今日要闻
17 条- 01Needle:你的搜索引擎无法记忆的基准测试
提出新型搜索评估基准Needle-in-a-Haystack,专用于评测大模型长上下文检索能力。
- 02英伟达预计AI需求扩大推动销售额达6730亿美元
英伟达财报展望强调AI芯片需求激增是其营收增长核心驱动力,属关键产业动态。
- 03麻省理工学院人工智能在教学、学习与研究培训中应用的特设委员会
MIT成立跨学科委员会,系统评估AI在教育与科研中的应用规范与伦理框架。
- 04MiniMax年经常性收入暴涨500%,token价格暴涨2000%!这就是Agent红利吧
MiniMax因Agent技术商业化加速,ARR与代币价格大幅增长,反映智能体赛道商业价值爆发
- 05澳大利亚禁止生成式AI参与官方音乐排行榜
澳大利亚官方音乐榜单新规禁止AI生成内容上榜,属全球首例AI内容监管政策落地
- 06我的软件开发工作流已变成 AI,感觉疲惫而空洞
反思当前过度依赖AI工具导致开发者职业倦怠与意义感丧失的个人体验与行业现象
- 07基元律动累计融资数千万美元,推出“中国版OpenRouter”
AI基础设施公司基元律动完成数千万美元融资,并发布类OpenRouter的国产AI模型路由与编排平台
- 08工业Agent不是“套壳”大模型!西门子百年经验灌进工业AI
西门子Xcelerator平台将工业领域知识深度融入AI系统,实现工业场景中AI的持续演进与落地。
- 09人类关于人工智能意识的辩论方向错了
批判当前AI意识讨论陷入哲学误区,主张应聚焦可验证的行为与功能而非主观体验。
- 10让视频模型学得更好、更快
介绍提升视频生成模型训练效率与性能的新方法,含架构优化与数据策略。
- 11Laion 大视频数据集
Laion 发布面向视频生成与理解研究的开源大规模视频-文本对数据集,含千万级样本。
- 12CEO解雇开发者为AI腾出空间;开发者创建开源AI CEO
讽刺性事件:企业用AI替代开发者,后者反向开发开源AI CEO工具,反映人机角色冲突与开源对抗趋势。
- 13千问办公首发上线Qwen3.8-Flash,生成速度提升100%,Token消耗减少75%
千问官方发布轻量版Qwen3.8-Flash模型,显著提升生成速度并降低Token消耗,面向办公场景落地。
- 14通过 Accept 请求头向 AI 代理提供 Markdown
介绍如何利用 HTTP Accept 头让 AI 代理直接接收 Markdown 格式内容,提升解析效率。
- 15
- 16
- 17神秘「牛来」模型果然是智谱!GLM首个原生多模态,还用的国产卡
智谱发布GLM-5.3 Flash,首款原生多模态GLM模型,适配国产AI芯片
前沿论文
14 条- 01VBVR-Pro:面向原生视觉推理的可扩展、可验证测试套件
提出VBVR-Pro闭合测试平台,支持图像/视频作为第一类推理介质,解决训练任务稀缺与跨模态评估难题。
- 02一种面向多模态无监督持续后训练的视觉依赖感知框架
提出MU-CPT新任务及视觉依赖(VD)感知框架,通过建模token级VD缓解多模态大语言模型跨模态灾难性遗忘。
- 03面向小区边缘功率控制的智能体自主研究:彻底重构研究者角色
采用autoresearch协议,由AI编码智能体全自动迭代优化无线资源管理算法架构、损失函数与训练流程。
- 04PlanSightRAG:面向土木标准图纸的视觉优先多模态RAG框架
提出视觉优先的多模态RAG系统,直接对图纸图像索引与推理,实现自动化问答与合规性检查。
- 05在中微子基础模型中利用稀疏自编码器发现并使用可解释隐变量
首次将稀疏自编码器用于粒子物理基础模型,通过严格验证协议识别出方向重建任务中的物理概念表征图谱。
- 06行星预测引擎:基于智能数据选择与基础模型嵌入的自主地理空间预测系统
提出端到端自主AI系统PPE,自动完成地理空间数据检索、多模态融合、模型选择与预测,支撑全球挑战应对。
- 07TraceML:机器学习开发中人类与智能体规划行为的经验分析
提出TraceML数据集与方法,追踪并对比人与AI智能体在ML全流程开发中的规划行为差异,揭示能力瓶颈根源。
- 08ICON分解:面向深度表征的多变量概念级可审计解释方法
提出ICON分解法,量化各概念对神经元激活的独立贡献,避免传统概念解释中因相关性导致的误判。
- 09SwarmWorld:语言模型智能体社会中的迹式技术演化
构建去中心化LLM智能体社会SwarmWorld,通过环境媒介(stigmergy)实现技术积累与协同演化,超越独立搜索。
- 10承诺前门控:预判意图分歧以防止自动驾驶后交互决策失败
提出语言引导的意图模块与几何分歧评分门控机制,在规划提交前拦截错误决策,提升自动驾驶交互鲁棒性。
- 11前缀滑动:面向高效测试时缩放的方法
提出Prefix Sliding技术,动态丢弃低重要性中间推理token,显著降低长思考任务的显存与计算开销。
- 12面向移动端高效点卷积的大核CNN分组共享低秩近似方法
提出GS-LRA方法,通过分组共享低秩近似压缩大核CNN中被忽视的点卷积,提升边缘部署效率。
- 13为巴西班伊瓦语微调Whisper进行自动语音识别的初步研究
首次将Whisper适配至濒危原住民语言班伊瓦语,探索低资源语音识别技术路径与数据构建方法。
- 14R³:通过强化学习训练机器人在自然语言中进行推理
提出R³框架,用强化学习训练VLM在长程操作任务中进行自然语言推理,实现进度跟踪、关系推断与错误恢复。
官方发布
27 条- 01推出Anthropic科学人工智能计划
Anthropic启动专项AI for Science计划,聚焦可解释、可控的科研AI系统研发
- 02推进Claude在教育领域的应用
发布教育场景专属集成、学生项目扩展及高校合作更新
- 03Claude赋能生命科学
推出面向药物发现与临床研究的科学连接器、专业技能及性能优化
- 04
- 05
- 06科学家如何利用Claude加速科研与发现
展示Claude在真实科研流程中的实际应用案例与效率提升效果
- 07
- 08
- 09Anthropic与艾伦研究所、霍华德·休斯医学研究所合作加速科学发现
联合顶尖科研机构将Claude深度集成至生物医学研究流程,提升科学发现效率
- 10Anthropic与CodePath合作将Claude引入美国最大本科计算机科学项目
将Claude接入全美最大CS本科培养体系,推动AI工具进课堂与教学实践
- 11试点全球首个双盲AI评估
DeepMind启动世界首个双盲AI系统评估试点,消除评估者偏见,提升评测客观性。
- 12更优回答,更广思维:学生从 ChatGPT 与批判性思维训练中获得什么
超千名学生的随机对照实验证明,ChatGPT 结合批判性思维训练可提升原创性与真实大学作业表现
- 13OpenAI 扩大在巴西的业务布局
OpenAI 加强在巴西的开发者、企业及社区合作,推动当地 AI 应用落地。
- 14Anthropic 加入白宫 AI 教育承诺
Anthropic 签署白宫倡议,投入资源支持全美青少年及教育工作者的 AI 教育。
- 15使用政策更新
Anthropic 更新产品使用政策,以适配模型能力增强与用户场景演进。
- 16
- 17检测并抵御对 Claude 的恶意使用
Anthropic 发布对抗滥用的技术框架,涵盖越狱检测、提示注入识别与响应机制。
- 18理解与应对人工智能危害
Anthropic发布AI危害识别、分类与缓解的系统性框架,支撑负责任AI开发。
- 19
- 20AI系统红队测试中的挑战
分享Anthropic在AI红队实践中积累的实证经验,涵盖方法选择、收益与局限。
- 21安永、AWS与Anthropic合作
三方联合为企业构建可信赖的生成式AI解决方案,聚焦行业落地与合规集成。
- 22
- 23前沿模型安全
阐述Anthropic针对最先进AI模型设计的安全机制,包括训练前/中/后多阶段防护策略。
- 24Zoom合作及对Anthropic的投资
Zoom宣布投资Anthropic并集成Claude模型,增强会议实时摘要与智能协作能力。
- 25推出10万上下文窗口
Anthropic发布支持100K tokens上下文长度的新模型能力,显著提升长文档理解与推理性能。
- 26Anthropic与Google Cloud合作
Anthropic与Google Cloud深度集成,支持客户在Vertex AI平台直接调用Claude系列模型。
- 27借助Gemini 3.5 Transcribe实现智能语音转录
Gemini 3.5 Transcribe提供上下文感知、语义纠错的高准确率语音转文字服务。