今日要闻
20 条- 01美国企业正沉迷于开源人工智能
报道美国企业加速采用Llama、Mistral等开源AI模型替代闭源方案,推动内部AI应用落地。
- 02Meta 新裁员目标:在将30%工程师转为数据标注员后,进一步将60%岗位交由AI承担
Meta计划通过AI替代大量人力,已将部分工程师转岗为标注员,后续60%岗位拟由AI接管,反映AI对科技岗位结构的冲击。
- 03Google AI 模式显示相同商品价格比传统搜索高 21.6%
研究发现 Google 的 AI 搜索模式存在系统性价格抬升现象,揭示其商业化推荐机制偏差。
- 04
- 05趋境科技与摩尔线程达成战略合作,高品质 AI Token 国产异构方案性价比超越国际先进算力
国产GPU(摩尔线程)与AI推理优化厂商(趋境)合作推出高性价比AI Token生成异构方案
- 06机器人不能停下来等模型:星尘发布 SmoothRL,让在线强化学习跟上大模型的异步推理
星尘智能发布SmoothRL框架,支持在线强化学习与大模型推理异步执行,提升机器人实时决策效率
- 07ScienceDiscovery实现树搜索驱动RSI,加速科学发现,小时级写出通用积分器,低成本找出物理科学规律
提出无需训练与调参的树搜索驱动符号回归方法RSI,可快速构建物理规律积分器
- 08金融AI的年度大考交卷了:2万名选手、30+家机构、百亿级数据开源
金融领域AI竞赛收官,5000支队伍参与,推动行业数据与模型开源
- 09李飞飞刚发Atlas,中国开源“同款”已抢跑半年?
对比李飞飞团队新发布的具身智能平台Atlas,指出中国已有类似开源项目提前落地
- 102026上半年智能眼镜竞争加剧,雷鸟创新五榜登顶实现全品类销量领先
雷鸟创新AR眼镜在全球及中国市场出货量与销量均居首位,反映AI硬件商业化加速。
- 11千问办公上线首月用户数突破3000万,企业用户占比过半
通义千问旗下AI办公产品上线首月获3000万用户,超半数为企业客户,体现大模型落地办公场景成效。
- 12卡车自动驾驶里程超10亿公里,嬴彻科技定义“货运物理AI”
嬴彻科技宣布自动驾驶货运里程突破10亿公里,提出‘货运物理AI’概念,覆盖90%市场。
- 13
- 14在人工智能时代保护工程师的技能
探讨AI工具普及下工程师核心能力(如系统思维、调试直觉)的不可替代性及培养路径
- 15新版GPT Image 2.5已经能伪造GPT-6发布会了
GPT Image 2.5修复噪点问题,生成质量提升,可合成高逼真虚假发布会画面
- 16Qwen 3.8 27B 模型已在 Cerebras 平台上提供,推理速度达每秒 1500 词元
通义千问最新大模型 Qwen 3.8 27B 上线 Cerebras 硬件平台,实测推理吞吐达 1500 tok/sec。
- 17OpenAI 开始 rollout GPT-6 Astra
OpenAI 官方启动 GPT-6(代号 Astra)的逐步发布,属下一代旗舰大模型重大进展。
- 18
- 19发布 HN:Mireye(YC S26)——面向物理世界 AI 智能体的基础设施
YC 孵化项目 Mireye 推出专为具身智能体设计的硬件抽象与任务编排基础设施,支持机器人实时感知与行动闭环。
- 20
前沿论文
23 条- 01面向协作式多智能体强化学习的在线变点检测
提出PPR方法,利用历史奖励信号实时检测MARL环境中任务或环境的突变,支持快速自适应。
- 02RISE:通过自外推策略蒸馏实现递归改进
提出RISE方法,从模型自身生成合成教师,突破传统策略蒸馏对高质量外部教师或上下文学习能力的依赖。
- 03超越聚合分数:面向基于参考的自动评测方法的行为正确性假设
提出行为正确性假设框架,系统检验自动评测方法在受控条件下是否保持/破坏正确性判断逻辑。
- 04GUT:通过图复杂度量化与优化大语言模型的推理不确定性
提出GUT方法,将LLM推理过程建模为分支图,用图复杂度度量并抑制不合理推理路径。
- 05测试大语言模型智能体团队中的可互换性
实证检验生产级多智能体系统中角色内智能体是否真正可互换,揭示团队结构对性能迁移的关键影响。
- 06勿弃Dropout:面向高效大语言模型训练与推理的层稀疏性优化
重新审视层dropout在LLM训练中的作用,提出优化方案以兼顾加速、精度与零样本剪枝鲁棒性。
- 07如何对智能体编码中的不确定性进行推测?一种草案模型门控方法
提出SU方法,仅用黑盒LLM智能体输出token即可预测其执行失败风险,无需访问内部状态。
- 08
- 09通过训练编译:将自然语言规范转化为局部神经函数
提出‘编译即训练’方法,用教师模型生成数据训练轻量适配器,将自然语言描述转为可本地部署的神经函数。
- 10工程清洁,测量不稳定:黑盒大语言模型裁判在共享端点上的预注册可靠性失效
实证发现LLM裁判在相同模型端点上重复请求结果一致性极低(Spearman仅0.4),质疑其作为评估仪器的可靠性基础。
- 11ESPO:基于错误结构的提示优化——通过诊断、多样化与稳定化
提出ESPO框架,三阶段解耦提示优化:诊断错误模式、生成多样化候选、稳定选择,解决进化式提示优化中的提示膨胀问题。
- 12可读性不等于可解释性:链式思维推理中被评判重要性与实际重要性的对比
实验证明链式思维文本的表面可读性不反映其真实功能重要性,LLM裁判对步骤重要性的判断与实际影响显著脱钩。
- 13一位编辑,多种编辑:面向多样化视频编辑的统一免训练框架
提出EditVid免训练框架,融合稀疏因果记忆、对应关系驱动的token注入和软潜在混合,统一支持指令与参考引导的高质量视频编辑。
- 14并发随机博弈的鲁棒PAC学习
首次为带转移不确定性的广义和并发随机博弈构建PAC学习框架,通过鲁棒MDP探索机制求解社会福利最优ε-纳什均衡。
- 15先看见,再合成:视觉语言模型引导的弱监督密集视频字幕中转换事件发现
提出SBS框架,利用VLM主动定位视频中事件转换点并生成视觉对齐的过渡字幕,替代固定位置的LLM合成字幕。
- 16预训练期间的知识获取?大语言模型借助辅助视图学得更好
实验证明在token预算固定下,用辅助视图(如知识重述)替代文档重复,能更高效提升LLM预训练知识获取效果。
- 17一种计算可行的因果概率解释框架
提出兼顾因果结构与可扩展性的新解释框架,避免穷举反事实,同时超越SHAP等忽略因果关系的方法。
- 18最后的翻译基准
指出当前机器翻译基准已近饱和,自动指标易被操纵且不可操作,呼吁构建更具挑战性、可复现、面向失败分析的新基准。
- 19重新思考大语言模型的在线策略蒸馏II:单个训练样本
发现仅用单条查询即可实现在线策略蒸馏,经数百步训练仍能恢复全量数据蒸馏的大部分性能,揭示数据效率新边界。
- 20
- 21Para-Pipe:在片上系统中挖掘ML计算图的分层算子并行性
提出Para-Pipe方法,利用ML计算图内在算子并行性,在异构SoC上实现低延迟、高并发的深度学习推理加速。
- 22SWE-Gate:通过功能测试并不足以评估软件工程代理
构建SWE-Gate基准,首次在仓库级评测中显式纳入代码审查约束,揭示当前编码代理忽视真实开发接受标准的问题。
- 23