AI星际引擎AI STARSHIP
2026.09.04 星期五
29
共 47 条

今日要闻

20
  1. 01
    美国企业正沉迷于开源人工智能

    报道美国企业加速采用Llama、Mistral等开源AI模型替代闭源方案,推动内部AI应用落地。

    nytimes.com·09/04·55开源模型企业应用产业动态
  2. 02
    Meta 新裁员目标:在将30%工程师转为数据标注员后,进一步将60%岗位交由AI承担

    Meta计划通过AI替代大量人力,已将部分工程师转岗为标注员,后续60%岗位拟由AI接管,反映AI对科技岗位结构的冲击。

    blog.pragmaticengineer.com·09/04·20产业动态就业影响大模型应用
  3. 03
    Google AI 模式显示相同商品价格比传统搜索高 21.6%

    研究发现 Google 的 AI 搜索模式存在系统性价格抬升现象,揭示其商业化推荐机制偏差。

    productrise.app·09/04·34AI 搜索算法偏见商业影响
  4. 04
  5. 05
    趋境科技与摩尔线程达成战略合作,高品质 AI Token 国产异构方案性价比超越国际先进算力

    国产GPU(摩尔线程)与AI推理优化厂商(趋境)合作推出高性价比AI Token生成异构方案

  6. 06
    机器人不能停下来等模型:星尘发布 SmoothRL,让在线强化学习跟上大模型的异步推理

    星尘智能发布SmoothRL框架,支持在线强化学习与大模型推理异步执行,提升机器人实时决策效率

  7. 07
    ScienceDiscovery实现树搜索驱动RSI,加速科学发现,小时级写出通用积分器,低成本找出物理科学规律

    提出无需训练与调参的树搜索驱动符号回归方法RSI,可快速构建物理规律积分器

  8. 08
    金融AI的年度大考交卷了:2万名选手、30+家机构、百亿级数据开源

    金融领域AI竞赛收官,5000支队伍参与,推动行业数据与模型开源

  9. 09
    李飞飞刚发Atlas,中国开源“同款”已抢跑半年?

    对比李飞飞团队新发布的具身智能平台Atlas,指出中国已有类似开源项目提前落地

  10. 10
    2026上半年智能眼镜竞争加剧,雷鸟创新五榜登顶实现全品类销量领先

    雷鸟创新AR眼镜在全球及中国市场出货量与销量均居首位,反映AI硬件商业化加速。

  11. 11
    千问办公上线首月用户数突破3000万,企业用户占比过半

    通义千问旗下AI办公产品上线首月获3000万用户,超半数为企业客户,体现大模型落地办公场景成效。

  12. 12
    卡车自动驾驶里程超10亿公里,嬴彻科技定义“货运物理AI”

    嬴彻科技宣布自动驾驶货运里程突破10亿公里,提出‘货运物理AI’概念,覆盖90%市场。

  13. 13
  14. 14
    在人工智能时代保护工程师的技能

    探讨AI工具普及下工程师核心能力(如系统思维、调试直觉)的不可替代性及培养路径

    spectrum.ieee.org·09/04·22职业发展工程实践AI影响
  15. 15
    新版GPT Image 2.5已经能伪造GPT-6发布会了

    GPT Image 2.5修复噪点问题,生成质量提升,可合成高逼真虚假发布会画面

  16. 16
    Qwen 3.8 27B 模型已在 Cerebras 平台上提供,推理速度达每秒 1500 词元

    通义千问最新大模型 Qwen 3.8 27B 上线 Cerebras 硬件平台,实测推理吞吐达 1500 tok/sec。

    inference-docs.cerebras.ai·09/04·105大模型推理加速硬件适配
  17. 17
    OpenAI 开始 rollout GPT-6 Astra

    OpenAI 官方启动 GPT-6(代号 Astra)的逐步发布,属下一代旗舰大模型重大进展。

    cnbc.com·09/04·96大模型产品发布OpenAI
  18. 18
  19. 19
    发布 HN:Mireye(YC S26)——面向物理世界 AI 智能体的基础设施

    YC 孵化项目 Mireye 推出专为具身智能体设计的硬件抽象与任务编排基础设施,支持机器人实时感知与行动闭环。

    news.ycombinator.com·09/04·20具身智能机器人基础设施
  20. 20

前沿论文

23
  1. 01
    面向协作式多智能体强化学习的在线变点检测

    提出PPR方法,利用历史奖励信号实时检测MARL环境中任务或环境的突变,支持快速自适应。

  2. 02
    RISE:通过自外推策略蒸馏实现递归改进

    提出RISE方法,从模型自身生成合成教师,突破传统策略蒸馏对高质量外部教师或上下文学习能力的依赖。

  3. 03
    超越聚合分数:面向基于参考的自动评测方法的行为正确性假设

    提出行为正确性假设框架,系统检验自动评测方法在受控条件下是否保持/破坏正确性判断逻辑。

  4. 04
    GUT:通过图复杂度量化与优化大语言模型的推理不确定性

    提出GUT方法,将LLM推理过程建模为分支图,用图复杂度度量并抑制不合理推理路径。

  5. 05
    测试大语言模型智能体团队中的可互换性

    实证检验生产级多智能体系统中角色内智能体是否真正可互换,揭示团队结构对性能迁移的关键影响。

  6. 06
    勿弃Dropout:面向高效大语言模型训练与推理的层稀疏性优化

    重新审视层dropout在LLM训练中的作用,提出优化方案以兼顾加速、精度与零样本剪枝鲁棒性。

  7. 07
    如何对智能体编码中的不确定性进行推测?一种草案模型门控方法

    提出SU方法,仅用黑盒LLM智能体输出token即可预测其执行失败风险,无需访问内部状态。

  8. 08
  9. 09
    通过训练编译:将自然语言规范转化为局部神经函数

    提出‘编译即训练’方法,用教师模型生成数据训练轻量适配器,将自然语言描述转为可本地部署的神经函数。

  10. 10
    工程清洁,测量不稳定:黑盒大语言模型裁判在共享端点上的预注册可靠性失效

    实证发现LLM裁判在相同模型端点上重复请求结果一致性极低(Spearman仅0.4),质疑其作为评估仪器的可靠性基础。

  11. 11
    ESPO:基于错误结构的提示优化——通过诊断、多样化与稳定化

    提出ESPO框架,三阶段解耦提示优化:诊断错误模式、生成多样化候选、稳定选择,解决进化式提示优化中的提示膨胀问题。

  12. 12
    可读性不等于可解释性:链式思维推理中被评判重要性与实际重要性的对比

    实验证明链式思维文本的表面可读性不反映其真实功能重要性,LLM裁判对步骤重要性的判断与实际影响显著脱钩。

  13. 13
    一位编辑,多种编辑:面向多样化视频编辑的统一免训练框架

    提出EditVid免训练框架,融合稀疏因果记忆、对应关系驱动的token注入和软潜在混合,统一支持指令与参考引导的高质量视频编辑。

  14. 14
    并发随机博弈的鲁棒PAC学习

    首次为带转移不确定性的广义和并发随机博弈构建PAC学习框架,通过鲁棒MDP探索机制求解社会福利最优ε-纳什均衡。

  15. 15
    先看见,再合成:视觉语言模型引导的弱监督密集视频字幕中转换事件发现

    提出SBS框架,利用VLM主动定位视频中事件转换点并生成视觉对齐的过渡字幕,替代固定位置的LLM合成字幕。

  16. 16
    预训练期间的知识获取?大语言模型借助辅助视图学得更好

    实验证明在token预算固定下,用辅助视图(如知识重述)替代文档重复,能更高效提升LLM预训练知识获取效果。

  17. 17
    一种计算可行的因果概率解释框架

    提出兼顾因果结构与可扩展性的新解释框架,避免穷举反事实,同时超越SHAP等忽略因果关系的方法。

  18. 18
    最后的翻译基准

    指出当前机器翻译基准已近饱和,自动指标易被操纵且不可操作,呼吁构建更具挑战性、可复现、面向失败分析的新基准。

  19. 19
    重新思考大语言模型的在线策略蒸馏II:单个训练样本

    发现仅用单条查询即可实现在线策略蒸馏,经数百步训练仍能恢复全量数据蒸馏的大部分性能,揭示数据效率新边界。

  20. 20
  21. 21
    Para-Pipe:在片上系统中挖掘ML计算图的分层算子并行性

    提出Para-Pipe方法,利用ML计算图内在算子并行性,在异构SoC上实现低延迟、高并发的深度学习推理加速。

  22. 22
    SWE-Gate:通过功能测试并不足以评估软件工程代理

    构建SWE-Gate基准,首次在仓库级评测中显式纳入代码审查约束,揭示当前编码代理忽视真实开发接受标准的问题。

  23. 23