AI星际引擎AI STARSHIP
2026.09.02 星期三
27
共 48 条

今日要闻

19
  1. 01
    Gemini 3.8 Flash 和 3.8 Flash Cyber

    谷歌发布 Gemini 3.8 Flash 系列新模型,含面向网络安全场景优化的 Flash Cyber 版本。

    blog.google·09/02·48大模型谷歌网络安全
  2. 02
    WebLLM:高性能浏览器内大语言模型推理引擎

    开源项目WebLLM实现在浏览器中直接运行大语言模型,无需服务器,支持端侧AI推理。

    github.com·09/02·24开源端侧AI大模型推理
  3. 03
    Mistral 默认启用用户输入训练,企业版除外

    Mistral 调整默认策略,将用户输入数据用于模型训练,仅企业客户可选择禁用。

    help.mistral.ai·09/02·28模型训练数据政策厂商动态
  4. 04
    大语言模型评审员验证存在性而非缺失性:AI 临床笔记中的遗漏盲区

    研究发现LLM在评估临床笔记时难以识别关键信息的缺失,存在系统性遗漏盲区。

    arxiv.org·09/02·20大语言模型医疗AI评估偏差
  5. 05
    Quasar 438B:欧洲领先的 AI 模型

    介绍欧洲新发布的开源大模型Quasar 438B,参数量4380亿,强调其在多语言与推理能力上的进展。

    multiversecomputing.com·09/02·25大模型开源欧洲AI
  6. 06
    SkyProduction天工工作台:从剧本到成片,一套工作台把精品短剧创作真正跑起来

    天工推出全新短剧创作工作台,集成剧本生成、分镜、配音、剪辑等AI驱动全流程工具

  7. 07
    还在为大模型洗数据熬夜?蚂蚁拿下VLDB工业最佳论文,一套宽表搞定35PB语料,效率狂飙5.6倍

    蚂蚁集团发布统一宽表系统OmniTable,支撑大模型数据处理,获VLDB 2026工业赛道最佳论文。

  8. 08
    阿里更新旗舰模型Qwen3.8-Max,前端编程能力跃居全球第一

    阿里巴巴发布Qwen3.8-Max新版本,其前端编程能力在权威基准测试中位列全球第一。

  9. 09
    前字节强化学习专家孙鹏博士加盟星尘智能,完善Physical AI全栈技术布局

    前字节跳动强化学习专家孙鹏博士加入星尘智能,加强其具身智能(Physical AI)全栈技术研发能力。

  10. 10
    企业级Agent落地样板间!百融硅基员工批量上岗,按结果领工资

    百融智能推出AI客服Agent,日均处理1.5万通电话,实现效果付费制落地应用

  11. 11
    Claude最强Fable 5.1发布!8项屠榜,最高降价45%,反蒸馏机制上线

    Anthropic发布Claude Fable 5.1,多项基准领先,成本大幅下降,并引入防止模型被反向蒸馏的新防护机制。

  12. 12
    香港首个真实开放场景服务机器人落地兰桂坊

    香港兰桂坊部署首台面向真实开放环境的服务机器人,承担酒保等交互任务,验证复杂城市场景落地能力。

  13. 13
    巨简单,更懂家!海信JUOS正式发布:行业首个家庭智能伴侣级AIOS

    海信发布JUOS——首个定位家庭智能伴侣的操作系统,集成多模态感知、场景理解与主动服务能力。

    qbitai.com·09/02AIOS家庭AI操作系统
  14. 14
    李飞飞发布:全球首个多模态世界模型

    斯坦福教授李飞飞团队推出首个能从单张图像重建3D世界并生成机器人训练环境的多模态世界模型。

  15. 15
    AI 编程代理技能面向真实工程师

    探讨当前AI编程代理在真实工程场景中的能力边界与实用技能要求。

    github.com·09/02·20编程代理工程实践AI应用
  16. 16
    Show HN:Weedout——隐藏 YouTube 标注为 AI 的视频的 Safari 扩展

    一款 Safari 浏览器扩展,可自动隐藏 YouTube 页面中标记为 AI 生成的视频,反映用户对 AI 内容标识的规避需求。

    masteranza.github.io·09/02·24浏览器扩展AI内容标识用户体验
  17. 17
    一个文档页面即一条搜索查询,用于查找 AI 代理并将其路由至贵公司

    提出将产品文档页转化为可被AI代理发现和调用的服务入口,推动AI原生交互范式

    blog.val.town·09/02·20AI代理开发者工具AI原生应用
  18. 18
    埃德·齐特龙的 AI 怀疑论预测准确度如何?

    回顾科技评论员Ed Zitron对AI发展的多项质疑性预测,评估其准确性与偏差。

    danluu.com·09/02·64AI评论预测分析技术舆论
  19. 19
    Atlas:一种面向空间智能的世界模型

    提出Atlas世界模型,聚焦空间感知与环境建模,推动AI从语言理解向物理世界交互演进。

    worldlabs.ai·09/02·36世界模型空间智能具身AI

前沿论文

15
  1. 01
    超越评分:理解大语言模型作为评判者的摘要评估机制

    通过八类扰动实验,机械性解析LLM评判者在可读性与充分性维度上的打分内在机制。

  2. 02
    通过轨迹感知评估实现高效SWE智能体基准测试

    提出PTA-IRT框架,利用智能体求解轨迹而非仅结果进行软件工程任务评估,提升效率与保真度。

  3. 03
    面向仓库级代码生成的自适应关键令牌感知检索

    提出新RAG方法,在仓库级代码生成中显式识别并检索与任务强相关的关键上下文令牌。

  4. 04
    CordisBench:语言模型能否推理动态智能体运行时中的组件生命周期?

    构建含1200题的基准CordisBench,评测LLM对动态插件依赖、状态传播与清理的生命周期推理能力。

  5. 05
    言语强化学习的兴起

    提出言语强化学习(VRL)范式,统一定义自然语言反馈在智能体生命周期中生效时机与作用对象。

  6. 06
    Facet-0:面向接触密集型精密操作的机器人基础模型

    发布机器人基础模型Facet-0,联合视觉-语言语义与力觉历史,预测动作接触后果以实现亚毫米装配。

  7. 07
  8. 08
    StudentSim:训练基于大语言模型的学生模拟器

    提出StudentSim框架,融合状态追踪与LLM角色扮演,构建能匹配真实学生能力演化的高保真模拟器。

  9. 09
    为写作设计主动式思维伙伴

    探索主动式AI写作助手的设计空间,支持个性化、高阶认知干预(如构思、结构化、反思),而不仅是文本补全。

  10. 10
    大语言模型量化损伤的结构:为何下一位精度应全局分配

    通过因果混合精度干预实证发现,LLM量化误差主要源于全局层间耦合,新增精度应优先分配至全模型而非局部层。

  11. 11
    弥合文档视觉语言模型的成本-质量差距:难度感知数据策展与质量调整部署经济学

    提出MoE-VLM(35B总参/3B激活)系统,结合难度感知数据策展与经济性部署策略,实现合规场景下低于人工成本的文档理解。

  12. 12
    从小型到大型大语言模型的近最优SFT-RL标注预算分配扩展

    建立近最优框架,揭示SFT与RL标注预算的跨规模可迁移分配规律,避免单一最优比假设。

  13. 13
    从生产流量到后训练:构建覆盖企业请求混合分布的自托管大语言模型

    通过生产错误分析驱动三轴质量对齐(指令遵循、函数调用、任务分布),将200+内部应用统一收敛至单个自托管LLM。

  14. 14
    基于熵的选择性智能体引导:从不完美VLM教师学习自主策略

    提出SAGE框架,仅当学习者不确定性高时才查询昂贵VLM教师,实现低成本、鲁棒的自主策略学习。

  15. 15
    从困惑到清晰:面向文本分类的困惑感知检索与知识注入

    针对细粒度标签分类难题,提出混淆感知检索与领域知识注入,提升LLM在相似标签间的判别能力。

官方发布

7
  1. 01
  2. 02
    ATV Big Air Tour 借助 ChatGPT 将 3 天工作缩短至 3 小时

    ATV赛事团队使用ChatGPT Work自动化营销与商品管理,15分钟生成商品库存网站。

    openai.com·OpenAI·09/02产品应用工作效率ChatGPT
  3. 03
    Google AI 发布的 2026 年 8 月最新 AI 动态

    汇总 Google 在 2026 年 8 月发布的多项 AI 技术进展与产品更新。

    blog.google·Google AI·09/02技术进展产品发布产业动态
  4. 04
    与客户共同开发企业级前沿安全防护措施

    Anthropic联合企业客户推进前沿AI系统安全防护体系建设,聚焦可靠性、可解释性与可控性。

    anthropic.com·Anthropic·09/02AI安全企业应用前沿模型
  5. 05
    通过Gemini实现智能体视频理解

    DeepMind推出基于Gemini的智能体视频理解技术,支持多步推理与任务驱动的视频分析。

    deepmind.google·Google DeepMind·09/02多模态智能体视频理解
  6. 06
    AI 原生公司如何将工作流转化为运营能力

    Basis、Clay 和 Exa Labs 利用 AI 智能体优化入职、客户管理与开发者集成,为企服提供可复用的AI落地范式。

  7. 07
    试用 Google Pics:在 Google Workspace 中轻松进行图像生成与编辑

    基于最新 Nano Banana 模型的图像生成与编辑工具 Google Pics 正式上线 Workspace。

    blog.google·Google AI·09/02图像生成多模态模型办公集成