今日要闻
19 条- 01Gemini 3.8 Flash 和 3.8 Flash Cyber
谷歌发布 Gemini 3.8 Flash 系列新模型,含面向网络安全场景优化的 Flash Cyber 版本。
- 02WebLLM:高性能浏览器内大语言模型推理引擎
开源项目WebLLM实现在浏览器中直接运行大语言模型,无需服务器,支持端侧AI推理。
- 03Mistral 默认启用用户输入训练,企业版除外
Mistral 调整默认策略,将用户输入数据用于模型训练,仅企业客户可选择禁用。
- 04大语言模型评审员验证存在性而非缺失性:AI 临床笔记中的遗漏盲区
研究发现LLM在评估临床笔记时难以识别关键信息的缺失,存在系统性遗漏盲区。
- 05Quasar 438B:欧洲领先的 AI 模型
介绍欧洲新发布的开源大模型Quasar 438B,参数量4380亿,强调其在多语言与推理能力上的进展。
- 06SkyProduction天工工作台:从剧本到成片,一套工作台把精品短剧创作真正跑起来
天工推出全新短剧创作工作台,集成剧本生成、分镜、配音、剪辑等AI驱动全流程工具
- 07还在为大模型洗数据熬夜?蚂蚁拿下VLDB工业最佳论文,一套宽表搞定35PB语料,效率狂飙5.6倍
蚂蚁集团发布统一宽表系统OmniTable,支撑大模型数据处理,获VLDB 2026工业赛道最佳论文。
- 08阿里更新旗舰模型Qwen3.8-Max,前端编程能力跃居全球第一
阿里巴巴发布Qwen3.8-Max新版本,其前端编程能力在权威基准测试中位列全球第一。
- 09前字节强化学习专家孙鹏博士加盟星尘智能,完善Physical AI全栈技术布局
前字节跳动强化学习专家孙鹏博士加入星尘智能,加强其具身智能(Physical AI)全栈技术研发能力。
- 10企业级Agent落地样板间!百融硅基员工批量上岗,按结果领工资
百融智能推出AI客服Agent,日均处理1.5万通电话,实现效果付费制落地应用
- 11Claude最强Fable 5.1发布!8项屠榜,最高降价45%,反蒸馏机制上线
Anthropic发布Claude Fable 5.1,多项基准领先,成本大幅下降,并引入防止模型被反向蒸馏的新防护机制。
- 12香港首个真实开放场景服务机器人落地兰桂坊
香港兰桂坊部署首台面向真实开放环境的服务机器人,承担酒保等交互任务,验证复杂城市场景落地能力。
- 13巨简单,更懂家!海信JUOS正式发布:行业首个家庭智能伴侣级AIOS
海信发布JUOS——首个定位家庭智能伴侣的操作系统,集成多模态感知、场景理解与主动服务能力。
- 14李飞飞发布:全球首个多模态世界模型
斯坦福教授李飞飞团队推出首个能从单张图像重建3D世界并生成机器人训练环境的多模态世界模型。
- 15AI 编程代理技能面向真实工程师
探讨当前AI编程代理在真实工程场景中的能力边界与实用技能要求。
- 16Show HN:Weedout——隐藏 YouTube 标注为 AI 的视频的 Safari 扩展
一款 Safari 浏览器扩展,可自动隐藏 YouTube 页面中标记为 AI 生成的视频,反映用户对 AI 内容标识的规避需求。
- 17一个文档页面即一条搜索查询,用于查找 AI 代理并将其路由至贵公司
提出将产品文档页转化为可被AI代理发现和调用的服务入口,推动AI原生交互范式
- 18埃德·齐特龙的 AI 怀疑论预测准确度如何?
回顾科技评论员Ed Zitron对AI发展的多项质疑性预测,评估其准确性与偏差。
- 19Atlas:一种面向空间智能的世界模型
提出Atlas世界模型,聚焦空间感知与环境建模,推动AI从语言理解向物理世界交互演进。
前沿论文
15 条- 01超越评分:理解大语言模型作为评判者的摘要评估机制
通过八类扰动实验,机械性解析LLM评判者在可读性与充分性维度上的打分内在机制。
- 02通过轨迹感知评估实现高效SWE智能体基准测试
提出PTA-IRT框架,利用智能体求解轨迹而非仅结果进行软件工程任务评估,提升效率与保真度。
- 03面向仓库级代码生成的自适应关键令牌感知检索
提出新RAG方法,在仓库级代码生成中显式识别并检索与任务强相关的关键上下文令牌。
- 04CordisBench:语言模型能否推理动态智能体运行时中的组件生命周期?
构建含1200题的基准CordisBench,评测LLM对动态插件依赖、状态传播与清理的生命周期推理能力。
- 05言语强化学习的兴起
提出言语强化学习(VRL)范式,统一定义自然语言反馈在智能体生命周期中生效时机与作用对象。
- 06Facet-0:面向接触密集型精密操作的机器人基础模型
发布机器人基础模型Facet-0,联合视觉-语言语义与力觉历史,预测动作接触后果以实现亚毫米装配。
- 07
- 08StudentSim:训练基于大语言模型的学生模拟器
提出StudentSim框架,融合状态追踪与LLM角色扮演,构建能匹配真实学生能力演化的高保真模拟器。
- 09为写作设计主动式思维伙伴
探索主动式AI写作助手的设计空间,支持个性化、高阶认知干预(如构思、结构化、反思),而不仅是文本补全。
- 10大语言模型量化损伤的结构:为何下一位精度应全局分配
通过因果混合精度干预实证发现,LLM量化误差主要源于全局层间耦合,新增精度应优先分配至全模型而非局部层。
- 11弥合文档视觉语言模型的成本-质量差距:难度感知数据策展与质量调整部署经济学
提出MoE-VLM(35B总参/3B激活)系统,结合难度感知数据策展与经济性部署策略,实现合规场景下低于人工成本的文档理解。
- 12从小型到大型大语言模型的近最优SFT-RL标注预算分配扩展
建立近最优框架,揭示SFT与RL标注预算的跨规模可迁移分配规律,避免单一最优比假设。
- 13从生产流量到后训练:构建覆盖企业请求混合分布的自托管大语言模型
通过生产错误分析驱动三轴质量对齐(指令遵循、函数调用、任务分布),将200+内部应用统一收敛至单个自托管LLM。
- 14基于熵的选择性智能体引导:从不完美VLM教师学习自主策略
提出SAGE框架,仅当学习者不确定性高时才查询昂贵VLM教师,实现低成本、鲁棒的自主策略学习。
- 15从困惑到清晰:面向文本分类的困惑感知检索与知识注入
针对细粒度标签分类难题,提出混淆感知检索与领域知识注入,提升LLM在相似标签间的判别能力。
官方发布
7 条- 01
- 02ATV Big Air Tour 借助 ChatGPT 将 3 天工作缩短至 3 小时
ATV赛事团队使用ChatGPT Work自动化营销与商品管理,15分钟生成商品库存网站。
- 03Google AI 发布的 2026 年 8 月最新 AI 动态
汇总 Google 在 2026 年 8 月发布的多项 AI 技术进展与产品更新。
- 04与客户共同开发企业级前沿安全防护措施
Anthropic联合企业客户推进前沿AI系统安全防护体系建设,聚焦可靠性、可解释性与可控性。
- 05通过Gemini实现智能体视频理解
DeepMind推出基于Gemini的智能体视频理解技术,支持多步推理与任务驱动的视频分析。
- 06AI 原生公司如何将工作流转化为运营能力
Basis、Clay 和 Exa Labs 利用 AI 智能体优化入职、客户管理与开发者集成,为企服提供可复用的AI落地范式。
- 07试用 Google Pics:在 Google Workspace 中轻松进行图像生成与编辑
基于最新 Nano Banana 模型的图像生成与编辑工具 Google Pics 正式上线 Workspace。