今日要闻
24 条- 01Stripe 构建了其内部 AI 平台
支付公司 Stripe 自研内部 AI 平台,支撑工程与产品智能化,属典型产业动态
- 02AI 原生应用是什么样
定义并举例说明AI原生(AI-native)产品范式,强调以模型能力为设计原点而非UI叠加
- 03
- 04联想亮相阿里云栖大会:联想天禧AI把超级组织落地到端侧
联想在阿里云栖大会发布天禧AI端侧全场景产品矩阵,推动AI超级组织能力下沉至终端设备。
- 05让Token生产更高效:异构混推的关键技术演进与创新实践
商汤大装置团队介绍异构混推技术在提升大模型推理效率方面的创新实践。
- 06汇智智能发布Hellome:国内首个FDE直连智能体服务平台,把AI交付周期压进“周”
发布国内首个面向FDE(功能驱动工程)的直连智能体服务平台,实现AI服务周级交付。
- 07
- 08它石智航顶尖团队引领中国具身智能率先迈入规模化落地阶段
它石智航推进具身智能机器人研发与量产,加速规模化商业落地
- 09斑马智能发布端模型AutoOmni2.0,让元神AI更懂“我的世界”
斑马智能在云栖大会发布全模态端侧大模型AutoOmni 2.0-23B-A3B,强化本地化多模态理解能力
- 10DeepSeek新论文公开Agent训练!梁文锋署名
DeepSeek发布新论文,公开智能体(Agent)训练方法,支持每秒生成5000+沙盒环境。
- 11Qwen一号位定了!刘大一恒接棒
通义实验室负责人变更,刘大一恒接任Qwen项目一号位,系与稚晖君同届的天才少年。
- 12Jev vs Decitron:同为决策AI,为什么不是一回事?
对比两类决策AI在复杂现实推演与决策能力上的本质差异。
- 13实时世界模型进入“全科生”阶段,PixVerse R2先交卷!
PixVerse发布R2模型,实现世界模型在实时性与通用性上的协同突破。
- 14稚晖君把机器人卖到2万元一台,可人可狗可开发!
稚晖君发布2万元级开源可编程机器人,支持人形/四足形态及开发者定制。
- 15阿里千问AI平台全面升级模型服务、Agent服务、AI应用
阿里千问AI平台升级MaaS、智能体(Agent)服务及行业AI解决方案能力。
- 16GPT-6 Astra搓3D刷屏后,3D生成的竞争规则变了
GPT-6 Astra推动3D内容生成技术突破,重塑行业竞争格局
- 17Claude Opus 5.5突袭!68万行代码一天迁完,API价格打8折
Anthropic发布Claude Opus 5.5,支持大规模代码迁移并大幅下调API缓存读取价格
- 18刷视频也能教会机器人干活!1200亿tokens人类动作预训练,误差按幂律下降
基于1200亿token互联网视频动作数据预训练机器人策略模型,泛化误差呈幂律收敛
- 19滴滴自动驾驶连获全国工商联及北京市荣誉榜单认可
滴滴自动驾驶入选2026年民营企业发展新质生产力案例及北京未来产业先锋榜。
- 20新CC:一款为家庭打造的AI智能体
Hacker News报道一款面向家庭场景的AI智能体产品,属AI产业动态。
- 21
- 22Unreal Agent
Hacker News用户讨论基于Unreal Engine构建的具身智能体(Agent)框架,支持3D环境感知与交互。
- 23Claude Opus 5.5 智能、性能与价格分析
分析 Anthropic 最新大模型 Claude Opus 5.5 的能力表现、基准测试结果及定价策略。
- 24Show HN:AI·rete·RAG——Rete 规则引擎做决策,RAG 提供解释
开源项目将经典 Rete 规则引擎与 RAG 结合,实现可解释的混合推理系统。
前沿论文
25 条- 01使用流匹配改进集成滤波器
提出FlowEF方法,利用条件流匹配将预报集合映射为分析集合,提升数据同化精度。
- 02SoLiD26:面向机器学习原子势的固-液界面第一性原理数据集
发布含1540万结构的固-液界面数据集SoLiD26,专用于训练和评估机器学习原子势模型。
- 03在检索与硬件约束下评估开源权重土耳其语大语言模型处理领域文档的能力
在资源受限本地部署场景下,用真实工业与公共部门长文档评测5个开源土耳其语LLM的问答性能。
- 04共享全局KV缓存与层特异性局部历史
提出混合KV缓存机制,在共享全局键值基础上保留层特异性局部历史,降低解码困惑度。
- 05
- 06从失败中学习:面向小语言模型工具调用智能体的异构图记忆
设计异构图记忆模块,使中小规模LLM工具智能体能识别并规避重复失败、状态误写等结构性错误。
- 07
- 08任务诱导的视觉Transformer特征空间黎曼度量
提出基于任务解码器雅可比矩阵的拉回度量,建模ViT特征空间的任务敏感几何结构。
- 09特权反事实问题信用:面向多轮医疗对话的评估方法
提出PCQC方法,通过反事实归因量化单个提问对诊断结果的贡献,提升医疗对话策略训练质量。
- 10一类低参数正交矩阵的黎曼结构与优化
研究块对角置换结构正交矩阵的流形性质,为高效深度学习结构提供几何优化理论基础。
- 11风险控制的KV缓存驱逐:从内存预算到风险目标
将KV驱逐重构为风险控制问题,以任务效用下降超阈值的请求发生率为部署风险指标。
- 12六层更少:面向Whisper模型的无标签恢复编码器剪枝
提出无需标注的编码器剪枝方法,成功将Whisper编码器压缩6层,保持语音识别精度。
- 13预训练模型在AI辅助教育新题型教学评估中的评测
评测Bloom分类器在AI生成教育题目上的泛化能力,揭示其在分布外数据上的性能衰减问题。
- 14更少语言,更多隐变量:面向驾驶任务的标注高效视觉-语言-动作模型
提出LADA三阶段流程,利用无标注观测数据生成隐动作标注,缓解VLA模型对语言指令的依赖。
- 15Flash-dLLM:面向IO感知的KV缓存与并行解码,实现快速、内存高效的扩散型大语言模型
提出Flash-dLLM框架,通过IO感知KV缓存和并行解码提升扩散型LLM推理效率与内存利用率。
- 16Agensh:将组织智能扩展至1024个智能体
提出无中心协调器的自组织多智能体框架Agensh,解决大规模智能体协同中的可扩展性瓶颈。
- 17SpeakerMem-R1:面向多方对话的以说话人为中心的双轨记忆机制
提出SpeakerMem-R1记忆架构,显式建模多方对话中说话人身份、关系及群体状态演化,提升长期记忆保真度。
- 18CliffCompaction:面向长周期编码智能体的成本高效上下文压缩方法
提出CliffCompaction自动压缩技术,在受限上下文窗口下降低50%成本,同时提升Terminal-Bench和KernelBench性能。
- 19SWE-Serve:面向生产级推理服务的智能体工程评测基准
发布SWE-Serve基准,首次系统评测智能体在模型支持、运行时执行、API集成等真实推理工程任务中的能力。
- 20
- 21壮大编排框架,而非扩大上下文:从无策略支架到可复用专家智能体
提出Growing Harness范式,将重复控制逻辑训练为可复用代码,使LLM专注语义推理,提升智能体长期任务效率。
- 22类型安全不等于无错误:约束型决策头遵循选项名称而非绑定其上的评分标准
揭示类型化决策模型虽保证输出格式合规,但可能误读选项语义;通过Jev系列模型实证选项命名方式影响决策正确性。
- 23EquivSVA:跨等价RTL实现的行为断言形式化验证数据集
构建EquivSVA数据集,用于评估LLM生成的SystemVerilog断言是否捕获外部可观测行为,而非依赖特定RTL实现细节。
- 24基于LLM的代码漏洞修复中指标失效问题:一项实证研究与变更感知筛选器
实证指出编译率不能可靠衡量C/C++漏洞修复效果,提出变更感知筛选器提升评估科学性。
- 25AI能否节省产品设计时间?一项关于AI提示到设计工作流的随机对照实验
首个针对产品设计领域的RCT实验,证实LLM驱动的prompt-to-design工作流显著缩短原型设计时间。
官方发布
11 条- 01Google DeepMind 发布 Gemini 3.8 文本转语音模型
Google DeepMind 推出 Gemini 3.8 新版 TTS 模型,显著提升语音自然度与多语种支持能力。
- 02
- 03invideo 如何借助 GPT-6 Astra 将色彩分级效率提升 3 倍
invideo 利用 GPT-6 Astra 实现更精准剪辑规划,色彩校正与分级效率提升三倍,并日产 50 种定制特效。
- 04Harvey 借助 GPT-6 Astra 将法律语境转化为更优文书草稿
Harvey 集成 GPT-6 Astra 后可生成结构更优、上下文感知更强的法律文书,释放律师战略思考时间。
- 05
- 06推出 MentalHealthBench
OpenAI 发布首个专家共建的心理健康对话评估基准,聚焦安全性和帮助性响应能力
- 07ChatGPT 广告业务扩展至东南亚和台湾地区
ChatGPT Ads 正式拓展至东南亚及台湾地区,覆盖超60国,面向符合条件的企业开放广告投放
- 08Airbnb 扩大对 GPT-6 Astra 和 OpenAI 前沿模型的访问
Airbnb 向内部工程团队开放 GPT-6 Astra 等前沿模型,用于调试、系统设计与加速交付。
- 09Grab 与 OpenAI 将实用 AI 技能带入东南亚
OpenAI 与 Grab 联合推出区域计划,为东南亚 3 万名合作伙伴提供实用 AI 技能培训。
- 10GPT-6 的提示词缓存优化
GPT-6 通过提升缓存命中率、新增诊断工具、显式断点和精细控制,降低延迟与调用成本。
- 11推出 GPT-6 Sol 和 Luna
OpenAI 官方发布两款新模型 GPT-6 Sol 与 Luna,分别侧重能力与成本平衡。