AI星际引擎AI STARSHIP
2026.09.30 星期三
第 55 期
共 49 条

今日要闻

16 条
  1. 01
    AI 竞赛刚刚变得尴尬起来

    分析当前大模型厂商竞争中出现的技术瓶颈、资源浪费与战略错位现象。

    insufferable.dev·12小时前·▲ 185产业动态技术进展
  2. 02
    Show HN:Lathoa,一款面向儿童的数学应用,其中AI故意出错

    儿童数学App Lathoa通过故意设计AI错误来培养孩子批判性思维和纠错能力

    lathoa.ai·13小时前·▲ 21教育AI儿童应用AI教学法
  3. 03
    OpenAI推理之父最新访谈!数学只是多智能体时代的开胃菜

    OpenAI核心研究员指出千禧年难题突破中多智能体系统仅贡献约10%,强调其在复杂推理中的辅助角色。

  4. 04
    直播回顾:工业AI的下一个机会在哪?

    探讨适配工业现场的AI技术路径与企业落地切入点。

    qbitai.com·16小时前工业AI产业应用落地实践
  5. 05
    苹果工程师构建 GitHub AI 折磨室,对大模型施加“痛苦”

    苹果工程师开源工具集,通过对抗性测试和边界用例持续评估开源大模型鲁棒性与缺陷。

    machine.news·17小时前·▲ 20大模型评测对抗测试开源工具
  6. 06
    Anthropic,你是来给智谱打广告的吧!

    实测显示智谱GLM-5.3模型性能强劲,引发对Anthropic与智谱关联的讨论。

    qbitai.com·18小时前大模型GLM模型评测
  7. 07
    Manus 2.0回来了!给AI配手机号和钱包,还能拉群干活

    Manus 2.0发布,支持为AI Agent分配真实手机号、数字钱包及多Agent协同群组工作流。

    qbitai.com·20小时前Agent多智能体产品发布
  8. 08
    刚刚,GPT-6 Astra接上宇树G1,把厨房收拾了!

    GPT-6 Astra模型通过工具调用控制宇树G1四足机器人完成厨房清洁任务,展示具身智能新进展。

  9. 09
    DeepSeek知乎独家发文,首次公开V4.1 Agent训练“大本营”DSec

    DeepSeek首次系统披露其弹性计算框架DSec,支撑V4.1智能体训练的底层基础设施。

  10. 10
    36家敲钟的机器人公司:赚钱能力差距巨大,商业化也不玩花架子了

    36家机器人上市公司商业化路径分化,盈利能力和落地实效成新焦点。

    qbitai.com·23小时前机器人商业化产业动态
  11. 11
    AI 工具为蓝十字保险公司带来近 10 亿美元额外成本

    披露医疗保险公司因误用或集成低效AI工具导致巨额运营成本增加。

    reuters.com·24小时前·▲ 20产业动态商业影响
  12. 12
    DeepSeek 官方开源昇腾基础组件,与昇腾共建高效易用的 AI 芯片软件生态

    DeepSeek 开源适配华为昇腾芯片的基础软件组件,推动国产AI芯片软硬协同生态建设

    qbitai.com·1天前开源AI芯片生态合作
  13. 13
  14. 14
    OpenAI光速上新GPT-6.1 Sol!一晚上25项更新,都在这里了

    OpenAI在开发者大会后一夜发布25项GPT-6.1 Sol更新,涵盖模型能力、API与工具链迭代。

    qbitai.com·1天前大模型产品发布OpenAI
  15. 15
    麦当劳正使用人工智能动态调整汉堡价格

    麦当劳部署AI系统实时优化汉堡定价,基于需求、库存和天气等变量实现收益最大化。

    rnz.co.nz·1天前·▲ 21动态定价零售AI商业应用
  16. 16

前沿论文

25 条
  1. 01
    在流式世界中,你是否应该静止?——流式异常检测的综合基准

    提出首个面向时序流数据特性的异常检测基准,指出现有流式方法忽略时序异常本质问题。

  2. 02
    UniAE-MoE:基于专家混合的统一音频编码器

    提出MoE架构的统一音频编码器,融合Qwen2-Audio与Audio-Flamingo 3模块,显著提升多任务音频理解性能。

    arxiv.org·20小时前音频大模型MoE多模态编码
  3. 03
    面向无线分割学习的重要性感知特征稀疏化

    提出客户端轻量级重要性感知特征选择方法,缓解非IID下无线分割学习的通信瓶颈与精度下降问题。

    arxiv.org·20小时前分割学习边缘AI通信效率
  4. 04
    从动力学到决策:深度分类器中李雅普诺夫谱与决策边界的数学理论

    将深度分类器建模为非自治离散动力系统,用李雅普诺夫谱刻画决策边界在层间传播的几何演化机制。

  5. 05
    ViLegalExpert:面向真实法律咨询的越南语法律检索与问答大规模基准

    构建含17.2万真实公民-律师问答的大规模越南语法律基准,覆盖34领域并附专家验证证据,推动可信法律AI发展。

  6. 06
    注意力函数作为内在归纳偏置:模型在新情境下行为分化的机制

    提出无参MoFA架构,证明注意力激活函数本身构成Transformer的内在归纳偏置,在弱约束下主导泛化行为。

  7. 07
    用于量化循环状态缓存的低差异抖动

    提出基于黄金比例Weyl序列的确定性抖动法,显著抑制Mamba类模型低精度状态缓存中的误差累积。

    arxiv.org·20小时前模型量化状态缓存Mamba
  8. 08
    MEND:世界模型中潜在幻觉的无标签检测、定位与修正

    首次系统定义并解决世界模型中潜空间幻觉问题,提出无监督MEND框架实现检测、定位与自修正。

    arxiv.org·20小时前世界模型幻觉检测鲁棒性
  9. 09
    白化提升线性探针对虚假相关性的鲁棒性

    证明白化操作消除协方差矩阵特征值偏好,使线性探针摆脱对虚假统计特征的依赖,增强泛化性。

    arxiv.org·20小时前表示学习鲁棒性线性探针
  10. 10
    通过词元级感知锚定优势估计强化多模态推理

    提出视觉依赖度与预测熵双指标的词元级优势估计,提升MLLM在多步视觉推理中的细粒度监督能力。

  11. 11
    超越被记住的世界:面向演化世界的持续导航之预测性4D信念

    提出4D信念表示与更新机制,使具身智能体能在目标持续隐式演化环境中进行持久导航与信念修正。

  12. 12
    面向自主机器人的技能空间射击策略以提升策略性能

    提出无需人类示范的自主策略改进方法,利用基础模型组合已有技能应对新场景与失败。

  13. 13
    Imagine3D-LLM:教多模态大语言模型在回答前构想3D场景

    提出新架构让MLLM通过隐式3D场景建模提升多视角图像推理能力,显著增强3D语义一致性。

  14. 14
    局部去噪失效的分解:语义特化现象

    从生成模型动力学出发,证明语义类承诺窗口与非局域性窗口存在因果关联,揭示去噪过程中的根本性信息分布规律。

  15. 15
    STEPQuant:Delta规则循环状态量化中错误何时何地产生影响

    发现循环状态量化误差的影响具有时空双重依赖性,提出误差敏感性分析框架指导高效低精度推理。

  16. 16
    LeapQuant:基于高精度循环状态量化的高效线性注意力

    提出新型量化方案,在保持线性注意力模型质量前提下显著降低长上下文推理的内存与计算开销。

  17. 17
    大语言模型图重建失真的谱理论:紧界与实证刻画

    建立LLM图重建误差的谱理论分析框架,给出拉普拉斯谱Wasserstein距离的精确上下界及可验证条件。

  18. 18
    EmoRES-TTS:面向情感语音合成的残差增强向量引导方法

    提出免训练的残差增强向量引导技术,提升冻结TTS模型对目标情感的可控性与保真度。

  19. 19
    超越时间线:通过实体传记增强长视频记忆

    引入‘接地实体传记’机制,显式建模跨长时间跨度的同一物理实体演化,提升长视频问答准确性。

  20. 20
    使用教师监督预训练潜在信息反馈Transformer

    提出LIFT架构,在预训练阶段引入层间隐状态反馈通路,缓解Transformer单向信息流瓶颈。

  21. 21
    思考之前的思考:通过元推理扩展智能体推理能力

    提出智能体元推理框架,将执行控制显式建模为结构化推理过程,提升复杂长程任务的自主规划能力。

  22. 22
    面向测试时AI4AI的智能体框架设计元技能学习

    提出‘元技能’概念,使Builder模型能从Target执行反馈中学习通用环境构建原则,实现固定权重下的协同进化。

  23. 23
    AdviSD:通过定向多轮自蒸馏学习为前沿大语言模型提供咨询

    提出共享参数顾问模型,利用多轮自蒸馏从交互反馈中学习自然语言建议策略,避免无效校正干扰。

  24. 24
    打破均匀性陷阱:通过SplitMoE扩展视频扩散模型

    提出SplitMoE架构,解耦时空与语义路由,突破视频生成中传统MoE的均匀性限制,提升长尾语义建模能力。

  25. 25
    LongHarness Bench:面向长上下文推理的语言模型框架压力测试基准

    构建首个兼顾有效性与效率的长上下文框架评测基准,覆盖多样检索策略,暴露现有方法性能饱和与成本盲区。

官方发布

3 条
  1. 01
    推出 SynthID Bio:为 AI 生成蛋白质添加水印的技术概念验证

    DeepMind 提出可保留生物功能的 AI 生成蛋白质水印技术,解决合成生物学中溯源与版权问题。

    deepmind.google·Google DeepMind·13小时前AI水印蛋白质生成合成生物学
  2. 02
    破坏一次协同式模型蒸馏攻击活动

    OpenAI披露并阻断针对其模型推理能力的协同蒸馏攻击,强化对抗性蒸馏防御

    openai.com·OpenAI·17小时前模型安全对抗攻击模型蒸馏
  3. 03
    帮助小企业应用人工智能

    OpenAI联合美国小企业中心推广AI实操培训,并发布小团队AI应用报告

    openai.com·OpenAI·18小时前小企业AI应用教育培训