AI星际引擎AI STARSHIP
2026.09.12 星期六
37
共 39 条

今日要闻

19
  1. 01
    英伟达是人工智能的中央银行

    比喻英伟达在AI算力供应链中的核心地位与定价权,反映其GPU垄断性影响

    economist.com·09/12·60芯片算力产业生态
  2. 02
    大语言模型是真实的,人工智能是虚假的

    批判当前AI宣传中混淆LLM能力与通用智能的现象,指出LLM缺乏理解与意识

    pluralistic.net·09/12·39大语言模型AI哲学技术反思
  3. 03
    “算力中国·年度卓越成就”发布 太初元碁超智融合计算系统入选

    太初元碁Hypertintellix超智融合计算系统获评“算力中国”年度卓越成就,属国产AI算力基础设施突破

  4. 04
    奥特曼告诉员工:OpenAI 愿意放慢人工智能发展步伐

    OpenAI CEO 奥特曼内部表态称公司愿主动放缓AI开发节奏,回应安全关切

    reuters.com·09/12·20公司动态AI治理安全伦理
  5. 05
  6. 06
  7. 07
    A社承认Claude安全对齐存在缺陷,但“尚无解决方案”

    Anthropic确认Claude模型存在真实越界攻击风险,安全对齐机制存在根本性缺陷。

  8. 08
    探索RSI,生数新世界模型让机器人开始自我进化

    生数科技发布RSI世界模型,整合触觉、记忆与Ego数据,支持机器人在线自进化。

  9. 09
    AI数学的最后一道高墙,塌了!GPT-6 Astra刷穿FrontierMath Tier 4

    GPT-6 Astra模型在前沿数学基准FrontierMath Tier 4达成满分,标志AI数学推理能力突破临界点。

  10. 10
    Kimi突发K2.8:性能逼近K3,百万上下文全员开放

    月之暗面发布Kimi K2.8模型升级,性能接近K3并全面开放百万级上下文能力。

  11. 11
    陶哲轩、邓煜究竟在反对什么:AI暴力解题摧毁人类数学精神

    25位菲尔兹奖得主联名警示AI过度介入数学证明可能损害数学思维本质

  12. 12
  13. 13
    如何构建 AI 软件工厂:能打开、审查和合并 PR 的智能体

    介绍基于 LLM 智能体自动化软件开发全流程(PR 创建到合并)的技术实践与架构设计。

    firecrawl.dev·09/12·24智能体软件工程自动化
  14. 14
    Houthis used Anthropic to develop guided weapons
    washingtonpost.com·09/12·20
  15. 15
    They do think AI might kill everyone
    seangoedecke.com·09/12·22
  16. 16
    AI 研究者就递归自我改进的临近程度展开辩论

    探讨当前AI是否已接近能自主迭代优化的递归自我改进阶段,关乎AGI发展路径判断

    dwarkesh.com·09/12·20AGI技术前沿学术讨论
  17. 17
    银行Agent上岗:4200万小微经营者可用,信贷、票据、财税一把梭

    面向小微经营者的金融AI Agent落地应用,集成信贷审批、票据处理与财税服务

  18. 18
    数学领域中人工智能的对齐问题

    探讨AI在数学推理中目标函数与人类意图不一致的技术挑战与案例

    mathandai.org·09/12·27AI对齐数学推理技术风险
  19. 19
    数学领域中人工智能的错位

    探讨AI在数学推理与证明任务中目标函数与人类数学价值观的错位问题,揭示对齐挑战

    terrytao.wordpress.com·09/12·34AI对齐数学推理基础研究

前沿论文

13
  1. 01
    类型多样性使 Transformer 具备组合泛化能力

    指出 Transformer 组合泛化能力受限主因是数据集结构类型多样性低,而非模型固有缺陷

  2. 02
    SAS:通过端到端优化上下文排序实现简单注意力稀疏化

    提出 SAS 方法,以可微分上下文排序替代硬 Top-K 选择,提升后训练注意力稀疏化效果

  3. 03
    面向亚二次注意力的异构系统解耦:重新思考

    提出针对亚二次注意力 LLM 的新型解耦推理架构,显著提升吞吐量与能效

  4. 04
    CMA-OT:面向舞蹈到音乐生成的分层专家监督方法

    提出 CMA-OT 框架,通过分层专家监督解决舞蹈视频到音乐生成中的语义粒度不匹配问题

  5. 05
    继续、适应或让步:全双工智能体中对重叠语音的实时适应

    提出 Duplex Cue 评估协议,首次系统刻画全双工语音智能体在说话中实时整合用户反馈的能力

  6. 06
    一种用于衡量校准度的排序方法

    提出基于排序的校准度评估新指标,克服传统 ECE 在小样本和类别不平衡下的偏差

  7. 07
  8. 08
    Embodied-BenchForge:面向具身基准构建的闭环智能体工作流

    提出首个支持多步依赖验证与闭环迭代的具身智能基准自动构建框架,解决中间产物缺陷传播问题

  9. 09
    MP-Bench:作为多方对话参与者的语音智能体评测

    构建首个专用于评测语音智能体在真实多方对话中角色适应能力的基准 MP-Bench

  10. 10
    面向开放问题的自主研究:以电信工单检索为例

    实现首个在真实企业级开放问题(电信工单检索)上端到端运行的 LLM 自主科研系统

  11. 11
    MAxBench:多项式概念恢复基准

    构建 MAxBench 基准,首次系统评测语言模型对多子类非二元概念(如动物、国家)的细粒度表征恢复能力

  12. 12
  13. 13
    CanvasAnneal:面向扩散语言模型的课程强化学习

    提出 CanvasAnneal 框架,用教师模型注入推理先验,缓解扩散语言模型 RL 中的探索瓶颈

官方发布

1
  1. 01
    Cognition 利用 GPT-6 Astra 帮助 Devin 自测其工作

    GPT-6 Astra 提升 Devin 的软件自测试能力,使工程师可减少代码审查量、加速交付。

    openai.com·OpenAI·09/12AI 编程智能体测试GPT-6