AI星际引擎AI STARSHIP
2026.09.24 星期四
49
主题 · 强化学习

强化学习

14
  1. 01
    特权反事实问题信用:面向多轮医疗对话的评估方法

    提出PCQC方法,通过反事实归因量化单个提问对诊断结果的贡献,提升医疗对话策略训练质量。

    arxiv.org·arXiv·17小时前医疗AI强化学习归因评估
  2. 02
    PACT:从信用分配到批评者对齐

    形式化定义LLM强化学习中token级信用分配的三大公理,为RLHF等算法提供统一数学基础。

    arxiv.org·arXiv·2天前强化学习LLM训练信用分配
  3. 03
    Critical-State RL:面向多轮工具调用的可训练状态诊断方法

    提出Critical-State RL方法,精准识别多轮交互中真正需优化的关键模型调用状态,避免奖励噪声干扰训练信号。

    arxiv.org·arXiv·2天前强化学习工具调用训练诊断
  4. 04
    DAPO:字节跳动Seed与清华大学AIR联合开源的强化学习系统

    字节跳动与清华联合发布开源强化学习框架DAPO,支持大规模分布式训练和算法快速迭代。

    github.com·Hacker News·3天前·20强化学习开源框架分布式训练
  5. 05
  6. 06
    CodeMidas:基于源代码本身规模化构建智能编码强化学习环境

    提出CodeMidas流水线,直接从现有代码库功能生成可执行RL环境,突破依赖issue/commit的局限,显著扩展编码智能体训练任务规模。

  7. 07
    λ-控制的GRPO:将流匹配比率不稳定性转化为预算化资源

    提出λ-GRPO方法稳定流匹配模型的强化学习训练,通过预算化重要性比率抑制多步去噪中的梯度发散。

    arxiv.org·arXiv·5天前强化学习生成模型算法优化
  8. 08
    得分中心化稳定离策略强化学习

    提出得分中心化技术缓解训练-推理不匹配导致的漂移问题,显著提升大模型RL训练稳定性。

  9. 09
    RetireOPD:面向智能体强化学习的自退休在线策略蒸馏

    提出阶段感知的自退休蒸馏机制,动态淘汰不可靠教师信号,提升多轮智能体RL训练效率与泛化性。

  10. 10
    罗福莉沉寂半年官宣小米强化学习!直播新模型训练过程,一小时烧3万美元

    小米AI负责人罗福莉公开强化学习新模型训练实况,披露高成本算力消耗与训练细节(如奖励曲线、显卡故障)。

    qbitai.com·量子位·09/17强化学习模型训练算力成本
  11. 11
    历史依赖日志下的离策略评估呈指数级难度

    证明即使日志覆盖所有隐藏状态,当记录器依赖历史时,离策略评估仍可能指数级不可靠。

    arxiv.org·arXiv·09/17强化学习离策略评估POMDP
  12. 12
    通过蒙特卡洛规划实现在线鲁棒强化学习

    提出鲁棒MCTS变体,显式建模仿真器与真实环境动力学差异,在低保真模拟失配下保障决策可靠性。

  13. 13
    贝尔曼策略优化

    提出无评判器的贝尔曼策略优化(BPO)方法,基于贝尔曼方程重构策略镜像下降,避免中间状态值估计,提升LLM强化学习效率。

    arxiv.org·arXiv·09/15强化学习LLM训练优化算法
  14. 14
    CanvasAnneal:面向扩散语言模型的课程强化学习

    提出 CanvasAnneal 框架,用教师模型注入推理先验,缓解扩散语言模型 RL 中的探索瓶颈