强化学习
14 条- 01特权反事实问题信用:面向多轮医疗对话的评估方法
提出PCQC方法,通过反事实归因量化单个提问对诊断结果的贡献,提升医疗对话策略训练质量。
- 02PACT:从信用分配到批评者对齐
形式化定义LLM强化学习中token级信用分配的三大公理,为RLHF等算法提供统一数学基础。
- 03Critical-State RL:面向多轮工具调用的可训练状态诊断方法
提出Critical-State RL方法,精准识别多轮交互中真正需优化的关键模型调用状态,避免奖励噪声干扰训练信号。
- 04DAPO:字节跳动Seed与清华大学AIR联合开源的强化学习系统
字节跳动与清华联合发布开源强化学习框架DAPO,支持大规模分布式训练和算法快速迭代。
- 05
- 06CodeMidas:基于源代码本身规模化构建智能编码强化学习环境
提出CodeMidas流水线,直接从现有代码库功能生成可执行RL环境,突破依赖issue/commit的局限,显著扩展编码智能体训练任务规模。
- 07λ-控制的GRPO:将流匹配比率不稳定性转化为预算化资源
提出λ-GRPO方法稳定流匹配模型的强化学习训练,通过预算化重要性比率抑制多步去噪中的梯度发散。
- 08得分中心化稳定离策略强化学习
提出得分中心化技术缓解训练-推理不匹配导致的漂移问题,显著提升大模型RL训练稳定性。
- 09RetireOPD:面向智能体强化学习的自退休在线策略蒸馏
提出阶段感知的自退休蒸馏机制,动态淘汰不可靠教师信号,提升多轮智能体RL训练效率与泛化性。
- 10罗福莉沉寂半年官宣小米强化学习!直播新模型训练过程,一小时烧3万美元
小米AI负责人罗福莉公开强化学习新模型训练实况,披露高成本算力消耗与训练细节(如奖励曲线、显卡故障)。
- 11历史依赖日志下的离策略评估呈指数级难度
证明即使日志覆盖所有隐藏状态,当记录器依赖历史时,离策略评估仍可能指数级不可靠。
- 12通过蒙特卡洛规划实现在线鲁棒强化学习
提出鲁棒MCTS变体,显式建模仿真器与真实环境动力学差异,在低保真模拟失配下保障决策可靠性。
- 13贝尔曼策略优化
提出无评判器的贝尔曼策略优化(BPO)方法,基于贝尔曼方程重构策略镜像下降,避免中间状态值估计,提升LLM强化学习效率。
- 14CanvasAnneal:面向扩散语言模型的课程强化学习
提出 CanvasAnneal 框架,用教师模型注入推理先验,缓解扩散语言模型 RL 中的探索瓶颈