AI星际引擎AI STARSHIP
2026.09.24 星期四
49
主题 · LLM训练

LLM训练

3
  1. 01
    PACT:从信用分配到批评者对齐

    形式化定义LLM强化学习中token级信用分配的三大公理,为RLHF等算法提供统一数学基础。

    arxiv.org·arXiv·2天前强化学习LLM训练信用分配
  2. 02
    面向大语言模型偏好对齐的零阶范式

    提出ComPO方法,基于比较预言机实现零阶偏好对齐,在小似然差场景下高效提取方向性信息。

    arxiv.org·arXiv·09/17偏好对齐LLM训练优化方法
  3. 03
    贝尔曼策略优化

    提出无评判器的贝尔曼策略优化(BPO)方法,基于贝尔曼方程重构策略镜像下降,避免中间状态值估计,提升LLM强化学习效率。

    arxiv.org·arXiv·09/15强化学习LLM训练优化算法