LLM训练
3 条- 01PACT:从信用分配到批评者对齐
形式化定义LLM强化学习中token级信用分配的三大公理,为RLHF等算法提供统一数学基础。
- 02面向大语言模型偏好对齐的零阶范式
提出ComPO方法,基于比较预言机实现零阶偏好对齐,在小似然差场景下高效提取方向性信息。
- 03贝尔曼策略优化
提出无评判器的贝尔曼策略优化(BPO)方法,基于贝尔曼方程重构策略镜像下降,避免中间状态值估计,提升LLM强化学习效率。
形式化定义LLM强化学习中token级信用分配的三大公理,为RLHF等算法提供统一数学基础。
提出ComPO方法,基于比较预言机实现零阶偏好对齐,在小似然差场景下高效提取方向性信息。
提出无评判器的贝尔曼策略优化(BPO)方法,基于贝尔曼方程重构策略镜像下降,避免中间状态值估计,提升LLM强化学习效率。