AI星际引擎
AI STARSHIP
首页
动态
博客
播客
论文
学习
关于
墨
纸
2026.09.24 星期四
第
49
期
主题 · 大模型对齐
大模型对齐
1 条
01
得分中心化稳定离策略强化学习
提出得分中心化技术缓解训练-推理不匹配导致的漂移问题,显著提升大模型RL训练稳定性。
arxiv.org
·
arXiv
·
6天前
强化学习
训练稳定性
大模型对齐