AI星际引擎
AI STARSHIP
首页
动态
博客
播客
论文
学习
关于
墨
纸
2026.10.01 星期四
第
56
期
主题 · RLHF
RLHF
1 条
01
冷却采样器,而非学习器:采样温度移动重要性校正GRPO的陈旧性悬崖
发现采样温度可调控RLHF中采样器-学习器失步的‘陈旧性悬崖’,为稳定强化学习提供新干预维度。
arxiv.org
·
arXiv
·
2天前
强化学习
RLHF
采样温度