AI星际引擎AI STARSHIP
2026.10.01 星期四
第 56 期
主题 · RLHF

RLHF

1 条
  1. 01
    冷却采样器,而非学习器:采样温度移动重要性校正GRPO的陈旧性悬崖

    发现采样温度可调控RLHF中采样器-学习器失步的‘陈旧性悬崖’,为稳定强化学习提供新干预维度。

    arxiv.org·arXiv·2天前强化学习RLHF采样温度