AI星际引擎AI STARSHIP
2026.10.01 星期四
第 56 期
主题 · 鲁棒训练

鲁棒训练

1 条
  1. 01
    基于优势与序列权重估计的双通道鲁棒组相对策略优化

    提出RoVR-GSPO,分别鲁棒化奖励优势估计与序列权重计算,缓解极端奖励和token扰动导致的优化崩溃。