AI星际引擎
AI STARSHIP
首页
动态
博客
播客
论文
学习
关于
墨
纸
2026.10.01 星期四
第
56
期
主题 · 鲁棒训练
鲁棒训练
1 条
01
基于优势与序列权重估计的双通道鲁棒组相对策略优化
提出RoVR-GSPO,分别鲁棒化奖励优势估计与序列权重计算,缓解极端奖励和token扰动导致的优化崩溃。
arxiv.org
·
arXiv
·
2天前
策略优化
鲁棒训练
组相对学习