AI星际引擎
AI STARSHIP
首页
动态
博客
播客
论文
学习
关于
墨
纸
2026.10.01 星期四
第
56
期
主题 · 策略微调
策略微调
1 条
01
在自生成与奖励加权数据上的微调:学习动力学、收敛速率及离策略优势
理论分析RE(S)类离策略微调的动力学特性,证明适度离策略(S>1)可加速收敛并提升泛化。
arxiv.org
·
arXiv
·
2天前
策略微调
离策略学习
收敛分析