算法优化
2 条- 01λ-控制的GRPO:将流匹配比率不稳定性转化为预算化资源
提出λ-GRPO方法稳定流匹配模型的强化学习训练,通过预算化重要性比率抑制多步去噪中的梯度发散。
- 02GPU-CFR:通过编译游戏为静态数据流和CUDA图重放,实现80倍加速的反事实遗憾最小化
提出GPU-CFR新方法,将CFR算法编译为静态数据流与CUDA图重放,实现80倍加速,突破GPU上树遍历计算瓶颈。
提出λ-GRPO方法稳定流匹配模型的强化学习训练,通过预算化重要性比率抑制多步去噪中的梯度发散。
提出GPU-CFR新方法,将CFR算法编译为静态数据流与CUDA图重放,实现80倍加速,突破GPU上树遍历计算瓶颈。