AI星际引擎AI STARSHIP
2026.09.24 星期四
49
主题 · 算法优化

算法优化

2
  1. 01
    λ-控制的GRPO:将流匹配比率不稳定性转化为预算化资源

    提出λ-GRPO方法稳定流匹配模型的强化学习训练,通过预算化重要性比率抑制多步去噪中的梯度发散。

    arxiv.org·arXiv·6天前强化学习生成模型算法优化
  2. 02
    GPU-CFR:通过编译游戏为静态数据流和CUDA图重放,实现80倍加速的反事实遗憾最小化

    提出GPU-CFR新方法,将CFR算法编译为静态数据流与CUDA图重放,实现80倍加速,突破GPU上树遍历计算瓶颈。

    arxiv.org·arXiv·09/11算法优化GPU加速博弈论