生成模型
3 条- 01通过测试时训练的流匹配实现物理系统的贝叶斯滤波
提出基于流匹配的贝叶斯滤波新方法,避免粒子近似损失分布信息,提升高维状态估计精度
- 02λ-控制的GRPO:将流匹配比率不稳定性转化为预算化资源
提出λ-GRPO方法稳定流匹配模型的强化学习训练,通过预算化重要性比率抑制多步去噪中的梯度发散。
- 03PosteriorBench:从点估计到后验匹配的生成式逆求解器评估
提出PosteriorBench基准,强调逆问题求解需匹配完整后验分布而非单点重建,避免模式坍缩等缺陷。
提出基于流匹配的贝叶斯滤波新方法,避免粒子近似损失分布信息,提升高维状态估计精度
提出λ-GRPO方法稳定流匹配模型的强化学习训练,通过预算化重要性比率抑制多步去噪中的梯度发散。
提出PosteriorBench基准,强调逆问题求解需匹配完整后验分布而非单点重建,避免模式坍缩等缺陷。