2026年9月13日,英伟达正式发布开源强化学习算法FlashREINFORCE。技术报告显示,该算法在训练AI智能体时,所有测试任务均达到或超越主导性基线GRPO水平,而消耗的rollout(轨迹采样)数量仅为后者的一半。这意味着在相同训练预算下,研究团队可运行两倍数量的实验,或将硬件资源需求减半。

回归本源:为何强化学习需要“做减法”

FlashREINFORCE的核心论点直指当前领域痛点:对复杂算法脚手架的依赖正产生边际收益递减。论文标题“强化学习应当回归REINFORCE”表明,团队主张回到Ronald Williams于1992年提出的基础原则,即利用加权总回报的单条轨迹更新策略。

此前,组相对策略优化(GRPO)因DeepSeek R1模型的广泛应用而成为主流。GRPO通过生成多个响应进行组间比较来稳定训练,但这一机制带来了高昂的同步成本。在浏览网页、代码执行等长周期智能体任务中,最慢的rollout成为速率瓶颈,导致GPU闲置。此外,异步运行时的GRPO易出现灾难性退化,Qwen团队曾记录到模型在训练第600步时停止调用工具,陷入不可逆崩溃。

三大机制解决稳定性难题

英伟达团队并未简单复用旧算法,而是针对朴素REINFORCE的高方差、策略陈旧性和长度偏差三大顽疾,引入了三项关键改进:

首先是“One-Batch REINFORCE”处理方差。算法对来自不同提示的独立轨迹进行批处理,计算批次平均奖励并分配符号优势,无需评论家模型或兄弟rollouts对比。每批次更新后即丢弃数据,避免策略漂移。

其次,“序列信任域”解决策略陈旧性。针对异步训练中行为策略与当前策略的漂移,算法计算轨迹中标记的平均伯努利KL代理值。若超过阈值,则直接拒绝整条轨迹,防止损坏的梯度更新。这一设计继承了DeepMind IMPALA框架的异步校正原则,并适配了语言模型的变长特性。

最后,“样本均值优化”消除长度偏差。算法按标记数标准化每条轨迹的贡献,确保长失败轨迹不会主导负向信号,短成功轨迹也不会被淹没。

基准测试:效率与稳定性的双重胜利

在数学推理任务中,Qwen2.5-Math-1.5B模型在使用FlashREINFORCE训练后,平均准确率达到38.0%,优于GRPO的36.3%。关键在于,FlashREINFORCE仅用了25.6万次rollout,而GRPO需51.2万次。

在更具挑战性的Python工具使用任务中,差异更为显著。训练至第600步时,FlashREINFORCE得分为37.0,平均每轨迹调用3.25次工具;而同条件下的GRPO得分降至30.3,且完全停止调用工具,重现了已知的不稳定性崩溃。

长期稳定性方面,即使在策略滞后4至8次更新的极端异步条件下,FlashREINFORCE在DeepSeek-R1-Distill-Qwen-1.5B及300亿参数的Qwen3-30B-A3B模型上均保持稳定,并在ALFWorld基准测试中实现了98.3%的已知任务成功率。

行业影响与落地指南

FlashREINFORCE的发布暗示,语言模型强化学习领域积累的算法复杂性可能多为工程开销。若结果经独立复现证实,行业此前为GRPO的同步结构支付的“计算税”将被大幅削减。对于受限於数百张H100 GPU的研究团队而言,rollout需求减半意味着显著的可扩展性提升。

目前,该算法已通过Apache 2.0许可开源,并集成至英伟达NeMo Labs的Molt框架(2026年9月14日更新)。开发者可通过GitHub获取PyTorch参考实现及CPU验证示例。值得注意的是,实施时需存储推理引擎生成的实际行为对数概率,Molt框架已自动处理此流程。

英伟达并未建议全面弃用GRPO。对于同步工作流及短周期任务,GRPO依然有效。但随着AI智能体向长周期、异步、不规则轨迹方向发展,FlashREINFORCE展示了更优的结构匹配性。

常见问题解析

FlashREINFORCE与标准REINFORCE有何不同?
标准REINFORCE因高方差难以扩展。FlashREINFORCE通过批次均值基线提供廉价符号优势,利用序列信任域筛选漂移轨迹,并通过长度标准化平衡贡献,使其在现代智能体训练条件下具备可行性。

能否在现有GRPO模型上切换?
可以。若使用Molt框架,仅需更改配置标志。关键基础设施要求是rollout工作程序必须在生成时存储行为对数概率,以供重要性采样校正使用。

是否不再需要GPU集群?
并非如此。FlashREINFORCE减少的是rollout数量而非消除硬件需求。在同等准确率下,它可将所需rollout减半,从而缩短墙钟时间或减少GPU用量,但大规模智能体训练仍需大量算力支持。