AREAL团队通过设计全异步强化学习系统,结合算法创新与系统优化,显著提升了大语言模型推理训练的效率与性能,同时保持或提高了模型准确率。 以下是具体实现方式:
传统同步强化学习系统存在两大核心问题:
AREAL通过全异步设计解决这些问题,允许生成与训练独立运行,资源持续满负荷工作。

AREAL由四个核心组件构成,通过解耦生成与训练流程实现异步:
接收生成响应或权重更新请求。当新模型参数可用时,中断当前生成任务,加载新参数后继续序列生成。
例如,学生解题过程中接收新思路并立即调整,避免从头开始。
评估模型生成回答的质量。例如,在编程任务中提取代码并运行单元测试验证准确性。
从经验回放缓冲区采样数据,执行PPO(Proximal Policy Optimization)更新,并将结果参数存储在分布式存储中。
数据仅使用一次以确保新鲜度,避免过时数据影响训练效果。
作为核心桥梁,协调推理工作器、奖励服务与训练工作器。
从数据集读取数据并调用生成请求,将响应发送至奖励服务获取奖励,存储轨迹与奖励至回放缓冲区。
模型更新后,控制器触发推理工作器的权重更新功能。
异步流程示例:
异步设计带来两大技术挑战,AREAL通过算法创新解决:
训练批次可能包含多个策略版本的数据,降低学习性能。
解决方案:提出过时性感知训练(Staleness-Aware Training),引入超参数η(最大允许过时度)。系统优先处理旧轨迹,确保过时度≤η。当η=0时退化为同步RL;η=1时恢复为一步重叠方法。
同一轨迹可能由不同策略版本生成,违反PPO假设(所有动作由单一策略生成)。
解决方案:提出解耦PPO目标函数(Decoupled PPO Objective),将行为策略πbehav(用于采样轨迹)与代理策略πprox(规范目标策略πθ更新)分离。通过重要性采样推导出适用于异步训练的目标函数,放宽单一策略生成数据的要求。
实际实现:
AREAL基于Python和PyTorch实现,结合SGLang(生成服务后端)与Megatron-Core(训练后端),通过以下优化提升性能:
将基于规则的奖励计算(如字符串匹配、单元测试)与基于TCP的数据传输移至单独线程,通过流水线化重叠操作。
使用asyncio协程并发运行多个推理请求,避免阻塞等待。
采用动态分配算法平衡微批次间的令牌分布,在固定内存约束下最大化GPU利用率,同时最小化前向-后向传递次数。
效果:
在数学推理(AIME24基准)与代码生成(LiveCodeBench基准)任务中,AREAL与同步RL系统对比显示:
数学任务:1.5B模型从41.0小时减至14.8小时,7B模型从57.7小时减至25.4小时。
代码任务:14B模型从48.8小时减至21.9小时,32B模型从51.1小时减至31.1小时。
数学任务:1.5B与7B模型准确率分别为42.2%和63.1%,与同步系统持平。
代码任务:14B与32B模型准确率分别为58.1%和61.0%,略高于同步系统。
总体实现高达2.57倍训练吞吐量提升,在512个GPU上展示线性扩展效率。
通过消融实验验证设计选择的有效性:
朴素PPO在η>0时性能显著下降,而解耦目标函数在η≤4时保持稳定,证明其处理过时数据的能力。
移除该功能后,1.5B和7B模型在4个节点上的吞吐量分别降低12%和17%,验证其必要性。
与标准策略相比,动态批处理平均提高30%吞吐量,避免内存不足错误。
AREAL通过全异步设计、算法创新与系统优化,实现了大语言模型推理训练的效率与性能双重提升。其成功表明,系统设计与算法创新的结合是解决强化学习训练瓶颈的关键。未来,AREAL为训练更强大的推理模型提供了可靠框架,有望推动机器智能边界的进一步拓展。
