字节跳动 Seed 团队与清华大学 AIR 研究院联合推出完全开源的大规模大语言模型(LLM)强化学习系统 DAPO(Decoupled Clip and Dynamic sAmpling Policy Optimization)。该系统涵盖算法、代码基础设施及数据集,旨在为研究社区提供可扩展的强化学习实践路径。

核心突破:性能与效率双优

DAPO 提出了“解耦裁剪与动态采样策略优化”算法。基于 Qwen2.5-32B 基础模型训练的 DAPO-Qwen-32B,在 AIME 2024 基准测试中取得 50 分的成绩。值得注意的是,该模型仅用了此前最强模型 DeepSeek-R1-Zero-Qwen-32B 50% 的训练步数,即实现了性能超越。

训练监控数据显示,DAPO 在响应长度、奖励分数及熵值控制上表现出高度稳定性。响应长度的稳步增长促进了复杂推理模式的学习,而受控的熵值平衡了探索与利用,有效避免了过拟合或过度随机化。

全栈开源:从算法到数据

为实现高复现性,团队开源了包括算法细节、基础设施及数据集在内的完整训练配方。系统基于 verl 框架构建,并在火山引擎机器学习平台上完成实验验证。

  • 数据集:提供经过精心筛选的训练集 DAPO-Math-17k 及验证集 AIME 2024。
  • 训练脚本:提供开箱即用的复现脚本,包含两个版本:一是不含 Token 级策略梯度损失和动态采样的早期版本(AIME 得分 44);二是完整版 DAPO(AIME 得分 50)。相关训练记录已在 Wandb 公开。
  • 推理部署:支持通过 Ray Serve 和 vLLM 进行模型部署与评估,并提供基于 Huggingface 及本地路径的加载示例。

目前,DAPO-Qwen-32B 模型权重已公开,开发者可通过提供的 Python 代码快速集成并进行数学推理任务测试。团队表示,后续将在火山引擎平台上提供完整的复现指南,以进一步降低社区使用门槛。