字节跳动采用 GRPO 来增强训练后模型能力
核心要点
- TikTok 母公司的研究团队重新设计了 DeepSeek 技术,使视觉生成模型与人类偏好保持一致,基准增益高达 181%。
- 字节跳动的人工智能研究部门采用了最初为大型语言模型设计的强化学习技术,并将其改进为视觉生成,产生了一个名为 DanceGRPO 的框架,该框架在文本到图像、文本到视频和图像到视

TikTok 母公司的研究团队重新设计了 DeepSeek 技术,使视觉生成模型与人类偏好保持一致,基准增益高达 181%。
字节跳动的人工智能研究部门采用了最初为大型语言模型设计的强化学习技术,并将其改进为视觉生成,产生了一个名为 DanceGRPO 的框架,该框架在文本到图像、文本到视频和图像到视频任务中提供了显着的质量改进。
这项工作由字节跳动的 Seed 团队与香港大学的研究人员合作开发,代表了解决生成人工智能中持续令人头疼的问题的更雄心勃勃的尝试之一:让扩散模型和修正流模型真正产生人类想要的东西。
格洛丽亚 关闭应用——格洛丽亚财经持续关注。设置监视器并仅在发生重大变化时才收到反馈。设置监视器 →
从语言到视觉
组相对策略优化 (GRPO) 首次出现于 2024 年 4 月,作为 DeepSeek DeepSeekMath 研究的一部分。它的核心创新是优雅的。 GRPO 不是训练单独的批评家模型来评估输出(根据人类反馈进行强化学习的标准方法),而是相对于一组样本对输出进行评分。这种架构捷径使整个培训过程更便宜、更高效。
字节跳动的贡献是弄清楚如何将相同的逻辑应用于视觉生成,这是一个根本不同的问题。语言模型按顺序生成标记。扩散模型通过迭代去噪生成图像和视频,这是一个由随机微分方程控制的过程。 DanceGRPO 重新设计了采样过程,使 GRPO 基于组的相对评分与这些视觉管道兼容。
结果是一个跨多个基础模型工作的框架,包括 Stable Diffusion、FLUX、HunyuanVideo 和 SkyReels-I2V。它支持至少五种不同的奖励类型,使研究人员可以灵活地定义“好”输出。
改进背后的数字
基准测试的改进最清楚地说明了这一点。在 HPS-v2.1 和 CLIP Score(衡量生成的图像与文本提示和人类偏好的匹配程度)等指标上,DanceGRPO 记录的增强程度高达 181%。
2025 年 9 月左右宣布的名为 BranchGRPO 的后续项目进一步推动了该方法。据报告,对齐分数提高了 16%,同时训练时间缩短了 55%。
超越视觉生成
字节跳动还与清华大学 AIR 实验室合作开发了 DAPO(解耦剪辑和动态采样策略优化的缩写)。 DAPO 的目标是语言模型中的推理能力。
DAPO 在测试数学推理能力的 AIME 2024 基准测试中获得了 50 分,同时比同类 DeepSeek-R1 设置减少了 50% 的训练步骤。
