本文重新审视了传统的策略梯度 (PG) 机制,并提出了一种极简的强化学习 (RL) 方法,称为组策略梯度 (GPG)。与传统方法不同,GPG 直接优化原始强化学习 (RL) 目标,从而无需替代损失函数。通过消除评论家和参考模型,避免 KL 散度约束,并解决优势和梯度估计偏差问题,我们的方法与组相对策略优化 (GRPO) 相比,显著简化了训练过程。我们的方法无需依赖辅助技术或调整即可实现卓越性能。大量实验表明,我们的方法不仅降低了计算成本,而且在各种单模态和多模态任务上始终优于 GRPO。
有趣的是,本文对《Understanding R1-Zero-Like Training: A Critical Perspective》中 Dr. GRPO 的一些方法发表了一些复现心得。对于 Dr. GRPO,可以观看笔记《R1 训练中的坑都踩了吗?》
r1后续论文建议配合:《字节Seed:Seed-Thinking-v1.5 赶上来了》《PPO 在长思维链中为什么崩溃?》《建议大模型RL训练的都来看看字节VAPO》《建议复现R1的都来看看,这次是32B完整经验》《SimpleRL-Zoo:R1-zero 成功因素的几点分析》《快手:SRPO,两阶段历史重采样策略优化》等共同观看。
人工智能 大模型 LLM GRPO deepseek r1 强化学习 大模型训练 大模型面试

















