使用 GRPO 后训练 Qwen 3.5-2B
针对开源小模型在处理任务时常见的过度推理问题,社区分享了基于 GRPO 算法对 Qwen 3.5-2B 进行后训练的实践经验与完整代码。该实践主要探讨了如何通过策略优化来对齐轻量级模型、抑制冗余推理,从而提升小参数模型在本地运行时的执行效率,为开发者微调同类模型提供了一套可参考的落地路径。
针对开源小模型在处理任务时常见的过度推理问题,社区分享了基于 GRPO 算法对 Qwen 3.5-2B 进行后训练的实践经验与完整代码。该实践主要探讨了如何通过策略优化来对齐轻量级模型、抑制冗余推理,从而提升小参数模型在本地运行时的执行效率,为开发者微调同类模型提供了一套可参考的落地路径。
当前 Kimi、DeepSeek、Qwen 和 GLM 等主流大模型广泛采用在线策略蒸馏与 GRPO 算法。这些强化学习技术能够与预训练及监督微调(SFT)无缝结合。通过剖析其数学原理与代码实现,开发者可以理清核心算法的衔接方式,从而在实际工程中优化模型训练效果。
该项目旨在单张 RTX 3090 显卡上,复现 OpenAI 关于“持久有益模型”(Persistently Beneficial Models)的研究。在测试对齐特征的持久性之前,开发者需要先通过强化学习(RL)在模型中“注入”特定行为特征。然而,在使用当前热门的 GRPO(群组相对策略优化)算法进行训练时遭遇瓶颈:特征得分仅提升了 2.4 分(95% 置信区间为 [+0.2, +4.8]),而达到预期效果需要提升约 15 分。尽管排除了代码和工程层面的明显问题,训练依然无法有效注入特征。这一尝试对于希望在消费级硬件上进行低成本 RLHF/GRPO 微调的开发者具有重要参考价值,暴露了小规模强化学习在奖励设计和超参数微调上的实际挑战,也引发了社区关于如何优化轻量级对齐训练的讨论。