AiNews
⚡ 速览 🧠 模型
← 返回首页

#llm-alignment

包含标签 "llm-alignment" 的文章,共 1 篇。

🧠 模型动态 Reddit

单卡GRPO复现OpenAI“持久有益模型”受阻

该项目旨在单张 RTX 3090 显卡上,复现 OpenAI 关于“持久有益模型”(Persistently Beneficial Models)的研究。在测试对齐特征的持久性之前,开发者需要先通过强化学习(RL)在模型中“注入”特定行为特征。然而,在使用当前热门的 GRPO(群组相对策略优化)算法进行训练时遭遇瓶颈:特征得分仅提升了 2.4 分(95% 置信区间为 [+0.2, +4.8]),而达到预期效果需要提升约 15 分。尽管排除了代码和工程层面的明显问题,训练依然无法有效注入特征。这一尝试对于希望在消费级硬件上进行低成本 RLHF/GRPO 微调的开发者具有重要参考价值,暴露了小规模强化学习在奖励设计和超参数微调上的实际挑战,也引发了社区关于如何优化轻量级对齐训练的讨论。