标签: GRPO
该标签下的全部文章 "GRPO".
GRPO 入门:不用 critic,怎样用一组答案计算优势
从同一道题采样四个答案开始,手算组内奖励标准化与 token 裁剪,解释 GRPO 的完整流程、零优势组和 KL 正则。
MoE 做强化学习为什么容易不稳?从 Dense 对比到路由重放
解释 MoE 与 Dense 的参数、计算和显存差异,拆解大模型 RL 中的路由不一致、专家失衡、探索不足与通信瓶颈,并梳理 R3、PR2、RoutePack 和 ESRL 的解决思路。
该标签下的全部文章 "GRPO".
从同一道题采样四个答案开始,手算组内奖励标准化与 token 裁剪,解释 GRPO 的完整流程、零优势组和 KL 正则。
解释 MoE 与 Dense 的参数、计算和显存差异,拆解大模型 RL 中的路由不一致、专家失衡、探索不足与通信瓶颈,并梳理 R3、PR2、RoutePack 和 ESRL 的解决思路。