标签: 强化学习
该标签下的全部文章 "强化学习".
REINFORCE 入门:奖励怎样变成模型的梯度
用一个只有两个候选答案的模型,手算 REINFORCE 的概率、损失、梯度和 SGD 更新,理解基线、方差与完整在线训练流程。
大模型强化学习导读:先看懂训练链路,再学九种方法
从 prompt、rollout、奖励与优势到参数更新,串起 REINFORCE、Actor-Critic、PPO、GRPO、RLOO、ReMax、DAPO、GSPO 与 DPO 的入门学习路线。
MoE 做强化学习为什么容易不稳?从 Dense 对比到路由重放
解释 MoE 与 Dense 的参数、计算和显存差异,拆解大模型 RL 中的路由不一致、专家失衡、探索不足与通信瓶颈,并梳理 R3、PR2、RoutePack 和 ESRL 的解决思路。
2026 Agent 记忆新技术:从历史检索到会学习、会核验的记忆
超越上下文、对话 RAG 和用户画像,解释 2026 年 MemRL、MemSkill、MemoryLACE、RuleMem、MemForest、FocusMem、TMEM 与环境核验记忆的机制、代码现状及实现路径。