全部文章
关于学习、实践与思考的持续记录。
Actor-Critic 与 GAE:谁来判断这一步比预期好多少
区分 actor、critic、reward model 和 reference,借三步生成例子手算 TD 误差与 GAE,解释策略与价值函数怎样协同训练。
REINFORCE 入门:奖励怎样变成模型的梯度
用一个只有两个候选答案的模型,手算 REINFORCE 的概率、损失、梯度和 SGD 更新,理解基线、方差与完整在线训练流程。
大模型强化学习导读:先看懂训练链路,再学九种方法
从 prompt、rollout、奖励与优势到参数更新,串起 REINFORCE、Actor-Critic、PPO、GRPO、RLOO、ReMax、DAPO、GSPO 与 DPO 的入门学习路线。
LoRA 微调讲透:A/B 矩阵怎样初始化、训练与合并
从低秩增量的逻辑出发,推导 LoRA A/B 矩阵形状、参数量和首步梯度,用可运行 PyTorch 示例解释一随机一为零的初始化,并介绍 PEFT、QLoRA、PiSSA 与 MoE 适配。