全部文章
关于学习、实践与思考的持续记录。
MoE 做强化学习为什么容易不稳?从 Dense 对比到路由重放
解释 MoE 与 Dense 的参数、计算和显存差异,拆解大模型 RL 中的路由不一致、专家失衡、探索不足与通信瓶颈,并梳理 R3、PR2、RoutePack 和 ESRL 的解决思路。
2026 Agent 记忆新技术:从历史检索到会学习、会核验的记忆
超越上下文、对话 RAG 和用户画像,解释 2026 年 MemRL、MemSkill、MemoryLACE、RuleMem、MemForest、FocusMem、TMEM 与环境核验记忆的机制、代码现状及实现路径。
2026 Agent 前沿与未解问题:从长任务、记忆到自动研究
基于截至 2026 年 9 月 14 日的一手资料,梳理 Agent 的八条前沿路线,解释可靠性、记忆、强化学习、多智能体协作、电脑操作、自动科研和安全的进展与边界。
高效 Attention 变体:从稀疏、低秩到线性注意力
区分稀疏、低秩、核线性注意力与 FlashAttention,推导因果状态更新,并用手算与可运行代码理解 Performer、RetNet、GLA、DeltaNet 和 Gated DeltaNet。