文章归档
按照时间回看所有记录。
Qwen-VL 系列架构解读:从视觉连接器到 Qwen3-VL 与最新多模态演进
更新于:深入拆解 Qwen3-VL 的视觉编码器、MLP 连接器、DeepStack、位置编码与训练流程,并核对截至 2026-09-26 的 Qwen3.8-Next、Omni 最新公开报告,附论文与 PDF 入口。
Vision Transformer(ViT)详解:结构、工作原理与有效性
以 224×224 图像和 ViT-B/16 为例,逐步推导 patch、位置编码、CLS、多头自注意力及张量形状,解释 ViT 为什么有效,以及它与 CNN 相比的数据需求和计算局限。
AI Agent 全流程链路:从 Message、Tools 与 Skills 装配到执行闭环
面向开发者拆解一条消息进入 AI Agent 后的完整链路:接入与规范化、状态和记忆、策略路由、Tool/Skill 装配、上下文构建、受限工具循环、审批、响应以及运行后治理。
梯度下降优化器与梯度提升树:底层原理、演进脉络与选型指南
从参数空间与函数空间出发,系统讲解 SGD、Momentum、AdamW 与 GBDT、XGBoost、LightGBM、CatBoost 的公式、直觉、差异、示例和实战选型。
从数据清洗到特征工程:传统机器学习标准流程与完整学习路径
以客户月度流失预测为贯穿案例,系统讲解审计边界、标签成熟、异常清洗、时间切分、特征工程、Pipeline、分类与回归评估、调参、交付和监控。
vLLM、FSDP 与大模型训练到推理:一份端到端基础设施指南
系统讲解 vLLM 的分页 KV Cache、连续批处理与推理并行,以及 FSDP/FSDP2 的状态分片、集合通信和检查点,并给出从训练到 OpenAI 兼容服务的示例、选型表与排障清单。
Plan-and-Execute、CoT、ReAct 与 Workflow:不是四选一,而是四个控制层次
从抽象层级、控制流、成本、延迟、可控性与适应性比较 CoT、ReAct、Plan-and-Execute 和 Workflow,并用同一差旅任务展示执行轨迹与生产选型。
Agent Tool Use 技术报告:原理、近期进展与可靠性工程
资料核查至 2026-09-18:系统解释 Agent 的工具选择、函数调用、状态闭环与规划执行,梳理按需工具发现、代码化编排、MCP 协议演进及状态化与安全评测,并给出生产可靠性架构与实施清单。
Transformer 中的位置编码:原理、公式与 PyTorch 实现
从自注意力的置换等变性出发,推导正弦/余弦位置编码,比较可学习位置嵌入、相对位置、RoPE 与 ALiBi,并给出带形状说明的 PyTorch 实现。
Claude Code 的记忆机制:写入、持久化、加载与会话边界
从 CLAUDE.md、自动记忆、JSONL 会话记录和上下文压缩四层拆解 Claude Code 的跨会话记忆,并说明配置核验、子 Agent 记忆与每日归档边界。
DeepSeek Harness 项目详解(四):应用入口、Web UI 与完整包索引
解释 profile/preset 装配、Web Host 与 Client、Typert RPC、TypeScript/Python SDK、工程验证,并提供 49 组 219 包的中文职责索引。
DeepSeek Harness 项目详解(一):整体架构与模块地图
基于本地 47f9438 版本,梳理 DeepSeek Harness 的 49 个模块组、219 个包,以及插件、Agent、工具、会话和 Web UI 之间的关系。
DeepSeek Harness 项目详解(二):运行主链、会话与上下文
沿 ReactLoopAgent 的真实调用顺序,解释 Inbox、Turn、Step、模型流、工具并发、事件日志、持久化与上下文压缩。
DeepSeek Harness 项目详解(三):工具、权限与任务编排
逐层解释文件、Shell、PTY、LSP、Web、MCP、Skills、沙箱、子 Agent、Workflow、Goal 和会话内提醒的职责与边界。
后端工程面经:幂等、消息队列、接口排障与部署
用重复下单和接口变慢等场景,解释幂等键、重试、消息可靠性、连接池、可观测性、部署与测试。
Redis 面经:缓存一致性、分布式锁与持久化
从缓存读写链路出发,拆解常见类型、穿透击穿雪崩、删除缓存的竞态、锁租约、淘汰持久化和事务。
MySQL 面经:索引、事务、锁与慢查询怎么讲清楚
以 MySQL 8.4 InnoDB 为例,解释联合索引、执行计划、隔离级别、快照读、扣库存、死锁和游标分页。
Python Web 面经:FastAPI、Django、请求链路与鉴权
从 WSGI/ASGI 到请求校验、依赖生命周期、数据库会话、N+1、鉴权和 CORS,整理八组常见问答。
Python 并发面经:GIL、线程、进程与 asyncio 怎么选
讲清并发与并行、可选无 GIL 构建、协程调度、TaskGroup、阻塞调用、锁、超时取消和并发限制。
Python 基础面经:对象、拷贝、装饰器与生成器怎么回答
用八组问答和可运行例子理解 Python 容器、对象引用、默认参数、闭包、装饰器、生成器、内存与类型标注。
Python 后端面经导读:48 个常见问题,怎样从会背到会讲
面向实习与初中级 Python 后端的复习路线,串起语言、异步、Web、MySQL、Redis、接口与排障六篇面经。
DPO 入门:不用在线奖励循环,怎样学习偏好
从 chosen/rejected 答案对出发,计算 reference 校准的偏好分差、sigmoid 损失与梯度,解释 DPO 与 PPO、SFT 的区别。
GSPO 入门:把概率比和裁剪移到整条回答
用四个 token 的概率比解释 GSPO 的几何平均、序列级裁剪与梯度,区分它与 GRPO,并说明 MoE 稳定性的适用边界。
DAPO 入门:把长推理训练的四个薄弱环节补起来
逐步解释 Clip-Higher、动态采样、token 级损失聚合和超长奖励处理,配完整链路与能手算的小例子。
ReMax 入门:用贪心答案当作自己的参照
解释随机生成与贪心生成的双路流程,手算奖励差和策略更新,区分贪心基线、最优答案、RLOO 和 critic。
RLOO 入门:把自己的奖励从基线里拿出去
用四个回答计算 leave-one-out 基线,说明 RLOO 如何构造 REINFORCE 梯度,以及它与 GRPO、PPO 的关系和差异。
GRPO 入门:不用 critic,怎样用一组答案计算优势
从同一道题采样四个答案开始,手算组内奖励标准化与 token 裁剪,解释 GRPO 的完整流程、零优势组和 KL 正则。
PPO 从零讲清:旧概率、新概率与裁剪更新
沿完整 RLHF 链路解释 PPO-Clip,手算正负优势的概率比与裁剪,讲清 old policy、reference、critic 和奖励的不同职责。
Actor-Critic 与 GAE:谁来判断这一步比预期好多少
区分 actor、critic、reward model 和 reference,借三步生成例子手算 TD 误差与 GAE,解释策略与价值函数怎样协同训练。
REINFORCE 入门:奖励怎样变成模型的梯度
用一个只有两个候选答案的模型,手算 REINFORCE 的概率、损失、梯度和 SGD 更新,理解基线、方差与完整在线训练流程。
大模型强化学习导读:先看懂训练链路,再学九种方法
从 prompt、rollout、奖励与优势到参数更新,串起 REINFORCE、Actor-Critic、PPO、GRPO、RLOO、ReMax、DAPO、GSPO 与 DPO 的入门学习路线。
LoRA 微调讲透:A/B 矩阵怎样初始化、训练与合并
从低秩增量的逻辑出发,推导 LoRA A/B 矩阵形状、参数量和首步梯度,用可运行 PyTorch 示例解释一随机一为零的初始化,并介绍 PEFT、QLoRA、PiSSA 与 MoE 适配。
MoE 做强化学习为什么容易不稳?从 Dense 对比到路由重放
解释 MoE 与 Dense 的参数、计算和显存差异,拆解大模型 RL 中的路由不一致、专家失衡、探索不足与通信瓶颈,并梳理 R3、PR2、RoutePack 和 ESRL 的解决思路。
2026 Agent 记忆新技术:从历史检索到会学习、会核验的记忆
超越上下文、对话 RAG 和用户画像,解释 2026 年 MemRL、MemSkill、MemoryLACE、RuleMem、MemForest、FocusMem、TMEM 与环境核验记忆的机制、代码现状及实现路径。
2026 Agent 前沿与未解问题:从长任务、记忆到自动研究
基于截至 2026 年 9 月 14 日的一手资料,梳理 Agent 的八条前沿路线,解释可靠性、记忆、强化学习、多智能体协作、电脑操作、自动科研和安全的进展与边界。
高效 Attention 变体:从稀疏、低秩到线性注意力
区分稀疏、低秩、核线性注意力与 FlashAttention,推导因果状态更新,并用手算与可运行代码理解 Performer、RetNet、GLA、DeltaNet 和 Gated DeltaNet。
大模型基础(二):Self-Attention 从张量到多头机制
更新于:逐步拆解 Q、K、V 投影、缩放点积、Mask、Softmax、Value 聚合与 Multi-Head Attention,并用可手算案例解释训练和推理中的真实数据流。
大模型基础(一):Transformer 到底改变了什么?
更新于:从序列建模难题出发,拆解 Transformer 的 Encoder–Decoder、Self-Attention、位置编码和残差路径,并建立现代 Transformer 变体的完整坐标系。
Pi Coding Agent 源码导读(十三):从零实现一个 Mini Pi
用 pi-ai 与 pi-agent-core 构造最小 Agent,并用确定性 Fake Provider 验证两轮模型调用、一次 Tool Use、结果回灌和事件顺序。
Pi Coding Agent 源码导读(十二):AgentHarness 的持久化运行架构
分析 Pi experimental AgentHarness 的 Session、Branch、AgentLane、Operation、事务存储、Effect Gate 与崩溃恢复,并和稳定 CLI v3 对照。
Pi Coding Agent 源码导读(十一):可靠性与安全边界
分析 Pi 的 Abort、Retry、Overflow Recovery、事件结算、Project Trust、凭据与工具权限,并给出容器化和 Tool Policy 的分层防护方案。
Pi Coding Agent 源码导读(十):Session Tree、分支与 Compaction
深入 Pi JSONL v3 的 append-only 会话树,解释 branch、fork、clone、Branch Summary、Compaction、split turn 与上下文恢复。
Pi Coding Agent 源码导读(九):TUI、Print、JSON、RPC 与 SDK
比较 Pi 的四种运行模式和直接 SDK 集成,解释同一个 AgentSession 如何被终端 UI、脚本、事件流与外部应用复用。
Pi Coding Agent 源码导读(八):Extensions 与可编程运行时
系统梳理 Pi Extension 的加载、事件、Hook、命令、工具、Provider、Session 状态与 TUI 扩展能力,以及它们真正的安全边界。
Pi Coding Agent 源码导读(七):Model、Provider 与协议适配
拆解 pi-ai、ModelRuntime、模型目录、认证解析、Provider 协议、thinking 映射、流式事件与跨模型上下文转换。
Pi Coding Agent 源码导读(六):System Prompt、Context 与 Skills
从 buildSystemPrompt() 与 AgentSession.prompt() 出发,分析工具说明、项目规则、Skills、Prompt Templates 和 Slash Commands 如何进入模型上下文。
Pi Coding Agent 源码导读(五):Memory,Pi 到底记住了什么
从工作上下文、JSONL 会话树、项目规则、Skills、Custom Entry 到 Compaction,建立 Pi Memory 的分层模型,并解释它为什么不是向量长期记忆。
Pi Coding Agent 源码导读(四):Tool Use 从 Schema 到副作用
拆解 Pi 工具的定义、参数准备、TypeBox 校验、Extension Hook、并行策略、文件写入队列、输出截断与 Tool Result 回灌。
Pi Coding Agent 源码导读(三):Agent Loop 的执行内核
深入 packages/agent,解释 prompt、continue、turn、消息流、工具批次、steering 与 follow-up 如何组成 Pi 的低层执行循环。
Pi Coding Agent 源码导读(二):启动、配置与资源发现
沿着 main()、createAgentSessionServices() 与 DefaultResourceLoader,拆解 Pi 如何合并配置、判断项目可信度、发现资源并组装可运行的 AgentSession。
Pi Coding Agent 源码导读(一):从输入到工具执行的整体架构
以 Pi v0.85.1 的官方文档和源码为依据,拆解 CLI、AgentSession、Agent Loop、工具、记忆、模型适配与 TUI,并还原一次请求的完整调用链。
Agent Workflow 与 Skills:一个管过程,一个管能力
更新于:从控制流、状态、知识封装和执行约束出发,解释 Agent Workflow 为什么存在、Skills 如何实现,以及什么时候单独使用或组合使用。
ReAct、Plan-and-Execute 与 Multi-Agent:内核差异、能力边界与实验设计
更新于:从反馈控制、显式规划、状态所有权和组织协作四个维度,解释三种 Agent 形态为什么不同、何时适用,以及如何通过对照实验评判。
如何把零散笔记整理成文章
一套从问题、证据、实践到结论的轻量整理方法。
这个博客是如何搭建的
Astro、Markdown、GitHub 与 Vercel 组成的轻量写作工作流。
你好,Learn Everything
为什么我要建立这个数字花园,以及这里将会记录什么。