全部文章
关于学习、实践与思考的持续记录。
Qwen-VL 系列架构解读:从视觉连接器到 Qwen3-VL 与最新多模态演进
更新于:深入拆解 Qwen3-VL 的视觉编码器、MLP 连接器、DeepStack、位置编码与训练流程,并核对截至 2026-09-26 的 Qwen3.8-Next、Omni 最新公开报告,附论文与 PDF 入口。
Vision Transformer(ViT)详解:结构、工作原理与有效性
以 224×224 图像和 ViT-B/16 为例,逐步推导 patch、位置编码、CLS、多头自注意力及张量形状,解释 ViT 为什么有效,以及它与 CNN 相比的数据需求和计算局限。
AI Agent 全流程链路:从 Message、Tools 与 Skills 装配到执行闭环
面向开发者拆解一条消息进入 AI Agent 后的完整链路:接入与规范化、状态和记忆、策略路由、Tool/Skill 装配、上下文构建、受限工具循环、审批、响应以及运行后治理。
梯度下降优化器与梯度提升树:底层原理、演进脉络与选型指南
从参数空间与函数空间出发,系统讲解 SGD、Momentum、AdamW 与 GBDT、XGBoost、LightGBM、CatBoost 的公式、直觉、差异、示例和实战选型。