标签: 深度学习
该标签下的全部文章 "深度学习".
Vision Transformer(ViT)详解:结构、工作原理与有效性
以 224×224 图像和 ViT-B/16 为例,逐步推导 patch、位置编码、CLS、多头自注意力及张量形状,解释 ViT 为什么有效,以及它与 CNN 相比的数据需求和计算局限。
梯度下降优化器与梯度提升树:底层原理、演进脉络与选型指南
从参数空间与函数空间出发,系统讲解 SGD、Momentum、AdamW 与 GBDT、XGBoost、LightGBM、CatBoost 的公式、直觉、差异、示例和实战选型。
Transformer 中的位置编码:原理、公式与 PyTorch 实现
从自注意力的置换等变性出发,推导正弦/余弦位置编码,比较可学习位置嵌入、相对位置、RoPE 与 ALiBi,并给出带形状说明的 PyTorch 实现。
大模型基础(二):Self-Attention 从张量到多头机制
更新于:逐步拆解 Q、K、V 投影、缩放点积、Mask、Softmax、Value 聚合与 Multi-Head Attention,并用可手算案例解释训练和推理中的真实数据流。