标签: 自注意力
该标签下的全部文章 "自注意力".
Vision Transformer(ViT)详解:结构、工作原理与有效性
以 224×224 图像和 ViT-B/16 为例,逐步推导 patch、位置编码、CLS、多头自注意力及张量形状,解释 ViT 为什么有效,以及它与 CNN 相比的数据需求和计算局限。
Transformer 中的位置编码:原理、公式与 PyTorch 实现
从自注意力的置换等变性出发,推导正弦/余弦位置编码,比较可学习位置嵌入、相对位置、RoPE 与 ALiBi,并给出带形状说明的 PyTorch 实现。