标签: Attention
该标签下的全部文章 "Attention".
高效 Attention 变体:从稀疏、低秩到线性注意力
区分稀疏、低秩、核线性注意力与 FlashAttention,推导因果状态更新,并用手算与可运行代码理解 Performer、RetNet、GLA、DeltaNet 和 Gated DeltaNet。
大模型基础(二):Self-Attention 从张量到多头机制
更新于:逐步拆解 Q、K、V 投影、缩放点积、Mask、Softmax、Value 聚合与 Multi-Head Attention,并用可手算案例解释训练和推理中的真实数据流。
大模型基础(一):Transformer 到底改变了什么?
更新于:从序列建模难题出发,拆解 Transformer 的 Encoder–Decoder、Self-Attention、位置编码和残差路径,并建立现代 Transformer 变体的完整坐标系。