标签: Self-Attention
该标签下的全部文章 "Self-Attention".
大模型基础(二):Self-Attention 从张量到多头机制
更新于:逐步拆解 Q、K、V 投影、缩放点积、Mask、Softmax、Value 聚合与 Multi-Head Attention,并用可手算案例解释训练和推理中的真实数据流。
该标签下的全部文章 "Self-Attention".
逐步拆解 Q、K、V 投影、缩放点积、Mask、Softmax、Value 聚合与 Multi-Head Attention,并用可手算案例解释训练和推理中的真实数据流。