注意力、多头注意力和完整的 Transformer,从零开始解释并在 PyTorch 中从头开始编码,每一步都在一个小例子和屏幕上的每个张量形状上手动完成。我们从为什么循环网络陷入困境开始,将单词转化为向量,并一步一步地建立注意力:点积、softmax、查询、键和值、为什么我们除以 d_k 的平方根、因果和填充掩码。然后是多头注意力:将 512 个维度分成 8 个头,每头 64 个,每行代码后面的形状,以及针对 PyTorch 自己的 nn.MultiheadAttention 的检查。接下来是 Transformer 的其余部分:正弦位置编码、残差连接和 LayerNorm、前馈块、编码器和解码器层、交叉注意力和完整架构。最后,我们在 GPU 上实时训练它,逐步解码并查看它学到的注意力图。要点:注意力让每个 token 一步步查看其他 token,这就是整个 Transformer。时间轴 0:00 - 3:55 为什么注意力 3:55 - 7:35 单词变成向量 7:35 - 16:07 注意力,一步一步 16:07 - 19:12 面具 19:12 - 26:50 多头注意力 26:50 - 32:48 位置、规范和前馈 32:48 - 38:25 完整内容Transformer 38:25 - 44:30 训练和推理 44:30 - 46:50 摘要 订阅更多内容:https://www.youtube.com/@mehdihosseinimoghadam GitHub:https://github.com/mehdihosseinimoghadam LinkedIn:https://linkedin.com/in/mehdi-hosseini-moghadam-384912198 #Transformer #Attention #SelfAttention #MultiHeadAttention #PyTorch #DeepLearning #MachineLearning #LLM #NLP #AI #Python #AttentionIsAllYouNeed #ArtificialIntelligence
免责声明:info@kdj.com
所提供的信息并非交易建议。根据本文提供的信息进行的任何投资,kdj.com不承担任何责任。加密货币具有高波动性,强烈建议您深入研究后,谨慎投资!
如您认为本网站上使用的内容侵犯了您的版权,请立即联系我们(info@kdj.com),我们将及时删除。