注意力、多頭注意力和完整的 Transformer,從零開始解釋並在 PyTorch 中從頭開始編碼,每一步都在一個小例子和螢幕上的每個張量形狀上手動完成。我們從為什麼循環網路陷入困境開始,將單字轉換為向量,並一步一步地建立注意力:點積、softmax、查詢、鍵和值、為什麼我們除以 d_k 的平方根、因果和填充掩碼。然後是多頭注意力:將 512 個維度分成 8 個頭,每頭 64 個,每行程式碼後面的形狀,以及針對 PyTorch 自己的 nn.MultiheadAttention 的檢查。接下來是 Transformer 的其餘部分:正弦位置編碼、殘差連接和 LayerNorm、前饋區塊、編碼器和解碼器層、交叉注意力和完整架構。最後,我們在 GPU 上即時訓練它,逐步解碼並查看它學到的注意力圖。重點:注意力讓每個 token 一步一步查看其他 token,這就是整個 Transformer。時間軸 0:00 - 3:55 為什麼注意力 3:55 - 7:35 字變成向量 7:35 - 16:07 注意力,一步一步 16:07 - 19:12 面具 19:12 - 26:50 多頭注意力 26:50 - 32:48完整內容Transformer 38:25 - 44:30 訓練與推理 44:30 - 46:50 摘要 訂閱更多:https://www.youtubedihosseinimoghadaminimoghadam GitHub:https://github.com/youtubedihosseinimoghadam LinkedIn:https://linkedin.https://github.com/ #Transformer #Attention #SelfAttention #MultiHeadAttention #PyTorch #DeepLearning #MachineLearning #LLM #NLP #AI #Python #AttentionIsAllYouNeed #ArtificialIntelligence
免責聲明:info@kdj.com
所提供的資訊並非交易建議。 kDJ.com對任何基於本文提供的資訊進行的投資不承擔任何責任。加密貨幣波動性較大,建議您充分研究後謹慎投資!
如果您認為本網站使用的內容侵犯了您的版權,請立即聯絡我們(info@kdj.com),我們將及時刪除。