注意、マルチヘッド アテンション、および完全な Transformer は、ゼロから説明され、PyTorch で最初からコード化されており、画面上の小さなサンプルとすべてのテンソル形状ですべてのステップが手作業で行われます。なぜリカレントネットワークが苦戦したかから始めて、単語をベクトルに変換し、ドット積、ソフトマックス、クエリ、キーと値、d_k の平方根で割る理由、因果マスクとパディングマスクなど、一度に 1 ステップずつ注意を高めていきます。次に、マルチヘッド アテンション: 512 次元を 64 個の 8 個のヘッドに分割し、コードの各行の後の形状を分割し、PyTorch 独自の nn.MultiheadAttendant に対するチェックを行います。次に、Transformer の残りの部分です。正弦波位置エンコーディング、残差接続と LayerNorm、フィードフォワード ブロック、エンコーダ層とデコーダ層、クロスアテンション、および完全なアーキテクチャです。最後に、GPU 上でライブでトレーニングし、段階的にデコードして、学習したアテンション マップを確認します。重要なポイント: 注意すると、すべてのトークンが 1 つのステップで他のすべてのトークンを参照できるようになります。これが Transformer 全体です。タイムライン 0:00 - 3:55 なぜ注意を払うのか 3:55 - 7:35 言葉がベクトルになる 7:35 - 16:07 注意、段階的に 16:07 - 19:12 マスク 19:12 - 26:50 多頭注意 26:50 - 32:48 立場、規範、フィードフォワード 32:48 - 38:25完全な Transformer 38:25 - 44:30 トレーニングと推論 44:30 - 46:50 概要 詳細を購読するには: https://www.youtube.com/@mehdihosseinimoghadam GitHub: https://github.com/mehdihosseinimoghadam LinkedIn: https://linkedin.com/in/mehdi-hosseini-moghadam-384912198 #トランスフォーマー #注意 #自己注意 #多頭注意 #PyTorch #ディープラーニング #機械学習 #LLM #NLP #AI #Python #注意はすべてあなたが必要 #人工知能
免責事項:info@kdj.com
提供される情報は取引に関するアドバイスではありません。 kdj.com は、この記事で提供される情報に基づいて行われた投資に対して一切の責任を負いません。暗号通貨は変動性が高いため、十分な調査を行った上で慎重に投資することを強くお勧めします。
このウェブサイトで使用されているコンテンツが著作権を侵害していると思われる場合は、直ちに当社 (info@kdj.com) までご連絡ください。速やかに削除させていただきます。
2026年10月03日 他の動画も公開されています