Kim K3 は、100 万トークンのコンテキスト ウィンドウを備えた 2.8 兆パラメータのオープンウェイト モデルであり、このビデオでは、その背後にあるすべてのコア アーキテクチャのアイデアを @PyTorch でゼロから実装しています。ペーパーリンク: https://arxiv.org/abs/2607.24653 ブログ: https://www.kimi.ai/blog/kimi-k3 コードリポジトリ: https://github.com/prasoonmhwr/fromScratch/blob/main/KimiK3/kimiK3.py このようなコンテンツをさらにご覧になりたい場合は、私のチャンネルを購読してください: (https://www.youtube.com/@prasoonmahawarYT) X (Twitter): https://www.x.com/prasoonmahawar Instagram: (https://www.instagram.com/prasoonmahawar) 👇 あなたの考えをコメントしてください ╔═╦╗╔╦╗╔═╦═╦╦╦╦╗╔═╗ ║╚╣║║║╚╣╚╣╔╣╔╣║╚╣═╣ ╠╗║╚╝║║╠╗║╚╣║║║║║═╣ ╚═╩══╩═╩═╩═╩╝╚╩═╩═╝ #ai #airesearch #python #pytorch #moonshotai #kimik3 #llm #llms 00:00 — イントロとフック 00:05 — アーキテクチャの概要 05:12 — 11 の新規貢献: 私たちのロードマップ 07:03 — キミ デルタ アテンション 13:03 — ゲート MLA + NoPE 16:21 — アテンション残差 (フル + ブロック) 20:10 — 安定した LatentMoE の概要 22:27 — SiTU-GLU 24:44 — 分位値バランシング 26:58 — ヘッドごとのミュオン 29:14 — モデル構成36:31 — ビルディング ブロック: RMSNorm、ShortConv、SiTU-GLU 49:48 — Quantile Balancing 実装 1:01:32 — 安定した LatentMoE 実装 1:16:36 — KDA: リカレント フォワード + チャンクワイズ フォワード 1:39:04 — ゲート MLA 実装 1:40:49 — ブロック アテンション残差実装 1:42:20 — Per-Head Muon オプティマイザー 1:43:59 — 完全な KimK3Block + KimK3 モデル 1:45:31 — 11 件の貢献すべての要約 1:47:14 — 結論
免責事項:info@kdj.com
提供される情報は取引に関するアドバイスではありません。 kdj.com は、この記事で提供される情報に基づいて行われた投資に対して一切の責任を負いません。暗号通貨は変動性が高いため、十分な調査を行った上で慎重に投資することを強くお勧めします。
このウェブサイトで使用されているコンテンツが著作権を侵害していると思われる場合は、直ちに当社 (info@kdj.com) までご連絡ください。速やかに削除させていただきます。
2026年08月21日 他の動画も公開されています