Kimi K3는 100만 개의 토큰 컨텍스트 창이 있는 2조 8천억 개의 매개변수 개방형 가중치 모델이며 이 비디오에서는 @PyTorch에서 그 뒤에 있는 모든 핵심 아키텍처 아이디어를 처음부터 구현합니다. 논문 링크: https://arxiv.org/abs/2607.24653 블로그: https://www.kimi.ai/blog/kimi-k3 코드 저장소: https://github.com/prasoonmhwr/fromScratch/blob/main/KimiK3/kimiK3.py 이와 같은 콘텐츠를 더 보려면 내 채널을 구독하세요: (https://www.youtube.com/@prasoonmahawarYT) X (트위터): https://www.x.com/prasoonmahawar 인스타그램: (https://www.instagram.com/prasoonmahawar) 👇 여러분의 생각을 댓글로 달아주세요 ╔=╦╗╔╦╗╔=╦=╦╦╦╦╗╔=╗ ║╚╣║║║╚╣╚╣╔╣╔╣║╚╣=╣ ╠╗║╚╝║║╠╗║╚╣║║║║║=╣ ╚=╩==╩=╩=╩=╩╝╚╩=╩=╝ #ai #airesearch #python #pytorch #moonshotai #kimik3 #llm #llms 00:00 — 소개 및 후크 00:05 — 아키텍처 개요 05:12 — 11개의 소설 기고: 로드맵 07:03 — Kimi Delta Attention 13:03 — Gated MLA + NoPE 16:21 — Attention Residual(전체 + 블록) 20:10 — Stable LatentMoE 개요 22:27 — SiTU-GLU 24:44 — Quantile Balancing 26:58 — Per-Head Muon 29:14 — 모델 구성 36:31 — 빌딩 블록: RMSNorm, ShortConv, SiTU-GLU 49:48 — Quantile Balancing 구현 1:01:32 — Stable LatentMoE 구현 1:16:36 — KDA: 반복 전달 + 청크 단위 전달 1:39:04 — Gated MLA 구현 1:40:49 — Block Attention Residuals 구현 1:42:20 — Per-Head Muon 최적화 프로그램 1:43:59 — KimiK3Block 완료 + KimiK3 모델 1:45:31 — 총 11개의 기여 요약 1:47:14 — 결론