어텐션, 멀티 헤드 어텐션 및 전체 Transformer는 PyTorch에서 처음부터 설명하고 처음부터 코딩했으며, 모든 단계는 작은 예와 화면의 모든 텐서 모양에서 수동으로 작업되었습니다. 순환 네트워크가 어려움을 겪는 이유부터 시작하여 단어를 벡터로 바꾸고 한 번에 한 단계씩 관심을 구축합니다. 내적, 소프트맥스, 쿼리, 키 및 값, d_k의 제곱근으로 나누는 이유, 인과 및 패딩 마스크. 그런 다음 다중 헤드 주의: 512 차원을 64개의 8개 헤드로 분할하고, 모든 코드 줄 뒤의 모양을 지정하고, PyTorch의 자체 nn.MultiheadAttention을 확인합니다. 다음으로 Transformer의 나머지 부분은 정현파 위치 인코딩, 잔여 연결 및 LayerNorm, 피드포워드 블록, 인코더 및 디코더 레이어, 교차 주의 및 전체 아키텍처입니다. 마지막으로 GPU에서 실시간으로 훈련하고, 단계별로 디코딩하고, 학습한 어텐션 맵을 살펴봅니다. 핵심 사항: 주의를 기울이면 모든 토큰이 한 단계에서 다른 모든 토큰을 볼 수 있으며 이것이 전체 Transformer입니다. 타임라인 0:00 - 3:55 주의를 기울이는 이유 3:55 - 7:35 단어가 벡터가 됩니다 7:35 - 16:07 주의, 단계별 16:07 - 19:12 마스크 19:12 - 26:50 여러 머리 주의 26:50 - 32:48 위치, 규범 및 피드포워드 32:48 - 38:25 전체 Transformer 38:25 - 44:30 훈련 및 추론 44:30 - 46:50 요약 자세한 내용을 보려면 구독하세요: https://www.youtube.com/@mehdihosseinimoghadam GitHub: https://github.com/mehdihosseinimoghadam LinkedIn: https://linkedin.com/in/mehdi-hosseini-moghadam-384912198 #Transformer #Attention #SelfAttention #MultiHeadAttention #PyTorch #DeepLearning #MachineLearning #LLM #NLP #AI #Python #Attention is All You Need #인공지능