Transformer
Transformer - Step1 Basic concepts
Encoder와 Decoder, Self-Attention과 Cross-Attention, 원래 Transformer와 GPT의 구조 차이를 정리하고, Attention Is All You Need와 BERT 두 논문을 리뷰한다.
Transformer Step0 - nanoGPT
안드레이 카파시의 nanoGPT 실습을 따라 Bigram부터 Causal Self-Attention, Multi-Head Attention, Transformer Block까지 decoder-only GPT를 직접 구현한다.
No posts match your search.