FIELD / AI-LLM / TRANSFORMER

Transformer

토큰 사이의 정보 흐름을 계산으로 따라간다

attention, QKV, position encoding과 GPT 구현을 논문, 그림, 코드의 순서로 연결합니다.

AttentionQKVTensor ShapeminGPTGPT
세부 주제 소개Active

attention, QKV, position encoding과 GPT 구현을 논문, 그림, 코드의 순서로 연결합니다.

AttentionQKVTensor ShapeminGPTGPT
AI / LLM 세부 주제11개 보기

최신글/ 11

01
Deep Dive

Attention Is All You Need 해부: Transformer가 RNN 없이 문장 전체를 읽는 법

Attention Is All You Need를 RNN의 순차 병목에서 시작해 scaled dot-product attention, multi-head, causal mask, positional encoding, encoder-decoder 실행 경로, 학습·추론·KV cache와 긴 문맥 한계까지 12살도 설명할 수 있게 해부한다.

2026. 07. 24. · 39분 읽기
02
Deep Dive

DeepSeek-R1 해부: 정답 채점으로 ‘생각하는’ 모델을 길들이는 GRPO와 2단계 RL

DeepSeek-R1 논문을 DeepSeek-R1-Zero의 순수 강화학습, GRPO의 그룹 상대 보상, cold start·거절 샘플링·두 번째 SFT·두 번째 RL, 보상 해킹과 운영 한계까지 연결해 읽는다. ‘긴 생각’이 왜 성능과 비용을 함께 바꾸는지 직접 계산으로 확인한다.

2026. 07. 24. · 42분 읽기
03
Deep Dive

DeepSeek-V3 Technical Report 해부: 671B인데 토큰마다 37B만 쓰는 MoE 시스템

DeepSeek-V3 Technical Report를 MoE 라우팅, MLA KV cache 압축, MTP, FP8 학습, 분산 통신, 사후학습과 배포까지 연결해 읽는다. 671B/37B라는 숫자가 제품의 비용·지연 시간·운영 복잡도에 뜻하는 바를 직접 계산으로 확인한다.

2026. 07. 24. · 36분 읽기
04
Deep Dive

FlashAttention 원 논문 해부: attention 행렬을 HBM에 쓰지 않고도 정확히 계산하는 법

Dao 외의 FlashAttention 원 논문을 12세 독자 기준으로 해부한다. standard attention이 N×N score·probability를 HBM에 materialize하는 병목, 타일과 online softmax의 m·l·누적 output 상태, forward/backward recomputation, IO·FLOP·memory의 구분, 2022 공식 CUDA source 실행 경로, 순수 Python 직접 검증, 정확한 선택·운영 경계를 사실과 해석으로 분리한다.

2026. 07. 24. · 45분 읽기
05
Deep Dive

Language Models are Few-Shot Learners 해부: GPT-3는 예시 몇 개로 왜 일을 바꿔 하는가

Language Models are Few-Shot Learners를 GPT-3의 decoder-only 구조, in-context learning, zero/one/few-shot 평가, 175B 규모·300B 토큰 학습, 데이터 혼입과 프롬프트 운영 한계까지 연결해 읽는다. 예시가 가중치를 바꾸지 않아도 출력을 바꾸는 이유를 작은 계산으로 확인한다.

2026. 07. 24. · 34분 읽기