LLM 수학을 공부하려고 목차를 찾으면 미적분, 선형대수, 확률론이 따로 나온다. 그런데 논문은 과목 순서로 쓰이지 않는다. Attention 한 줄 안에 행렬곱, 내적, softmax, 확률분포와 수치 안정성이 동시에 등장한다.
내 목표는 수학 전공 과정을 압축하는 것이 아니다. 다음 질문에 식과 tensor shape로 답할 수 있는 수준을 만드는 것이다.
- 왜 attention score를 로 나누는가?
- cross-entropy는 왜 다음 token 학습에 맞는가?
- cosine similarity와 dot product는 언제 같은 순서를 만드는가?
- BM25, dense retrieval, reranker는 무엇을 서로 다르게 최적화하는가?
- LoRA의 rank 가 parameter 수를 얼마나 줄이는가?
- temperature, top-, top-는 같은 조절 장치인가?
- RAG에서 retriever가 정답을 놓친 것과 generator가 근거를 무시한 것을 어떻게 나누는가?
- MCP tool 호출은 수학 공식인가, protocol 계약인가?
“이 수학만 알면 모든 LLM 논문을 이해한다”는 경계는 없다. 새로운 architecture, 최적화 이론, 분산 학습 논문은 더 깊은 수학을 요구한다. 이 연재의 도달점은 핵심 식을 피하지 않고, 모르는 기호를 찾아가며, 구현과 평가 조건을 검증할 수 있는 출발선이다.
먼저 구분할 네 가지
값, 모양, 의미, 비용
논문 식을 볼 때 숫자만 계산하면 tensor shape를 놓치고, shape만 보면 그 값이 확률인지 score인지 놓친다. 모든 식에 네 질문을 붙인다.
| 질문 | 확인할 것 | attention 예시 |
|---|---|---|
| 값 | 각 원소는 어떻게 계산되는가 | query와 key의 내적 |
| 모양 | 입력과 출력 차원은 무엇인가 | |
| 의미 | 행과 열은 무엇을 가리키는가 | 각 query token이 보는 key token |
| 비용 | 시간과 memory가 어떻게 커지는가 | sequence length에 대해 |
여기서 는 batch size, 는 head 수, 는 token 수, 는 model dimension으로 계속 사용한다.
정의, 항등식, 근사, 경험 법칙
수식 옆에 이 식의 지위를 적는 습관이 필요했다.
- 정의 — 처럼 기호의 뜻을 정한다.
- 항등식 — 조건 아래에서 항상 성립한다.
- 근사 — 계산을 줄이거나 다루기 쉽게 만든다. quantization과 ANN이 여기에 해당한다.
- 목적 함수 — 학습이 줄이거나 늘리려는 값이다. loss가 작다고 실제 서비스 품질이 자동으로 좋아지는 것은 아니다.
- 경험 법칙 — 특정 실험 조건에서 관찰한 경향이다. 법칙처럼 보이는 scaling 결과도 데이터·compute 조건을 함께 읽어야 한다.
parameter, hyperparameter, statistic
세 값도 자주 섞인다.
- parameter — 학습으로 갱신되는 weight다.
- hyperparameter — learning rate, batch size, LoRA rank처럼 사람이 정하거나 탐색한다.
- statistic — batch mean, evaluation accuracy처럼 데이터에서 계산한다.
LayerNorm의 는 parameter지만, 입력 한 token의 평균 와 분산 는 그때 계산하는 statistic이다.
score와 probability
attention logit, retrieval score, reward는 probability가 아닐 수 있다. probability라면 최소한 다음 조건을 만족해야 한다.
softmax는 임의의 real-valued logit 를 categorical distribution으로 바꾼다.
반면 cosine similarity는 범위의 score다. 그대로 “정답 확률 0.82”라고 부르면 안 된다.
연재가 다루는 최소 수학
01 선형대수와 tensor
01편은 다음을 다룬다.
- scalar, vector, matrix, tensor와 shape
- dot product, matrix multiplication, element-wise product
- transpose, norm, distance, cosine similarity
- basis, linear independence, rank
- eigenvalue와 SVD를 알아야 하는 범위
- embedding, attention, LoRA에 식을 연결하는 방법
도달 기준은 다음 식의 shape를 종이에 적는 것이다.
02 확률과 정보이론
02편은 다음을 연결한다.
- 조건부확률, Bayes rule
- random variable, expectation, variance
- Bernoulli, categorical, Gaussian distribution
- likelihood와 maximum likelihood
- log, sigmoid, softmax
- entropy, cross-entropy, KL divergence, perplexity
- temperature, top-, top- sampling
도달 기준은 “softmax와 cross-entropy를 붙이면 왜 정답 logit을 올리는 gradient가 생기는가”를 설명하는 것이다.
03 미분과 최적화
03편은 다음을 다룬다.
- derivative, partial derivative, gradient, Jacobian
- chain rule와 backpropagation
- gradient descent, mini-batch, AdamW
- vanishing·exploding gradient
- initialization, residual connection, normalization
- regularization, gradient clipping, numerical precision
도달 기준은 작은 계산 graph의 forward 값을 구한 뒤 각 parameter의 gradient를 역순으로 계산하는 것이다.
04 Transformer 한 바퀴
04편에서는 흩어진 공식을 하나의 decoder-only Transformer 경로로 합친다.
token id
→ embedding + position
→ masked multi-head self-attention
→ residual + normalization
→ feed-forward network
→ vocabulary logits
→ softmax / cross-entropy
도달 기준은 각 단계의 tensor shape, 학습 때 필요한 값, 생성 때 cache할 값을 분리하는 것이다.
05 검색과 RAG
05편은 검색 system의 수학을 다룬다.
- TF-IDF와 BM25
- dense embedding의 dot product와 cosine similarity
- contrastive learning과 InfoNCE
- exact nearest neighbor와 ANN의 차이
- score fusion과 Reciprocal Rank Fusion
- Cross-Encoder와 ColBERT late interaction
- Precision, Recall, MRR, MAP, nDCG
- RAG의 latent document marginalization
도달 기준은 Recall@k가 낮을 때 reranker를 바꾸는 것이 왜 해결책이 아닐 수 있는지 수식으로 설명하는 것이다.
06 Fine-tuning, alignment, agent와 MCP
06편은 다음 경계를 다룬다.
- SFT objective와 teacher forcing
- LoRA의 low-rank update와 parameter 수
- preference probability, RLHF, KL penalty, DPO
- tool selection을 categorical decision으로 보는 법
- expected utility, success probability, latency와 retry
- MCP host·client·server와 protocol lifecycle
MCP 자체는 학습 algorithm이 아니다. JSON-RPC message, schema, capability negotiation, 권한 경계를 정의하는 protocol이다. 수학은 tool 선택과 system 평가를 분석하는 데 도움을 주지만 protocol 문서를 대신하지 않는다.
계속 쓰는 기호
| 기호 | 뜻 | 자주 나오는 곳 |
|---|---|---|
| scalar 또는 한 sample | 문맥에 따라 확인 | |
| 길이 vector | embedding | |
| token 개의 representation | Transformer layer 입력 | |
| weight matrix, bias | linear layer | |
| model parameter 전체 | , loss | |
| 의 parameter별 gradient | backpropagation | |
| 의 probability 또는 density | 확률 model | |
| expectation | loss, reward | |
| 값을 가장 크게 만드는 index | greedy decoding | |
| norm | normalization, distance | |
| 상수 배를 제외하고 비례 | probability derivation | |
| element-wise product | gating | |
| 조건 가 참이면 1 | metric, mask |
논문마다 row vector와 column vector 관례가 다르다. 기호 모양보다 곱셈이 가능한 shape인지 먼저 확인한다.
합, 평균, log를 먼저 익힌 이유
복잡해 보이는 식도 세 연산의 조합인 경우가 많다.
합과 평균
batch loss는 sample loss의 평균이고, attention output은 value vector의 가중합이다.
여기서 는 query 가 key 에 준 attention weight다.
log
log는 곱을 합으로 바꾼다.
sequence probability는 token conditional probability의 곱이다.
log를 취하면 학습에서 다루기 쉬운 합이 된다.
아주 작은 probability를 계속 곱하면 floating-point underflow가 나기 쉽다. log-space 계산은 의미뿐 아니라 수치 안정성에도 중요하다.
지수와 softmax
지수함수는 큰 logit 차이를 더 크게 만든다. 라면 다. logit 차이가 1이면 확률 비율은 약 2.718배가 된다.
logit에 같은 상수 를 더해도 softmax는 바뀌지 않는다.
그래서 구현은 가장 큰 logit을 뺀 뒤 exponentiation한다.
값은 같지만 overflow 위험은 줄어든다.
논문 식을 읽는 7단계
다음 식을 예로 든다.
- 출력부터 찾는다. 결과는 각 query position의 새 representation이다.
- 모든 기호를 정의한다. 은 미래 token을 막는 causal mask다.
- shape를 적는다. 는 , 여기에 를 곱하면 다.
- 연산 축을 찾는다. softmax는 각 query row의 key 축에 적용한다.
- 특수한 경우를 넣는다. 이면 attention weight는 1이다.
- 숫자 두세 개로 손계산한다. scale과 mask 전후를 비교한다.
- 구현과 대조한다. transpose, mask 값, softmax dimension이 식과 같은지 본다.
공식을 읽었는데도 이해가 흐리면 대부분 2번이나 3번이 빠져 있었다.
어디까지 외워야 하나
외워야 할 것은 긴 식이 아니라 역할과 관계다.
| 바로 떠올릴 것 | 찾아보면서 써도 되는 것 |
|---|---|
| 행렬곱 shape 규칙 | Adam의 bias correction 세부식 |
| dot product와 cosine의 차이 | BM25 변형별 상수 배치 |
| chain rule | DPO 전체 유도 |
| softmax가 확률분포를 만드는 방식 | 특정 positional encoding 식 |
| cross-entropy와 negative log-likelihood 관계 | 최신 optimizer의 update rule |
| expectation, variance, KL의 뜻 | benchmark별 nDCG cutoff |
식을 암기한 뒤 적용 지점을 모르면 논문을 읽을 수 없다. 반대로 역할을 알면 정확한 식은 원문에서 다시 확인할 수 있다.
직접 확인할 최소 실습
각 편을 읽은 뒤 library 없이 작은 숫자로 확인한다.
- vector 두 개의 dot product와 cosine을 계산한다.
- logit 세 개의 stable softmax를 계산한다.
- 한 sample의 cross-entropy와 gradient 를 계산한다.
- scalar 계산 graph를 chain rule로 미분한다.
- token 두 개, head 하나인 attention을 계산한다.
- 문서 세 개에 BM25와 cosine score를 각각 매긴다.
- retrieval 결과로
Recall@2, MRR, nDCG를 계산한다. - weight를 LoRA rank 로 바꿨을 때 parameter 수를 비교한다.
계산기는 사용해도 된다. 중간값과 shape를 생략하지 않는 것이 더 중요하다.
이 연재로도 부족한 영역
다음 논문을 깊게 읽으려면 추가 수학이 필요하다.
- scaling law와 uncertainty — 통계적 추정, 회귀, confidence interval
- diffusion과 continuous-time model — 확률과정, stochastic differential equation
- state space model — 선형 system, convolution, control theory
- graph neural network — graph theory, spectral method
- distributed training — numerical analysis, communication complexity
- formal verification과 mechanistic interpretability — 논리, causal inference, 더 깊은 선형대수
- advanced RL — Markov decision process, Bellman equation, policy gradient
부족한 영역이 나왔을 때 전체 수학을 다시 시작하지 않는다. 논문의 중심 식에서 필요한 선수 개념을 역으로 확장한다.
완료 체크리스트
다음 문장에 답할 수 있으면 목표한 출발선에 섰다고 본다.
- vector, matrix, tensor의 shape를 연산 전후로 적을 수 있다.
- dot, matmul, element-wise product를 구분한다.
- softmax, cross-entropy, entropy, KL divergence를 구분한다.
- chain rule로 두세 단계 graph를 미분할 수 있다.
- gradient descent와 Adam이 parameter를 어떻게 바꾸는지 설명한다.
- attention 식의 각 축과 causal mask를 설명한다.
- autoregressive likelihood와 perplexity 관계를 설명한다.
- BM25, dense, late interaction, reranker의 score 계산을 구분한다.
- Recall, MRR, nDCG가 서로 다른 실패를 보는 이유를 설명한다.
- LoRA의 low-rank update를 shape와 parameter 수로 설명한다.
- tool 선택의 model probability와 tool 실행 성공률을 분리한다.
- MCP가 model 학습법이 아니라 context exchange protocol임을 설명한다.
Reference
- Ian Goodfellow, Yoshua Bengio, Aaron Courville. Deep Learning, 2016.
- Ashish Vaswani 외. Attention Is All You Need, 2017.
- Patrick Lewis 외. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks, 2020.
- Edward J. Hu 외. LoRA, 2021.
- Model Context Protocol. Specification 2025-11-25, 현재 확인한 latest revision.
댓글