Study Note원 논문·공식 유도·손계산

LLM 수학 00 — 논문을 읽기 위한 전체 지도

선형대수부터 확률, 미분, Transformer, 검색, fine-tuning과 MCP까지 무엇을 어느 깊이로 알아야 하는지 논문 속 질문을 기준으로 연결한다.

LLM 수학을 공부하려고 목차를 찾으면 미적분, 선형대수, 확률론이 따로 나온다. 그런데 논문은 과목 순서로 쓰이지 않는다. Attention 한 줄 안에 행렬곱, 내적, softmax, 확률분포와 수치 안정성이 동시에 등장한다.

내 목표는 수학 전공 과정을 압축하는 것이 아니다. 다음 질문에 식과 tensor shape로 답할 수 있는 수준을 만드는 것이다.

  • 왜 attention score를 dk\sqrt{d_k}로 나누는가?
  • cross-entropy는 왜 다음 token 학습에 맞는가?
  • cosine similarity와 dot product는 언제 같은 순서를 만드는가?
  • BM25, dense retrieval, reranker는 무엇을 서로 다르게 최적화하는가?
  • LoRA의 rank rr가 parameter 수를 얼마나 줄이는가?
  • temperature, top-kk, top-pp는 같은 조절 장치인가?
  • RAG에서 retriever가 정답을 놓친 것과 generator가 근거를 무시한 것을 어떻게 나누는가?
  • MCP tool 호출은 수학 공식인가, protocol 계약인가?

“이 수학만 알면 모든 LLM 논문을 이해한다”는 경계는 없다. 새로운 architecture, 최적화 이론, 분산 학습 논문은 더 깊은 수학을 요구한다. 이 연재의 도달점은 핵심 식을 피하지 않고, 모르는 기호를 찾아가며, 구현과 평가 조건을 검증할 수 있는 출발선이다.

먼저 구분할 네 가지

값, 모양, 의미, 비용

논문 식을 볼 때 숫자만 계산하면 tensor shape를 놓치고, shape만 보면 그 값이 확률인지 score인지 놓친다. 모든 식에 네 질문을 붙인다.

질문확인할 것attention 예시
각 원소는 어떻게 계산되는가query와 key의 내적
모양입력과 출력 차원은 무엇인가(B,H,T,T)(B,H,T,T)
의미행과 열은 무엇을 가리키는가각 query token이 보는 key token
비용시간과 memory가 어떻게 커지는가sequence length에 대해 O(T2)O(T^2)

여기서 BB는 batch size, HH는 head 수, TT는 token 수, DD는 model dimension으로 계속 사용한다.

정의, 항등식, 근사, 경험 법칙

수식 옆에 이 식의 지위를 적는 습관이 필요했다.

  • 정의 — x2=ixi2\lVert x\rVert_2=\sqrt{\sum_i x_i^2}처럼 기호의 뜻을 정한다.
  • 항등식 — 조건 아래에서 항상 성립한다.
  • 근사 — 계산을 줄이거나 다루기 쉽게 만든다. quantization과 ANN이 여기에 해당한다.
  • 목적 함수 — 학습이 줄이거나 늘리려는 값이다. loss가 작다고 실제 서비스 품질이 자동으로 좋아지는 것은 아니다.
  • 경험 법칙 — 특정 실험 조건에서 관찰한 경향이다. 법칙처럼 보이는 scaling 결과도 데이터·compute 조건을 함께 읽어야 한다.

parameter, hyperparameter, statistic

세 값도 자주 섞인다.

  • parameter θ\theta — 학습으로 갱신되는 weight다.
  • hyperparameter — learning rate, batch size, LoRA rank처럼 사람이 정하거나 탐색한다.
  • statistic — batch mean, evaluation accuracy처럼 데이터에서 계산한다.

LayerNorm의 γ,β\gamma,\beta는 parameter지만, 입력 한 token의 평균 μ\mu와 분산 σ2\sigma^2는 그때 계산하는 statistic이다.

score와 probability

attention logit, retrieval score, reward는 probability가 아닐 수 있다. probability라면 최소한 다음 조건을 만족해야 한다.

pi0,ipi=1p_i \ge 0, \qquad \sum_i p_i = 1

softmax는 임의의 real-valued logit ziz_i를 categorical distribution으로 바꾼다.

pi=softmax(z)i=ezijezjp_i=\operatorname{softmax}(z)_i=\frac{e^{z_i}}{\sum_j e^{z_j}}

반면 cosine similarity는 [1,1][-1,1] 범위의 score다. 그대로 “정답 확률 0.82”라고 부르면 안 된다.

연재가 다루는 최소 수학

01 선형대수와 tensor

01편은 다음을 다룬다.

  • scalar, vector, matrix, tensor와 shape
  • dot product, matrix multiplication, element-wise product
  • transpose, norm, distance, cosine similarity
  • basis, linear independence, rank
  • eigenvalue와 SVD를 알아야 하는 범위
  • embedding, attention, LoRA에 식을 연결하는 방법

도달 기준은 다음 식의 shape를 종이에 적는 것이다.

Q=XWQ,K=XWK,V=XWV,QKRT×TQ=XW_Q,\quad K=XW_K,\quad V=XW_V,\quad QK^\top\in\mathbb{R}^{T\times T}

02 확률과 정보이론

02편은 다음을 연결한다.

  • 조건부확률, Bayes rule
  • random variable, expectation, variance
  • Bernoulli, categorical, Gaussian distribution
  • likelihood와 maximum likelihood
  • log, sigmoid, softmax
  • entropy, cross-entropy, KL divergence, perplexity
  • temperature, top-kk, top-pp sampling

도달 기준은 “softmax와 cross-entropy를 붙이면 왜 정답 logit을 올리는 gradient가 생기는가”를 설명하는 것이다.

03 미분과 최적화

03편은 다음을 다룬다.

  • derivative, partial derivative, gradient, Jacobian
  • chain rule와 backpropagation
  • gradient descent, mini-batch, AdamW
  • vanishing·exploding gradient
  • initialization, residual connection, normalization
  • regularization, gradient clipping, numerical precision

도달 기준은 작은 계산 graph의 forward 값을 구한 뒤 각 parameter의 gradient를 역순으로 계산하는 것이다.

04 Transformer 한 바퀴

04편에서는 흩어진 공식을 하나의 decoder-only Transformer 경로로 합친다.

token id
→ embedding + position
→ masked multi-head self-attention
→ residual + normalization
→ feed-forward network
→ vocabulary logits
→ softmax / cross-entropy

도달 기준은 각 단계의 tensor shape, 학습 때 필요한 값, 생성 때 cache할 값을 분리하는 것이다.

05 검색과 RAG

05편은 검색 system의 수학을 다룬다.

  • TF-IDF와 BM25
  • dense embedding의 dot product와 cosine similarity
  • contrastive learning과 InfoNCE
  • exact nearest neighbor와 ANN의 차이
  • score fusion과 Reciprocal Rank Fusion
  • Cross-Encoder와 ColBERT late interaction
  • Precision, Recall, MRR, MAP, nDCG
  • RAG의 latent document marginalization

도달 기준은 Recall@k가 낮을 때 reranker를 바꾸는 것이 왜 해결책이 아닐 수 있는지 수식으로 설명하는 것이다.

06 Fine-tuning, alignment, agent와 MCP

06편은 다음 경계를 다룬다.

  • SFT objective와 teacher forcing
  • LoRA의 low-rank update와 parameter 수
  • preference probability, RLHF, KL penalty, DPO
  • tool selection을 categorical decision으로 보는 법
  • expected utility, success probability, latency와 retry
  • MCP host·client·server와 protocol lifecycle

MCP 자체는 학습 algorithm이 아니다. JSON-RPC message, schema, capability negotiation, 권한 경계를 정의하는 protocol이다. 수학은 tool 선택과 system 평가를 분석하는 데 도움을 주지만 protocol 문서를 대신하지 않는다.

계속 쓰는 기호

기호자주 나오는 곳
xxscalar 또는 한 sample문맥에 따라 확인
xRD\mathbf{x}\in\mathbb{R}^D길이 DD vectorembedding
XRT×DX\in\mathbb{R}^{T\times D}token TT개의 representationTransformer layer 입력
W,bW,bweight matrix, biaslinear layer
θ\thetamodel parameter 전체pθp_\theta, loss
θL\nabla_\theta LLL의 parameter별 gradientbackpropagation
p(x)p(x)xx의 probability 또는 density확률 model
E[X]\mathbb{E}[X]expectationloss, reward
argmaxi\operatorname*{argmax}_i값을 가장 크게 만드는 indexgreedy decoding
x\lVert x\rVertnormnormalization, distance
\propto상수 배를 제외하고 비례probability derivation
\odotelement-wise productgating
1[A]\mathbf{1}[A]조건 AA가 참이면 1metric, mask

논문마다 row vector와 column vector 관례가 다르다. 기호 모양보다 곱셈이 가능한 shape인지 먼저 확인한다.

합, 평균, log를 먼저 익힌 이유

복잡해 보이는 식도 세 연산의 조합인 경우가 많다.

합과 평균

i=1nxi=x1++xn,xˉ=1ni=1nxi\sum_{i=1}^{n}x_i=x_1+\cdots+x_n,\qquad \bar{x}=\frac{1}{n}\sum_{i=1}^{n}x_i

batch loss는 sample loss의 평균이고, attention output은 value vector의 가중합이다.

oi=j=1Tαijvjo_i=\sum_{j=1}^{T}\alpha_{ij}v_j

여기서 αij\alpha_{ij}는 query ii가 key jj에 준 attention weight다.

log

log는 곱을 합으로 바꾼다.

log(ab)=loga+logb,log(an)=nloga\log(ab)=\log a+\log b,\qquad \log(a^n)=n\log a

sequence probability는 token conditional probability의 곱이다.

p(x1T)=t=1Tp(xtx<t)p(x_{1\ldots T})=\prod_{t=1}^{T}p(x_t\mid x_{<t})

log를 취하면 학습에서 다루기 쉬운 합이 된다.

logp(x1T)=t=1Tlogp(xtx<t)\log p(x_{1\ldots T})=\sum_{t=1}^{T}\log p(x_t\mid x_{<t})

아주 작은 probability를 계속 곱하면 floating-point underflow가 나기 쉽다. log-space 계산은 의미뿐 아니라 수치 안정성에도 중요하다.

지수와 softmax

지수함수는 큰 logit 차이를 더 크게 만든다. z=[1,2]z=[1,2]라면 e2/e1=ee^2/e^1=e다. logit 차이가 1이면 확률 비율은 약 2.718배가 된다.

logit에 같은 상수 cc를 더해도 softmax는 바뀌지 않는다.

ezi+cjezj+c=eceziecjezj=ezijezj\frac{e^{z_i+c}}{\sum_j e^{z_j+c}} = \frac{e^c e^{z_i}}{e^c\sum_j e^{z_j}} = \frac{e^{z_i}}{\sum_j e^{z_j}}

그래서 구현은 가장 큰 logit을 뺀 뒤 exponentiation한다.

softmax(z)=softmax(zmax(z))\operatorname{softmax}(z)=\operatorname{softmax}(z-\max(z))

값은 같지만 overflow 위험은 줄어든다.

논문 식을 읽는 7단계

다음 식을 예로 든다.

Attention(Q,K,V)=softmax(QKdk+M)V\operatorname{Attention}(Q,K,V) = \operatorname{softmax}\left(\frac{QK^\top}{\sqrt{d_k}}+M\right)V
  1. 출력부터 찾는다. 결과는 각 query position의 새 representation이다.
  2. 모든 기호를 정의한다. MM은 미래 token을 막는 causal mask다.
  3. shape를 적는다. QKQK^\top(T,T)(T,T), 여기에 V(T,dv)V(T,d_v)를 곱하면 (T,dv)(T,d_v)다.
  4. 연산 축을 찾는다. softmax는 각 query row의 key 축에 적용한다.
  5. 특수한 경우를 넣는다. T=1T=1이면 attention weight는 1이다.
  6. 숫자 두세 개로 손계산한다. scale과 mask 전후를 비교한다.
  7. 구현과 대조한다. transpose, mask 값, softmax dimension이 식과 같은지 본다.

공식을 읽었는데도 이해가 흐리면 대부분 2번이나 3번이 빠져 있었다.

어디까지 외워야 하나

외워야 할 것은 긴 식이 아니라 역할과 관계다.

바로 떠올릴 것찾아보면서 써도 되는 것
행렬곱 shape 규칙Adam의 bias correction 세부식
dot product와 cosine의 차이BM25 변형별 상수 배치
chain ruleDPO 전체 유도
softmax가 확률분포를 만드는 방식특정 positional encoding 식
cross-entropy와 negative log-likelihood 관계최신 optimizer의 update rule
expectation, variance, KL의 뜻benchmark별 nDCG cutoff

식을 암기한 뒤 적용 지점을 모르면 논문을 읽을 수 없다. 반대로 역할을 알면 정확한 식은 원문에서 다시 확인할 수 있다.

직접 확인할 최소 실습

각 편을 읽은 뒤 library 없이 작은 숫자로 확인한다.

  1. vector 두 개의 dot product와 cosine을 계산한다.
  2. logit 세 개의 stable softmax를 계산한다.
  3. 한 sample의 cross-entropy와 gradient pyp-y를 계산한다.
  4. scalar 계산 graph를 chain rule로 미분한다.
  5. token 두 개, head 하나인 attention을 계산한다.
  6. 문서 세 개에 BM25와 cosine score를 각각 매긴다.
  7. retrieval 결과로 Recall@2, MRR, nDCG를 계산한다.
  8. D×DD\times D weight를 LoRA rank rr로 바꿨을 때 parameter 수를 비교한다.

계산기는 사용해도 된다. 중간값과 shape를 생략하지 않는 것이 더 중요하다.

이 연재로도 부족한 영역

다음 논문을 깊게 읽으려면 추가 수학이 필요하다.

  • scaling law와 uncertainty — 통계적 추정, 회귀, confidence interval
  • diffusion과 continuous-time model — 확률과정, stochastic differential equation
  • state space model — 선형 system, convolution, control theory
  • graph neural network — graph theory, spectral method
  • distributed training — numerical analysis, communication complexity
  • formal verification과 mechanistic interpretability — 논리, causal inference, 더 깊은 선형대수
  • advanced RL — Markov decision process, Bellman equation, policy gradient

부족한 영역이 나왔을 때 전체 수학을 다시 시작하지 않는다. 논문의 중심 식에서 필요한 선수 개념을 역으로 확장한다.

완료 체크리스트

다음 문장에 답할 수 있으면 목표한 출발선에 섰다고 본다.

  • vector, matrix, tensor의 shape를 연산 전후로 적을 수 있다.
  • dot, matmul, element-wise product를 구분한다.
  • softmax, cross-entropy, entropy, KL divergence를 구분한다.
  • chain rule로 두세 단계 graph를 미분할 수 있다.
  • gradient descent와 Adam이 parameter를 어떻게 바꾸는지 설명한다.
  • attention 식의 각 축과 causal mask를 설명한다.
  • autoregressive likelihood와 perplexity 관계를 설명한다.
  • BM25, dense, late interaction, reranker의 score 계산을 구분한다.
  • Recall, MRR, nDCG가 서로 다른 실패를 보는 이유를 설명한다.
  • LoRA의 low-rank update를 shape와 parameter 수로 설명한다.
  • tool 선택의 model probability와 tool 실행 성공률을 분리한다.
  • MCP가 model 학습법이 아니라 context exchange protocol임을 설명한다.

Reference

대화

댓글

0
댓글을 불러오는 중입니다.