Mathematics for LLM
공식을 외우지 않고 모델의 계산 경로를 읽는다
선형대수, 확률·정보이론, 미분·최적화부터 Transformer, 검색, 정렬과 도구 사용에 필요한 수학을 손계산과 tensor shape로 연결합니다.
세부 주제 소개Foundation
선형대수, 확률·정보이론, 미분·최적화부터 Transformer, 검색, 정렬과 도구 사용에 필요한 수학을 손계산과 tensor shape로 연결합니다.
AI / LLM 세부 주제11개 보기
최신글/ 09
Scaling Laws for Neural Language Models 해부: 같은 GPU 예산에서 모델·데이터·학습을 어떻게 나눌까
Kaplan 외의 Scaling Laws for Neural Language Models를 파라미터·고유 데이터·학습 연산의 관계, 과적합, 임계 배치, 계산 효율 경계까지 식과 작은 직접 계산으로 해부한다. 2020년 WebText2 결과를 오늘의 고정 처방으로 오해하지 않도록 Chinchilla의 재검증과 운영 선택 절차도 함께 다룬다.
2026. 07. 24. · 46분 읽기Training Compute-Optimal Large Language Models 해부: Chinchilla는 왜 더 작고 더 오래 읽었나
Hoffmann 외의 Training Compute-Optimal Large Language Models를 세 가지 scaling 분석, cosine learning-rate schedule, Chinchilla 70B/1.4T 학습, 데이터 혼합·평가·안전 한계까지 해부한다. 같은 FLOP에서 모델과 token을 함께 키운다는 관찰을 고정 처방으로 오해하지 않도록 직접 계산과 운영 선택 절차를 함께 기록한다.
2026. 07. 24. · 43분 읽기LLM 수학 00 — 논문을 읽기 위한 전체 지도
선형대수부터 확률, 미분, Transformer, 검색, fine-tuning과 MCP까지 무엇을 어느 깊이로 알아야 하는지 논문 속 질문을 기준으로 연결한다.
2026. 07. 21. · 12분 읽기LLM 수학 01 — 선형대수와 tensor shape
vector와 matrix의 연산을 embedding, attention, cosine similarity, SVD와 LoRA에 연결하고 모든 계산을 tensor shape로 검증한다.
2026. 07. 21. · 16분 읽기LLM 수학 02 — 확률과 정보이론
조건부확률에서 softmax, negative log-likelihood, entropy, KL divergence와 decoding까지 LLM이 분포를 학습하고 token을 뽑는 계산을 잇는다.
2026. 07. 21. · 18분 읽기