최근에 쓴 글부터

최신글

발행한 글 61편을 날짜순으로 모았습니다.

최신글 전체 목록

  1. 01

    Adam에서 L2가 weight decay가 아닌 이유 — AdamW

    Loshchilov·Hutter의 ICLR 2019 Decoupled Weight Decay Regularization 원 논문을 12살 독자 기준으로 해부한다. SGD에서는 같은 L2 penalty와 weight decay가 Adam에서는 왜 달라지는지, Adam의 moment·adaptive denominator, AdamW의 분리된 shrinkage, 원 논문과 PyTorch weight_decay 파라미터화 차이, normalized weight decay의 실험적 범위, 저자 공식 Torch 코드의 실제 순서, Python 3.9.6으로 직접 검증한 SGD 등가성·Adam 불등가성·moment 오염·반복 shrinkage, 성능·운영·LLM fine-tuning 주의점을 사실·직접 실행·해석으로 분리한다.

    읽기 ↗
  2. 02

    Attention Is All You Need 해부: Transformer가 RNN 없이 문장 전체를 읽는 법

    Attention Is All You Need를 RNN의 순차 병목에서 시작해 scaled dot-product attention, multi-head, causal mask, positional encoding, encoder-decoder 실행 경로, 학습·추론·KV cache와 긴 문맥 한계까지 12살도 설명할 수 있게 해부한다.

    읽기 ↗
  3. 03

    BPE는 단어를 외우지 않는다 — Subword와 토큰화의 시작

    Sennrich·Haddow·Birch ACL 2016 원 논문을 기준으로 BPE가 희귀 단어 문제를 왜 문자 쌍 병합으로 바꾸었는지, 학습 corpus에서 merge rule을 만들고 새 문장에 순서대로 적용하는 내부 상태, 단어 경계·어휘·token id의 차이, 원 논문의 character BPE와 현재 subword-nmt 0.2 구현의 end-of-word 차이, Python 3.9.6으로 저자 구현을 직접 실행한 10회 병합·적용·복원, 성능과 LLM token budget의 교환, 실패·재현·운영·대안을 12살 독자가 설명할 수 있게 정리한다.

    읽기 ↗
  4. 04

    Chain-of-Thought Prompting 해부: 답보다 먼저 중간 단계를 쓰면 왜 달라질까

    Wei 외의 Chain-of-Thought Prompting 원 논문을 12세 독자 기준으로 해부한다. few-shot prompt의 입력·중간 추론·최종 답 구조, autoregressive 확률과 token 비용, 원 논문의 ablation·scale·GSM8K 결과, 공개 dataset scorer의 한계, 신뢰성·보안·평가·운영 기준을 논문 사실과 직접 실행으로 나눠 설명한다.

    읽기 ↗
  5. 05

    Claude 3 Sonnet을 3,400만 feature로 분해해도 되는가 — Scaling Monosemanticity

    Templeton 외의 Scaling Monosemanticity 원문을 기준으로 Claude 3 Sonnet middle residual stream을 100만·400만·3,400만 feature SAE로 분해한 실험의 범위, norm-weighted L1, scaling law, feature steering, completeness와 cross-layer superposition 한계를 설명한다. Python 3.9.6으로 scale-cheating을 막는 norm penalty와 reconstruction error를 보존하는 feature clamp를 직접 계산한다.

    읽기 ↗
  6. 06

    DeepSeek-R1 해부: 정답 채점으로 ‘생각하는’ 모델을 길들이는 GRPO와 2단계 RL

    DeepSeek-R1 논문을 DeepSeek-R1-Zero의 순수 강화학습, GRPO의 그룹 상대 보상, cold start·거절 샘플링·두 번째 SFT·두 번째 RL, 보상 해킹과 운영 한계까지 연결해 읽는다. ‘긴 생각’이 왜 성능과 비용을 함께 바꾸는지 직접 계산으로 확인한다.

    읽기 ↗
  7. 07

    DeepSeek-V3 Technical Report 해부: 671B인데 토큰마다 37B만 쓰는 MoE 시스템

    DeepSeek-V3 Technical Report를 MoE 라우팅, MLA KV cache 압축, MTP, FP8 학습, 분산 통신, 사후학습과 배포까지 연결해 읽는다. 671B/37B라는 숫자가 제품의 비용·지연 시간·운영 복잡도에 뜻하는 바를 직접 계산으로 확인한다.

    읽기 ↗
  8. 08

    Direct Preference Optimization 해부: 사람의 A가 B보다 낫다는 말을 어떻게 바로 학습할까

    Rafailov 외의 Direct Preference Optimization을 RLHF의 보상 모델·PPO와 비교해, Bradley–Terry 선호 확률에서 KL 제약 정책까지의 수식 유도, 실제 공개 코드의 token log-probability 경로, 데이터 계약·평가·운영 한계까지 12세 독자 기준으로 해부한다. DPO가 보상·안전·권한 판단을 자동으로 해결하지 않는 이유도 직접 검증 경계와 함께 설명한다.

    읽기 ↗
  9. 09

    FlashAttention 원 논문 해부: attention 행렬을 HBM에 쓰지 않고도 정확히 계산하는 법

    Dao 외의 FlashAttention 원 논문을 12세 독자 기준으로 해부한다. standard attention이 N×N score·probability를 HBM에 materialize하는 병목, 타일과 online softmax의 m·l·누적 output 상태, forward/backward recomputation, IO·FLOP·memory의 구분, 2022 공식 CUDA source 실행 경로, 순수 Python 직접 검증, 정확한 선택·운영 경계를 사실과 해석으로 분리한다.

    읽기 ↗
  10. 10

    GPT-2가 Mary를 고르는 회로 — IOI Circuit

    Wang 외의 Interpretability in the Wild 원문을 기준으로 GPT-2 small이 indirect object identification에서 중복되지 않은 이름을 고르는 26 attention head·7 class circuit, pABC mean ablation, path patching, logit difference, faithfulness·completeness·minimality를 정리한다. Python 3.9.6으로 IOI 최소 알고리즘과 logit difference를 직접 확인한다.

    읽기 ↗
  11. 11

    GQA는 무엇을 공유하는가 — KV Cache 추론 병목 풀기

    Ainslie 외 GQA 원 논문을 기준으로 MHA·MQA·GQA의 query와 key·value 공유 구조, autoregressive KV cache 대역폭 식, MHA checkpoint mean-pooling uptraining, 실험 수치와 한계를 정리한다. Python 3.9.6으로 cache 크기와 group attention 출력을 직접 재현한다.

    읽기 ↗
  12. 12

    Induction Head는 문맥의 다음을 어떻게 복사하는가

    Olsson 외의 In-context Learning and Induction Heads 원문을 기준으로 [A][B] … [A] → [B] 패턴 복사를 구현하는 previous-token head와 induction head의 2-layer 회로, 논문이 정의한 in-context learning score, training phase change와 여섯 줄 증거의 강도, small attention-only model의 인과 증거와 large model의 상관 증거를 분리해 설명한다. Python 3.9.6으로 가장 작은 sequence-copy algorithm을 직접 실행한다.

    읽기 ↗
  13. 13

    Language Models are Few-Shot Learners 해부: GPT-3는 예시 몇 개로 왜 일을 바꿔 하는가

    Language Models are Few-Shot Learners를 GPT-3의 decoder-only 구조, in-context learning, zero/one/few-shot 평가, 175B 규모·300B 토큰 학습, 데이터 혼입과 프롬프트 운영 한계까지 연결해 읽는다. 예시가 가중치를 바꾸지 않아도 출력을 바꾸는 이유를 작은 계산으로 확인한다.

    읽기 ↗
  14. 14

    Llama 3 Herd of Models 해부: LLM 한 개가 아니라 운영 가능한 모델군을 만드는 법

    Llama 3.1을 다룬 The Llama 3 Herd of Models 논문을 데이터, Transformer, 장문 문맥, 사후 학습, 16K GPU 운영, 안전성, 평가까지 연결해 읽는다. 모델 이름과 벤치마크 점수보다 어떤 시스템 선택이 왜 필요한지 설명한다.

    읽기 ↗
  15. 15

    LLM의 답 하나를 역추적할 수 있는가 — Circuit Tracing과 Attribution Graph

    Ameisen 외의 Circuit Tracing 원문을 기준으로 cross-layer transcoder(CLT), clean prompt에서만 원 모델과 일치하는 local replacement model, attribution graph의 네 node와 Jacobian edge, pruning과 intervention validation을 처음부터 설명한다. Python 3.9.6 표준 라이브러리로 cross-layer reconstruction, baseline error 보정, graph influence, finite perturbation 불일치를 직접 계산한다.

    읽기 ↗
  16. 16

    LoRA 원 논문 해부: 큰 모델을 얼리고 작은 저랭크 변화만 학습하는 이유

    Hu 외의 LoRA 원 논문을 12세 독자 기준으로 해부한다. 동결한 사전학습 가중치 W₀에 저랭크 BA 변화만 더하는 수식, rank·scaling·초기화·병합의 내부 실행, 원 논문 실험 조건과 한계, 공식 loralib source·작은 행렬 직접 검증, full fine-tuning·adapter·prompt tuning·QLoRA의 선택 경계를 사실과 해석으로 분리한다.

    읽기 ↗
  17. 17

    MES·SCM 업무 AI의 RAG baseline — Multi-query, Think mode, MCP를 같은 것으로 보지 않는 설계

    MES·SCM 업무 AI에서 Multi-query를 기본 경로로 두면 왜 위험한지, 현재 코드의 실제 호출 경로와 Think mode·MCP tool loop의 차이, Exact·BM25 중심 baseline과 데이터 기반 확장·평가 기준을 정리한다.

    읽기 ↗
  18. 18

    RAG 원 논문 해부: 언어 모델이 문서를 찾아 읽고 답을 만들게 하려면

    Lewis 외의 원 논문 Retrieval-Augmented Generation을 12세 독자도 설명할 수 있게 해부한다. DPR·BART·Wikipedia index·잠재 문서 확률·RAG-Sequence와 RAG-Token의 수식, 공개 구현의 검색·문서 결합·marginalization 경로, 작은 수식 직접 실행, 색인 운영·권한·평가의 실무 경계를 원문 사실과 해석으로 분리한다.

    읽기 ↗
  19. 19

    ReAct 원 논문 해부: 생각하고 도구를 실행하고 관찰로 고치는 에이전트의 최소 원리

    Yao 외의 ReAct 원 논문을 12세 독자 기준으로 해부한다. Thought·Action·Observation의 닫힌 고리, 원 논문의 확장 action space와 prompt·Wikipedia 환경·notebook 실행 흐름, HotpotQA·FEVER·ALFWorld·WebShop 결과, 공개 WikiEnv 상태 전이 직접 검증, tool 권한·멱등성·prompt injection·평가·운영 경계를 사실과 해석으로 분리한다.

    읽기 ↗
  20. 20

    Scaling Laws for Neural Language Models 해부: 같은 GPU 예산에서 모델·데이터·학습을 어떻게 나눌까

    Kaplan 외의 Scaling Laws for Neural Language Models를 파라미터·고유 데이터·학습 연산의 관계, 과적합, 임계 배치, 계산 효율 경계까지 식과 작은 직접 계산으로 해부한다. 2020년 WebText2 결과를 오늘의 고정 처방으로 오해하지 않도록 Chinchilla의 재검증과 운영 선택 절차도 함께 다룬다.

    읽기 ↗
  21. 21

    Training Compute-Optimal Large Language Models 해부: Chinchilla는 왜 더 작고 더 오래 읽었나

    Hoffmann 외의 Training Compute-Optimal Large Language Models를 세 가지 scaling 분석, cosine learning-rate schedule, Chinchilla 70B/1.4T 학습, 데이터 혼합·평가·안전 한계까지 해부한다. 같은 FLOP에서 모델과 token을 함께 키운다는 관찰을 고정 처방으로 오해하지 않도록 직접 계산과 운영 선택 절차를 함께 기록한다.

    읽기 ↗
  22. 22

    Training language models to follow instructions with human feedback 해부: InstructGPT는 사람의 선호를 어떻게 학습했나

    Ouyang 외의 Training language models to follow instructions with human feedback를 SFT·보상 모델·PPO-ptx의 세 단계, 사람 선호 데이터 계약, KL 제약, 평가·안전 한계, 공개 artifact와 직접 산술 검증까지 연결해 해부한다. RLHF가 인간 전체의 가치나 권한 판단을 자동으로 해결하지 않는 이유를 운영 기준과 함께 설명한다.

    읽기 ↗
  23. 23

    Transformer 안에서는 무엇이 흐르는가 — 내부 작동 Primer

    Ferrando 외의 2024 Transformer 내부 작동 primer를 기준으로 decoder-only LLM의 residual stream·attention QK/OV 회로·FFN·unembedding과, input attribution·direct logit attribution·activation patching·probe·sparse autoencoder의 증거 범위를 12살 독자가 구분하도록 설명한다. Python 3.9.6 순수 표준 라이브러리로 작은 1-layer causal Transformer의 attention write·FFN write·residual·logit contribution·activation patching을 직접 실행해 관찰한다.

    읽기 ↗
  24. 24

    Transformer를 회로로 읽는 법 — Residual Stream과 Path

    Elhage 외 Transformer Circuits framework를 기준으로 attention head를 residual stream에 읽고 쓰는 독립 add operation으로 보는 이유, QK·OV 회로, direct path·full OV path·virtual attention head, Q·K·V composition, 고정 attention pattern에서 가능한 path expansion과 실제 model에서의 한계를 12살 독자 기준으로 정리한다. Python 3.9.6으로 2-layer attention-only residual path와 logit 기여 합을 직접 재현한다.

    읽기 ↗
  25. 25

    뉴런보다 많은 feature를 찾는 방법 — Sparse Autoencoder

    Bricken 외의 Towards Monosemanticity 원문을 바탕으로 512개 MLP neuron activation을 4,096개 이상의 sparse feature로 분해하는 sparse autoencoder의 encoder·decoder·L1 loss·unit-norm dictionary·dead feature resampling을 설명한다. 해석가능성, reconstruction, causal intervention이 서로 다른 검증이라는 점과 L1만으로 의미가 보장되지 않는 반례를 Python 3.9.6으로 직접 계산한다.

    읽기 ↗
  26. 26

    단어를 ID가 아니라 좌표로 배우면 못 본 문장도 왜 확률을 가질까

    Bengio·Ducharme·Vincent·Jauvin의 2003년 Neural Probabilistic Language Model 원 논문을 12세 독자 기준으로 해부한다. 희소한 n-gram 표의 한계에서 출발해 공유 embedding table C와 tanh hidden layer, direct path W, full softmax, log likelihood와 perplexity, gradient 흐름, Brown·AP News 결과와 병목, Python 표준 라이브러리 finite difference 직접 검산, Transformer와의 연결과 한계를 사실과 해석으로 분리한다.

    읽기 ↗
  27. 27

    문장을 한 벡터에 접어 넣고 다시 풀어내면 번역이 되는 이유

    Sutskever·Vinyals·Le의 2014년 Sequence to Sequence Learning with Neural Networks 원 논문을 12살 독자 기준으로 해부한다. 길이가 다른 문장을 어떻게 조건부 확률로 번역하는지, LSTM encoder와 decoder, cell state와 gate, EOS, source reversal, 정답 prefix 확률 계산과 beam search, WMT14 실험·384M parameter·8 GPU 병렬화·BLEU의 경계, Python 표준 라이브러리 toy LSTM 직접 재현, fixed vector 병목과 attention·Transformer로 이어지는 이유를 사실과 해석으로 분리한다.

    읽기 ↗
  28. 28

    번역할 다음 단어마다 입력 문장을 다시 보는 법 — Bahdanau Attention

    Bahdanau·Cho·Bengio의 2015년 Neural Machine Translation by Jointly Learning to Align and Translate 원 논문을 12살 독자 기준으로 해부한다. 고정 길이 문장 벡터의 병목, 양방향 RNN annotation, 매 출력 단계마다 달라지는 context vector, additive soft alignment와 softmax, 논문이 실제 사용한 GRU decoder와 maxout 출력, GroundHog 공식 구현의 계산 흐름, WMT14 English-to-French 실험 조건과 BLEU의 경계, Python 3.9.6 수치 재현, 시간·메모리 비용과 Transformer·RAG와의 차이를 사실·직접 실행·해석으로 분리한다.

    읽기 ↗
  29. 29

    신경망은 어떻게 자기 잘못을 모든 가중치에 나눠 줄까: Backpropagation 원 논문 해부

    Rumelhart·Hinton·Williams의 1986년 Backpropagation 원 논문을 12세 독자 기준으로 해부한다. hidden representation과 credit assignment 문제, sigmoid·MSE에서 chain rule로 나오는 gradient, delta·weight·bias·momentum의 실제 계산, 2-2-1 신경망 수치·finite-difference 직접 검산, 원 논문의 대칭·가계도 실험, LLM 학습과의 연결, 수치·운영·한계를 사실과 해석으로 분리한다.

    읽기 ↗
  30. 30

    작은 LLM은 더 오래 생각하면 큰 모델을 이길까: Test-Time Compute 원 논문 해부

    Snell 외의 2024 원 논문을 12세 독자 기준으로 해부한다. test-time compute가 무엇인지, proposer·verifier·process reward model·best-of-N·beam search·revision을 어떻게 한 틀에서 보았는지, 난이도별 compute-optimal routing의 수식과 한계, 14× model 비교의 FLOPs 산술, 논문 재현 불가능 경계와 순수 Python 직접 검산을 사실·직접 확인·해석으로 분리한다.

    읽기 ↗
  31. 31

    층을 더 쌓으면 왜 더 못 배우나 — ResNet의 residual connection

    He·Zhang·Ren·Sun의 CVPR 2016 Deep Residual Learning for Image Recognition 원 논문을 12살 독자 기준으로 해부한다. 층을 늘리면 training error까지 나빠지는 degradation 문제, residual function F(x), identity·projection shortcut, convolution과 feature map의 shape 규칙, original post-activation ResNet-50 병목 block의 공식 Caffe 실행 흐름, ImageNet·CIFAR-10 실험 조건과 수치, Python 3.9.6으로 직접 확인한 forward·projection·gradient 경로, 성능·메모리·운영상의 대가와 Transformer residual connection과의 경계를 사실·직접 실행·해석으로 나눈다.

    읽기 ↗
  32. 32

    한 뉴런에 여러 개념이 들어가는 이유 — Toy Models of Superposition

    Elhage 외의 Toy Models of Superposition 원문을 바탕으로, feature가 neuron보다 많을 때 sparse input과 ReLU가 왜 여러 feature를 하나의 activation direction에 겹쳐 넣게 하는지, interference·phase change·geometry·polysemantic neuron을 작은 2-feature 1-dimension 예제로 끝까지 계산한다. Python 3.9.6으로 antipodal superposition의 성공과 동시 활성화 실패를 직접 검증한다.

    읽기 ↗
  33. 33

    한 사람의 hidden unit만 보고 균형을 맞추는 법 — Layer Normalization

    Ba·Kiros·Hinton의 2016년 Layer Normalization 원 논문을 12살 독자 기준으로 해부한다. BatchNorm이 미니배치에 의존해 RNN과 작은 배치에서 겪는 제약, 한 training case의 hidden unit 전체에서 평균·분산을 구하는 LayerNorm 수식, gain·bias, RNN·LSTM 적용 위치, PyTorch normalized_shape와 eps의 실제 경계, BatchNorm과 다른 invariance, 원 논문의 CNN 한계, Python 3.9.6 수치·gradient 직접 검증, Transformer·RMSNorm과의 차이를 사실·직접 실행·해석으로 분리한다.

    읽기 ↗
  34. 34

    LLM 내부구조 이해용 핵심 논문 리스트

    LLM 내부구조를 아키텍처, 내부 모듈, 기계적 해석가능성, 지식 저장과 수정 순서로 보기 위한 핵심 논문 목록.

    읽기 ↗
  35. 35

    Transformer를 제대로 이해하기 위한 Attention Is All You Need 읽기

    Transformer를 외우는 글이 아니라 설명할 수 있게 이해하는 글. Attention, QKV, multi-head, encoder-decoder, mask, positional encoding을 원 논문 흐름대로 풀어 쓴다.

    읽기 ↗
  36. 36

    머신러닝과 딥러닝의 차이, EZ하게 설명

    AI, 머신러닝, 딥러닝의 관계부터 데이터, 라벨, 모델, 학습, 특징, 신경망까지 처음 보는 사람도 설명할 수 있게 풀어 쓴 입문 글.

    읽기 ↗
  37. 37

    BM25부터 E5-Mistral까지 BGE-M3의 비교 기준을 다시 읽었다

    BGE-M3 논문에 등장하는 BM25·mDPR·mContriever·mE5-large·E5-Mistral-7B의 구조와 학습 조건, 입력 형식, tokenizer 통제와 benchmark 해석을 따로 정리했다.

    읽기 ↗
  38. 38

    pgvector와 HNSW를 밑바닥부터 이해하기

    pgvector가 PostgreSQL에 무엇을 추가하는지부터 HNSW 그래프의 생성·탐색 원리, ANN 후보와 WHERE 필터의 실제 실행 순서, 필터가 recall을 낮추는 이유와 설계 대안까지 소스 기준으로 파고들었다.

    읽기 ↗
  39. 39

    RAG는 모델보다 답을 찾는 경로를 바꾸는 일이었다

    AWS의 RAG 강연을 따라가며 모델 단독 답변, 기본 RAG, 관리형 Knowledge Bases, 고급 검색 파이프라인이 무엇을 다르게 만드는지 정리했다.

    읽기 ↗
  40. 40

    BEIR를 읽고 검색 모델보다 먼저 평가 환경을 의심해야 했다

    BEIR의 zero-shot 검색 결과를 바탕으로 BM25-only가 맞는 조건과 Exact·Dense·Hybrid·Reranker를 선택할 기준, 평가셋의 selection bias를 정리했다.

    읽기 ↗
  41. 41

    BGE-M3를 읽고 하나의 모델로 Dense·Sparse·Multi-vector를 묶으면 정답일까

    BGE-M3가 Dense·learned sparse·multi-vector를 하나의 모델에서 어떻게 학습하고 결합했는지, benchmark 결과와 비용·tokenizer·학습 데이터 조건을 MES 검색 관점에서 검토했다.

    읽기 ↗
  42. 42

    BM25-only가 정답인지 MES·SCM 검색을 질문 유형별로 다시 나눠 봤다

    BEIR·MIRACL·BGE-M3와 검색 엔진 공식 문서를 대조해, MES·SCM 검색을 BM25 하나가 아니라 질문 유형별 경로로 설계해야 하는 이유를 정리했다.

    읽기 ↗
  43. 43

    GPU 내부 구조 Deep Dive: SIMT부터 HBM까지

    CPU의 명령 제출부터 warp와 SM/CU, register·cache·HBM, 그래픽·AI 전용 유닛과 성능 병목까지 GPU 내부 실행 경로를 깊게 추적했다.

    읽기 ↗
  44. 44

    GPU와 LLM의 관계: 연산, 메모리, 학습, 추론, 분산 처리까지

    GPU의 SM·Tensor Core·메모리 계층부터 Transformer 연산, 학습 메모리, prefill/decode, KV cache, quantization과 multi-GPU 병렬화까지 하나의 실행 경로로 정리했다.

    읽기 ↗
  45. 45

    HBM은 LLM 성능을 어디에서 결정하는가

    HBM의 적층 구조와 대역폭 계산부터 LLM의 가중치, KV cache, prefill, decode, 학습과 분산 실행 병목까지 하나의 데이터 이동 문제로 연결했다.

    읽기 ↗
  46. 46

    LLM 수학 00 — 논문을 읽기 위한 전체 지도

    선형대수부터 확률, 미분, Transformer, 검색, fine-tuning과 MCP까지 무엇을 어느 깊이로 알아야 하는지 논문 속 질문을 기준으로 연결한다.

    읽기 ↗
  47. 47

    LLM 수학 01 — 선형대수와 tensor shape

    vector와 matrix의 연산을 embedding, attention, cosine similarity, SVD와 LoRA에 연결하고 모든 계산을 tensor shape로 검증한다.

    읽기 ↗
  48. 48

    LLM 수학 02 — 확률과 정보이론

    조건부확률에서 softmax, negative log-likelihood, entropy, KL divergence와 decoding까지 LLM이 분포를 학습하고 token을 뽑는 계산을 잇는다.

    읽기 ↗
  49. 49

    LLM 수학 03 — 미분과 최적화

    derivative와 chain rule에서 backpropagation을 유도하고, mini-batch gradient, AdamW, clipping, normalization과 numerical precision까지 학습 경로를 계산한다.

    읽기 ↗
  50. 50

    LLM 수학 04 — Transformer를 식으로 한 바퀴

    token id가 embedding, causal self-attention, FFN, vocabulary logit과 loss를 지나고 생성 시 KV cache로 이어지는 전 과정을 식·shape·비용으로 추적한다.

    읽기 ↗
  51. 51

    LLM 수학 05 — 검색과 RAG

    BM25, dense embedding, contrastive loss, ANN, hybrid fusion과 reranking을 비교하고 Recall·MRR·nDCG로 RAG 실패를 retrieval과 generation 단계로 나눈다.

    읽기 ↗
  52. 52

    LLM 수학 06 — Fine-tuning, agent와 MCP

    SFT·LoRA·preference 학습의 objective를 계산하고, tool 선택과 실행 신뢰도를 분리한 뒤 최신 MCP의 host·client·server 계약과 수학의 경계를 정리한다.

    읽기 ↗
  53. 53

    MIRACL을 읽고 다국어 Hybrid baseline을 MES의 정답으로 옮길 수 없는 이유

    MIRACL이 무엇을, 어떻게, 왜 측정했는지 따라가며 BM25+mDPR 결합이 강했던 이유와 예외, 다국어 benchmark를 사내 MES 검색에 일반화할 수 없는 조건을 정리했다.

    읽기 ↗
  54. 54

    nDCG@10은 상위 열 개의 순서를 어떻게 점수로 바꾸는가

    nDCG@10의 gain과 discount, ideal ranking, 정규화를 손으로 계산하고 trec_eval의 실제 구현 차이와 검색 평가에서 놓치기 쉬운 조건을 확인한다.

    읽기 ↗
  55. 55

    Pyserini로 indexing부터 nDCG와 Recall 평가까지 한 흐름으로 묶기

    Pyserini 2.3.0의 구조와 설치 조건을 소스에서 확인하고 작은 corpus의 indexing, BM25 검색, TREC run 생성, nDCG와 Recall 평가를 연결한다.

    읽기 ↗
  56. 56

    RAG에서 청크 개수와 임베딩 차원을 헷갈린 이유

    문서 청크 수와 임베딩 차원을 같은 크기로 보던 오해에서 출발해, Pooling과 저장·검색·생성 단계를 분리하며 RAG의 데이터 흐름을 다시 정리했다.

    읽기 ↗
  57. 57

    RAM과 LLM의 관계: 가중치, KV Cache, 대역폭, 학습 메모리까지

    RAM·VRAM·통합 메모리가 LLM의 가중치 적재, KV Cache, 추론 속도, 동시성, 학습 상태와 어떤 관계를 맺는지 용량과 대역폭 관점에서 계산한다.

    읽기 ↗
  58. 58

    Recall@100은 reranker가 살릴 수 있는 정답의 상한선이다

    Recall@100의 numerator와 denominator를 qrels 기준으로 계산하고 후보 검색의 상한선, macro average, 불완전한 relevance judgment의 함정을 확인한다.

    읽기 ↗
  59. 59

    Attention Is All You Need를 읽으며 다시 본 Transformer의 본질

    RNN을 없앴다는 한 문장을 넘어, Transformer가 토큰 사이의 정보 이동을 어떻게 다시 설계했는지 계산 흐름으로 읽었다.

    읽기 ↗
  60. 60

    minGPT를 시작하기 전에 정리한 Shakespeare GPT의 전체 흐름

    작은 Shakespeare GPT를 직접 학습하기 전에 필요한 개념과 minGPT의 데이터·forward·loss·학습·생성 흐름을 소스 순서대로 정리했다.

    읽기 ↗
  61. 61

    The Illustrated Transformer를 tensor shape으로 다시 읽기

    The Illustrated Transformer의 직관을 실제 QKV tensor와 attention 계산 순서로 옮겨, 한 문장이 block을 통과하는 흐름을 다시 그렸다.

    읽기 ↗