CATEGORY / AI-LLM

AI / LLM

AI와 LLM을 학습하고 구현한 과정을 기록합니다

Python 기반과 모델 구조부터 애플리케이션 프레임워크, fine-tuning, 추론, 도구 연동과 평가까지. 새로 공부하는 영역을 독립된 세부 주제로 확장해 기록합니다.

Subtopics
11
Published
47
PythonTransformerLangChainFine-tuningLLM Systems
분야 소개11개 주제 · 47개 글

Python 기반과 모델 구조부터 애플리케이션 프레임워크, fine-tuning, 추론, 도구 연동과 평가까지. 새로 공부하는 영역을 독립된 세부 주제로 확장해 기록합니다.

PythonTransformerLangChainFine-tuningLLM Systems
세부 주제11개 보기
Topic filter

세부 주제로 좁혀보기

전체 47
11 / 11

ML Foundations/ 19

01
ML Foundations · Deep Dive

LLM의 말하지 않은 중간 생각을 읽을 수 있는가 — Jacobian Lens와 J-space

Gurnee 외의 2026년 Jacobian Lens 원문과 공개 구현을 기준으로 평균 Jacobian이 intermediate residual을 vocabulary readout으로 옮기는 과정, sparse J-space, coordinate patching, 비용과 한계를 재구성한다. Python 3.9.6 표준 라이브러리 toy로 logit lens와 J-lens의 차이, 평균화, 직교 성분 보존, 1차 근사의 한계를 직접 검증했다.

2026. 07. 26. · 30분 읽기
02
ML Foundations · Deep Dive

Adam에서 L2가 weight decay가 아닌 이유 — AdamW

Loshchilov·Hutter의 ICLR 2019 Decoupled Weight Decay Regularization 원 논문을 12살 독자 기준으로 해부한다. SGD에서는 같은 L2 penalty와 weight decay가 Adam에서는 왜 달라지는지, Adam의 moment·adaptive denominator, AdamW의 분리된 shrinkage, 원 논문과 PyTorch weight_decay 파라미터화 차이, normalized weight decay의 실험적 범위, 저자 공식 Torch 코드의 실제 순서, Python 3.9.6으로 직접 검증한 SGD 등가성·Adam 불등가성·moment 오염·반복 shrinkage, 성능·운영·LLM fine-tuning 주의점을 사실·직접 실행·해석으로 분리한다.

2026. 07. 24. · 43분 읽기
03
ML Foundations · Deep Dive

BPE는 단어를 외우지 않는다 — Subword와 토큰화의 시작

Sennrich·Haddow·Birch ACL 2016 원 논문을 기준으로 BPE가 희귀 단어 문제를 왜 문자 쌍 병합으로 바꾸었는지, 학습 corpus에서 merge rule을 만들고 새 문장에 순서대로 적용하는 내부 상태, 단어 경계·어휘·token id의 차이, 원 논문의 character BPE와 현재 subword-nmt 0.2 구현의 end-of-word 차이, Python 3.9.6으로 저자 구현을 직접 실행한 10회 병합·적용·복원, 성능과 LLM token budget의 교환, 실패·재현·운영·대안을 12살 독자가 설명할 수 있게 정리한다.

2026. 07. 24. · 32분 읽기
04
ML Foundations · Deep Dive

Claude 3 Sonnet을 3,400만 feature로 분해해도 되는가 — Scaling Monosemanticity

Templeton 외의 Scaling Monosemanticity 원문을 기준으로 Claude 3 Sonnet middle residual stream을 100만·400만·3,400만 feature SAE로 분해한 실험의 범위, norm-weighted L1, scaling law, feature steering, completeness와 cross-layer superposition 한계를 설명한다. Python 3.9.6으로 scale-cheating을 막는 norm penalty와 reconstruction error를 보존하는 feature clamp를 직접 계산한다.

2026. 07. 24. · 20분 읽기
05
ML Foundations · Deep Dive

GPT-2가 Mary를 고르는 회로 — IOI Circuit

Wang 외의 Interpretability in the Wild 원문을 기준으로 GPT-2 small이 indirect object identification에서 중복되지 않은 이름을 고르는 26 attention head·7 class circuit, pABC mean ablation, path patching, logit difference, faithfulness·completeness·minimality를 정리한다. Python 3.9.6으로 IOI 최소 알고리즘과 logit difference를 직접 확인한다.

2026. 07. 24. · 13분 읽기