CATEGORY / AI-LLM

AI / LLM

AI와 LLM을 학습하고 구현한 과정을 기록합니다

Python 기반과 모델 구조부터 애플리케이션 프레임워크, fine-tuning, 추론, 도구 연동과 평가까지. 새로 공부하는 영역을 독립된 세부 주제로 확장해 기록합니다.

Subtopics
11
Published
47
PythonTransformerLangChainFine-tuningLLM Systems
분야 소개11개 주제 · 47개 글

Python 기반과 모델 구조부터 애플리케이션 프레임워크, fine-tuning, 추론, 도구 연동과 평가까지. 새로 공부하는 영역을 독립된 세부 주제로 확장해 기록합니다.

PythonTransformerLangChainFine-tuningLLM Systems
세부 주제11개 보기
Topic filter

세부 주제로 좁혀보기

전체 47
11 / 11

최신글/ 47

31
Inference Systems · Deep Dive

작은 LLM은 더 오래 생각하면 큰 모델을 이길까: Test-Time Compute 원 논문 해부

Snell 외의 2024 원 논문을 12세 독자 기준으로 해부한다. test-time compute가 무엇인지, proposer·verifier·process reward model·best-of-N·beam search·revision을 어떻게 한 틀에서 보았는지, 난이도별 compute-optimal routing의 수식과 한계, 14× model 비교의 FLOPs 산술, 논문 재현 불가능 경계와 순수 Python 직접 검산을 사실·직접 확인·해석으로 분리한다.

2026. 07. 24. · 58분 읽기
32
ML Foundations · Deep Dive

층을 더 쌓으면 왜 더 못 배우나 — ResNet의 residual connection

He·Zhang·Ren·Sun의 CVPR 2016 Deep Residual Learning for Image Recognition 원 논문을 12살 독자 기준으로 해부한다. 층을 늘리면 training error까지 나빠지는 degradation 문제, residual function F(x), identity·projection shortcut, convolution과 feature map의 shape 규칙, original post-activation ResNet-50 병목 block의 공식 Caffe 실행 흐름, ImageNet·CIFAR-10 실험 조건과 수치, Python 3.9.6으로 직접 확인한 forward·projection·gradient 경로, 성능·메모리·운영상의 대가와 Transformer residual connection과의 경계를 사실·직접 실행·해석으로 나눈다.

2026. 07. 24. · 42분 읽기
33
ML Foundations · Deep Dive

한 뉴런에 여러 개념이 들어가는 이유 — Toy Models of Superposition

Elhage 외의 Toy Models of Superposition 원문을 바탕으로, feature가 neuron보다 많을 때 sparse input과 ReLU가 왜 여러 feature를 하나의 activation direction에 겹쳐 넣게 하는지, interference·phase change·geometry·polysemantic neuron을 작은 2-feature 1-dimension 예제로 끝까지 계산한다. Python 3.9.6으로 antipodal superposition의 성공과 동시 활성화 실패를 직접 검증한다.

2026. 07. 24. · 24분 읽기
34
ML Foundations · Deep Dive

한 사람의 hidden unit만 보고 균형을 맞추는 법 — Layer Normalization

Ba·Kiros·Hinton의 2016년 Layer Normalization 원 논문을 12살 독자 기준으로 해부한다. BatchNorm이 미니배치에 의존해 RNN과 작은 배치에서 겪는 제약, 한 training case의 hidden unit 전체에서 평균·분산을 구하는 LayerNorm 수식, gain·bias, RNN·LSTM 적용 위치, PyTorch normalized_shape와 eps의 실제 경계, BatchNorm과 다른 invariance, 원 논문의 CNN 한계, Python 3.9.6 수치·gradient 직접 검증, Transformer·RMSNorm과의 차이를 사실·직접 실행·해석으로 분리한다.

2026. 07. 24. · 47분 읽기
35
Transformer · Study Note

LLM 내부구조 이해용 핵심 논문 리스트

LLM 내부구조를 아키텍처, 내부 모듈, 기계적 해석가능성, 지식 저장과 수정 순서로 보기 위한 핵심 논문 목록.

2026. 07. 23. · 4분 읽기