CATEGORY / AI-LLM

AI / LLM

AI와 LLM을 학습하고 구현한 과정을 기록합니다

Python 기반과 모델 구조부터 애플리케이션 프레임워크, fine-tuning, 추론, 도구 연동과 평가까지. 새로 공부하는 영역을 독립된 세부 주제로 확장해 기록합니다.

Subtopics
11
Published
47
PythonTransformerLangChainFine-tuningLLM Systems
분야 소개11개 주제 · 47개 글

Python 기반과 모델 구조부터 애플리케이션 프레임워크, fine-tuning, 추론, 도구 연동과 평가까지. 새로 공부하는 영역을 독립된 세부 주제로 확장해 기록합니다.

PythonTransformerLangChainFine-tuningLLM Systems
세부 주제11개 보기
Topic filter

세부 주제로 좁혀보기

전체 47
11 / 11

최신글/ 47

06
ML Foundations · Deep Dive

BPE는 단어를 외우지 않는다 — Subword와 토큰화의 시작

Sennrich·Haddow·Birch ACL 2016 원 논문을 기준으로 BPE가 희귀 단어 문제를 왜 문자 쌍 병합으로 바꾸었는지, 학습 corpus에서 merge rule을 만들고 새 문장에 순서대로 적용하는 내부 상태, 단어 경계·어휘·token id의 차이, 원 논문의 character BPE와 현재 subword-nmt 0.2 구현의 end-of-word 차이, Python 3.9.6으로 저자 구현을 직접 실행한 10회 병합·적용·복원, 성능과 LLM token budget의 교환, 실패·재현·운영·대안을 12살 독자가 설명할 수 있게 정리한다.

2026. 07. 24. · 32분 읽기
07
Inference Systems · Deep Dive

Chain-of-Thought Prompting 해부: 답보다 먼저 중간 단계를 쓰면 왜 달라질까

Wei 외의 Chain-of-Thought Prompting 원 논문을 12세 독자 기준으로 해부한다. few-shot prompt의 입력·중간 추론·최종 답 구조, autoregressive 확률과 token 비용, 원 논문의 ablation·scale·GSM8K 결과, 공개 dataset scorer의 한계, 신뢰성·보안·평가·운영 기준을 논문 사실과 직접 실행으로 나눠 설명한다.

2026. 07. 24. · 53분 읽기
08
ML Foundations · Deep Dive

Claude 3 Sonnet을 3,400만 feature로 분해해도 되는가 — Scaling Monosemanticity

Templeton 외의 Scaling Monosemanticity 원문을 기준으로 Claude 3 Sonnet middle residual stream을 100만·400만·3,400만 feature SAE로 분해한 실험의 범위, norm-weighted L1, scaling law, feature steering, completeness와 cross-layer superposition 한계를 설명한다. Python 3.9.6으로 scale-cheating을 막는 norm penalty와 reconstruction error를 보존하는 feature clamp를 직접 계산한다.

2026. 07. 24. · 20분 읽기
09
Transformer · Deep Dive

DeepSeek-R1 해부: 정답 채점으로 ‘생각하는’ 모델을 길들이는 GRPO와 2단계 RL

DeepSeek-R1 논문을 DeepSeek-R1-Zero의 순수 강화학습, GRPO의 그룹 상대 보상, cold start·거절 샘플링·두 번째 SFT·두 번째 RL, 보상 해킹과 운영 한계까지 연결해 읽는다. ‘긴 생각’이 왜 성능과 비용을 함께 바꾸는지 직접 계산으로 확인한다.

2026. 07. 24. · 42분 읽기
10
Transformer · Deep Dive

DeepSeek-V3 Technical Report 해부: 671B인데 토큰마다 37B만 쓰는 MoE 시스템

DeepSeek-V3 Technical Report를 MoE 라우팅, MLA KV cache 압축, MTP, FP8 학습, 분산 통신, 사후학습과 배포까지 연결해 읽는다. 671B/37B라는 숫자가 제품의 비용·지연 시간·운영 복잡도에 뜻하는 바를 직접 계산으로 확인한다.

2026. 07. 24. · 36분 읽기