Inference Systems
생성 과정의 병목을 시스템 관점에서 본다
prefill, decoding, KV cache와 serving 병목을 계산량, 메모리, 지연 시간으로 나눠 봅니다.
세부 주제 소개In progress
prefill, decoding, KV cache와 serving 병목을 계산량, 메모리, 지연 시간으로 나눠 봅니다.
AI / LLM 세부 주제11개 보기
최신글/ 03
Kanana-2 SLM 개발기 해부: 3B를 0.9B로 줄이면서 32K 문맥을 남긴 방법
카카오 Kanana-2 SLM 개발기를 처음부터 끝까지 읽는다. 3B Base를 1.3B·0.9B로 압축한 PCA pruning과 cascade distillation, 3:1 hybrid SWA가 32K BF16 KV cache를 4GiB에서 1120MiB로 줄이는 정확한 계산, 모델 크기에 맞춰 갈라진 post-training·임베딩·Elastic Training 판단을 12살도 따라올 수 있는 비유와 재현 가능한 수식으로 풀어낸다.
2026. 07. 29. · 38분 읽기Chain-of-Thought Prompting 해부: 답보다 먼저 중간 단계를 쓰면 왜 달라질까
Wei 외의 Chain-of-Thought Prompting 원 논문을 12세 독자 기준으로 해부한다. few-shot prompt의 입력·중간 추론·최종 답 구조, autoregressive 확률과 token 비용, 원 논문의 ablation·scale·GSM8K 결과, 공개 dataset scorer의 한계, 신뢰성·보안·평가·운영 기준을 논문 사실과 직접 실행으로 나눠 설명한다.
2026. 07. 24. · 53분 읽기작은 LLM은 더 오래 생각하면 큰 모델을 이길까: Test-Time Compute 원 논문 해부
Snell 외의 2024 원 논문을 12세 독자 기준으로 해부한다. test-time compute가 무엇인지, proposer·verifier·process reward model·best-of-N·beam search·revision을 어떻게 한 틀에서 보았는지, 난이도별 compute-optimal routing의 수식과 한계, 14× model 비교의 FLOPs 산술, 논문 재현 불가능 경계와 순수 Python 직접 검산을 사실·직접 확인·해석으로 분리한다.
2026. 07. 24. · 58분 읽기