AI / LLM
AI와 LLM을 학습하고 구현한 과정을 기록합니다
Python 기반과 모델 구조부터 애플리케이션 프레임워크, fine-tuning, 추론, 도구 연동과 평가까지. 새로 공부하는 영역을 독립된 세부 주제로 확장해 기록합니다.
- Subtopics
- 11
- Published
- 47
분야 소개11개 주제 · 47개 글
Python 기반과 모델 구조부터 애플리케이션 프레임워크, fine-tuning, 추론, 도구 연동과 평가까지. 새로 공부하는 영역을 독립된 세부 주제로 확장해 기록합니다.
세부 주제11개 보기
세부 주제로 좁혀보기
최신글/ 47
나의 Harness Engineering, 프론트엔드 정상화에서 AI를 어떻게 활용했는가
Runup 관리자 화면을 정상화하고 새 페이지를 만들면서 backend XML, DB 시스템 데이터, Figma 레이아웃, frontend 구현을 하나의 검증 루프로 묶은 과정을 복원한다. 화면 코드를 AI로 빨리 생성한 사실보다, AI가 읽을 계약과 사용할 부품, 넘지 못할 경계, 완료를 판정할 evaluator를 어떻게 설계했는지가 Harness Engineering의 본체였음을 설명한다.
2026. 08. 07. · 33분 읽기Kanana-2 SLM 개발기 해부: 3B를 0.9B로 줄이면서 32K 문맥을 남긴 방법
카카오 Kanana-2 SLM 개발기를 처음부터 끝까지 읽는다. 3B Base를 1.3B·0.9B로 압축한 PCA pruning과 cascade distillation, 3:1 hybrid SWA가 32K BF16 KV cache를 4GiB에서 1120MiB로 줄이는 정확한 계산, 모델 크기에 맞춰 갈라진 post-training·임베딩·Elastic Training 판단을 12살도 따라올 수 있는 비유와 재현 가능한 수식으로 풀어낸다.
2026. 07. 29. · 38분 읽기LLM의 말하지 않은 중간 생각을 읽을 수 있는가 — Jacobian Lens와 J-space
Gurnee 외의 2026년 Jacobian Lens 원문과 공개 구현을 기준으로 평균 Jacobian이 intermediate residual을 vocabulary readout으로 옮기는 과정, sparse J-space, coordinate patching, 비용과 한계를 재구성한다. Python 3.9.6 표준 라이브러리 toy로 logit lens와 J-lens의 차이, 평균화, 직교 성분 보존, 1차 근사의 한계를 직접 검증했다.
2026. 07. 26. · 30분 읽기Adam에서 L2가 weight decay가 아닌 이유 — AdamW
Loshchilov·Hutter의 ICLR 2019 Decoupled Weight Decay Regularization 원 논문을 12살 독자 기준으로 해부한다. SGD에서는 같은 L2 penalty와 weight decay가 Adam에서는 왜 달라지는지, Adam의 moment·adaptive denominator, AdamW의 분리된 shrinkage, 원 논문과 PyTorch weight_decay 파라미터화 차이, normalized weight decay의 실험적 범위, 저자 공식 Torch 코드의 실제 순서, Python 3.9.6으로 직접 검증한 SGD 등가성·Adam 불등가성·moment 오염·반복 shrinkage, 성능·운영·LLM fine-tuning 주의점을 사실·직접 실행·해석으로 분리한다.
2026. 07. 24. · 43분 읽기Attention Is All You Need 해부: Transformer가 RNN 없이 문장 전체를 읽는 법
Attention Is All You Need를 RNN의 순차 병목에서 시작해 scaled dot-product attention, multi-head, causal mask, positional encoding, encoder-decoder 실행 경로, 학습·추론·KV cache와 긴 문맥 한계까지 12살도 설명할 수 있게 해부한다.
2026. 07. 24. · 39분 읽기