FIELD / AI-LLM / FINE-TUNING

Fine-tuning

목적과 비용에 맞는 모델 적응 방법을 고른다

SFT, LoRA와 PEFT의 학습 흐름을 데이터 준비, 메모리 비용, 평가 기준과 함께 실험합니다.

SFTLoRAPEFTDatasetTraining
세부 주제 소개Planned

SFT, LoRA와 PEFT의 학습 흐름을 데이터 준비, 메모리 비용, 평가 기준과 함께 실험합니다.

SFTLoRAPEFTDatasetTraining
AI / LLM 세부 주제11개 보기

최신글/ 03

01
Deep Dive

Direct Preference Optimization 해부: 사람의 A가 B보다 낫다는 말을 어떻게 바로 학습할까

Rafailov 외의 Direct Preference Optimization을 RLHF의 보상 모델·PPO와 비교해, Bradley–Terry 선호 확률에서 KL 제약 정책까지의 수식 유도, 실제 공개 코드의 token log-probability 경로, 데이터 계약·평가·운영 한계까지 12세 독자 기준으로 해부한다. DPO가 보상·안전·권한 판단을 자동으로 해결하지 않는 이유도 직접 검증 경계와 함께 설명한다.

2026. 07. 24. · 54분 읽기
02
Deep Dive

LoRA 원 논문 해부: 큰 모델을 얼리고 작은 저랭크 변화만 학습하는 이유

Hu 외의 LoRA 원 논문을 12세 독자 기준으로 해부한다. 동결한 사전학습 가중치 W₀에 저랭크 BA 변화만 더하는 수식, rank·scaling·초기화·병합의 내부 실행, 원 논문 실험 조건과 한계, 공식 loralib source·작은 행렬 직접 검증, full fine-tuning·adapter·prompt tuning·QLoRA의 선택 경계를 사실과 해석으로 분리한다.

2026. 07. 24. · 45분 읽기
03
Deep Dive

Training language models to follow instructions with human feedback 해부: InstructGPT는 사람의 선호를 어떻게 학습했나

Ouyang 외의 Training language models to follow instructions with human feedback를 SFT·보상 모델·PPO-ptx의 세 단계, 사람 선호 데이터 계약, KL 제약, 평가·안전 한계, 공개 artifact와 직접 산술 검증까지 연결해 해부한다. RLHF가 인간 전체의 가치나 권한 판단을 자동으로 해결하지 않는 이유를 운영 기준과 함께 설명한다.

2026. 07. 24. · 57분 읽기