Attention Is All You Need를 읽으며 다시 본 Transformer의 본질
RNN을 없앴다는 한 문장을 넘어, Transformer가 토큰 사이의 정보 이동을 어떻게 다시 설계했는지 계산 흐름으로 읽었다.
AI Professional로 발돋움하는 과정을 기록하는 공간입니다.
잘못되었거나 부족한 부분이 있을 수 있습니다.
댓글로 피드백 주시면 감사하겠습니다.
Python 기반과 모델 구조부터 애플리케이션 프레임워크, fine-tuning, 추론, 도구 연동과 평가까지. 새로 공부하는 영역을 독립된 세부 주제로 확장해 기록합니다.
chunk 검색만으로 설명되지 않는 질문을 retrieval, GraphRAG, ontology, evaluation으로 나눠 답변 경로 전체를 살펴봅니다.
API, 트랜잭션, 테스트와 성능을 분리해 봅니다. 동작하는 코드를 운영 가능한 코드로 바꾸는 판단을 기록합니다.
배포, 컨테이너, 관측 가능성과 네트워크를 나눠 봅니다. 운영 중 다시 사용할 수 있는 근거와 복구 경로를 남깁니다.
스키마와 인덱스, 그래프·벡터 저장소, 마이그레이션을 분리해 선택의 기준과 운영 근거를 기록합니다.
수집, 메시징, 분산 처리, lakehouse와 품질 관리를 나눠 데이터가 소비자에게 도달하는 전체 경로를 기록합니다.
의사결정, 실패, 학습과 경력 흐름을 나눠 당시의 제약과 선택 이유를 다시 꺼내볼 수 있게 기록합니다.
3개의 기록
RNN을 없앴다는 한 문장을 넘어, Transformer가 토큰 사이의 정보 이동을 어떻게 다시 설계했는지 계산 흐름으로 읽었다.
작은 Shakespeare GPT를 직접 학습하기 전에 필요한 개념과 minGPT의 데이터·forward·loss·학습·생성 흐름을 소스 순서대로 정리했다.
The Illustrated Transformer의 직관을 실제 QKV tensor와 attention 계산 순서로 옮겨, 한 문장이 block을 통과하는 흐름을 다시 그렸다.