FIELD / CS / COMPUTER-ARCHITECTURE
Computer Architecture
코드가 명령어와 하드웨어 동작으로 이어지는 경로를 추적한다
CPU, 메모리 계층, 캐시와 명령어 실행 구조가 프로그램 성능에 미치는 영향을 정리합니다.
CPUGPUSIMTInstructionCacheMemory HierarchyPerformance
Published logs / 03
Computer Architecture 기록
01
Deep Dive · NVIDIA CUDA 13.3·Blackwell·Hopper·Turing과 AMD CDNA 4·CDNA 3·HIP 공식 문서 교차 확인
02GPU 내부 구조 Deep Dive: SIMT부터 HBM까지
CPU의 명령 제출부터 warp와 SM/CU, register·cache·HBM, 그래픽·AI 전용 유닛과 성능 병목까지 GPU 내부 실행 경로를 깊게 추적했다.
2026. 07. 21. · 22분 읽기Deep Dive · CUDA 13.3 공식 문서와 Transformer·FlashAttention·ZeRO·PagedAttention·Megatron-LM 원 논문 대조
03GPU와 LLM의 관계: 연산, 메모리, 학습, 추론, 분산 처리까지
GPU의 SM·Tensor Core·메모리 계층부터 Transformer 연산, 학습 메모리, prefill/decode, KV cache, quantization과 multi-GPU 병렬화까지 하나의 실행 경로로 정리했다.
2026. 07. 21. · 20분 읽기Deep Dive · Transformer·MQA·GQA·PagedAttention·FlashAttention·QLoRA·ZeRO·LoRA 원 논문과 NVIDIA·Apple·Hugging Face·PyTorch·Linux·llama.cpp 공식 문서를 대조했다.
RAM과 LLM의 관계: 가중치, KV Cache, 대역폭, 학습 메모리까지
RAM·VRAM·통합 메모리가 LLM의 가중치 적재, KV Cache, 추론 속도, 동시성, 학습 상태와 어떤 관계를 맺는지 용량과 대역폭 관점에서 계산한다.
2026. 07. 21. · 14분 읽기