BM25부터 E5-Mistral까지 BGE-M3의 비교 기준을 다시 읽었다
BGE-M3 논문에 등장하는 BM25·mDPR·mContriever·mE5-large·E5-Mistral-7B의 구조와 학습 조건, 입력 형식, tokenizer 통제와 benchmark 해석을 따로 정리했다.
제목, 요약, 분야, 태그를 한 번에 검색할 수 있습니다.
22개의 기록
BGE-M3 논문에 등장하는 BM25·mDPR·mContriever·mE5-large·E5-Mistral-7B의 구조와 학습 조건, 입력 형식, tokenizer 통제와 benchmark 해석을 따로 정리했다.
AWS의 RAG 강연을 따라가며 모델 단독 답변, 기본 RAG, 관리형 Knowledge Bases, 고급 검색 파이프라인이 무엇을 다르게 만드는지 정리했다.
BGE-M3가 Dense·learned sparse·multi-vector를 하나의 모델에서 어떻게 학습하고 결합했는지, benchmark 결과와 비용·tokenizer·학습 데이터 조건을 MES 검색 관점에서 검토했다.
BEIR·MIRACL·BGE-M3와 검색 엔진 공식 문서를 대조해, MES·SCM 검색을 BM25 하나가 아니라 질문 유형별 경로로 설계해야 하는 이유를 정리했다.
CPU의 명령 제출부터 warp와 SM/CU, register·cache·HBM, 그래픽·AI 전용 유닛과 성능 병목까지 GPU 내부 실행 경로를 깊게 추적했다.
GPU의 SM·Tensor Core·메모리 계층부터 Transformer 연산, 학습 메모리, prefill/decode, KV cache, quantization과 multi-GPU 병렬화까지 하나의 실행 경로로 정리했다.
선형대수부터 확률, 미분, Transformer, 검색, fine-tuning과 MCP까지 무엇을 어느 깊이로 알아야 하는지 논문 속 질문을 기준으로 연결한다.
vector와 matrix의 연산을 embedding, attention, cosine similarity, SVD와 LoRA에 연결하고 모든 계산을 tensor shape로 검증한다.
조건부확률에서 softmax, negative log-likelihood, entropy, KL divergence와 decoding까지 LLM이 분포를 학습하고 token을 뽑는 계산을 잇는다.
derivative와 chain rule에서 backpropagation을 유도하고, mini-batch gradient, AdamW, clipping, normalization과 numerical precision까지 학습 경로를 계산한다.
token id가 embedding, causal self-attention, FFN, vocabulary logit과 loss를 지나고 생성 시 KV cache로 이어지는 전 과정을 식·shape·비용으로 추적한다.
BM25, dense embedding, contrastive loss, ANN, hybrid fusion과 reranking을 비교하고 Recall·MRR·nDCG로 RAG 실패를 retrieval과 generation 단계로 나눈다.
SFT·LoRA·preference 학습의 objective를 계산하고, tool 선택과 실행 신뢰도를 분리한 뒤 최신 MCP의 host·client·server 계약과 수학의 경계를 정리한다.
MIRACL이 무엇을, 어떻게, 왜 측정했는지 따라가며 BM25+mDPR 결합이 강했던 이유와 예외, 다국어 benchmark를 사내 MES 검색에 일반화할 수 없는 조건을 정리했다.
nDCG@10의 gain과 discount, ideal ranking, 정규화를 손으로 계산하고 trec_eval의 실제 구현 차이와 검색 평가에서 놓치기 쉬운 조건을 확인한다.
Pyserini 2.3.0의 구조와 설치 조건을 소스에서 확인하고 작은 corpus의 indexing, BM25 검색, TREC run 생성, nDCG와 Recall 평가를 연결한다.
문서 청크 수와 임베딩 차원을 같은 크기로 보던 오해에서 출발해, Pooling과 저장·검색·생성 단계를 분리하며 RAG의 데이터 흐름을 다시 정리했다.
RAM·VRAM·통합 메모리가 LLM의 가중치 적재, KV Cache, 추론 속도, 동시성, 학습 상태와 어떤 관계를 맺는지 용량과 대역폭 관점에서 계산한다.
Recall@100의 numerator와 denominator를 qrels 기준으로 계산하고 후보 검색의 상한선, macro average, 불완전한 relevance judgment의 함정을 확인한다.
RNN을 없앴다는 한 문장을 넘어, Transformer가 토큰 사이의 정보 이동을 어떻게 다시 설계했는지 계산 흐름으로 읽었다.
작은 Shakespeare GPT를 직접 학습하기 전에 필요한 개념과 minGPT의 데이터·forward·loss·학습·생성 흐름을 소스 순서대로 정리했다.
The Illustrated Transformer의 직관을 실제 QKV tensor와 attention 계산 순서로 옮겨, 한 문장이 block을 통과하는 흐름을 다시 그렸다.