FIELD / RAG / RETRIEVAL
Retrieval
검색 품질을 만드는 각 단계를 분리해 본다
chunking, embedding, filtering과 reranking이 검색 결과에 주는 영향을 비교합니다.
ChunkingEmbeddingHybrid SearchRerankingFilter
세부 주제 소개In progress
chunking, embedding, filtering과 reranking이 검색 결과에 주는 영향을 비교합니다.
ChunkingEmbeddingHybrid SearchRerankingFilter
RAG 세부 주제4개 보기
최신글/ 10
06
Paper Review
07BGE-M3를 읽고 하나의 모델로 Dense·Sparse·Multi-vector를 묶으면 정답일까
BGE-M3가 Dense·learned sparse·multi-vector를 하나의 모델에서 어떻게 학습하고 결합했는지, benchmark 결과와 비용·tokenizer·학습 데이터 조건을 MES 검색 관점에서 검토했다.
2026. 07. 21. · 18분 읽기Paper Review
08BM25-only가 정답인지 MES·SCM 검색을 질문 유형별로 다시 나눠 봤다
BEIR·MIRACL·BGE-M3와 검색 엔진 공식 문서를 대조해, MES·SCM 검색을 BM25 하나가 아니라 질문 유형별 경로로 설계해야 하는 이유를 정리했다.
2026. 07. 21. · 15분 읽기Paper Review
09MIRACL을 읽고 다국어 Hybrid baseline을 MES의 정답으로 옮길 수 없는 이유
MIRACL이 무엇을, 어떻게, 왜 측정했는지 따라가며 BM25+mDPR 결합이 강했던 이유와 예외, 다국어 benchmark를 사내 MES 검색에 일반화할 수 없는 조건을 정리했다.
2026. 07. 21. · 16분 읽기Deep Dive
10Pyserini로 indexing부터 nDCG와 Recall 평가까지 한 흐름으로 묶기
Pyserini 2.3.0의 구조와 설치 조건을 소스에서 확인하고 작은 corpus의 indexing, BM25 검색, TREC run 생성, nDCG와 Recall 평가를 연결한다.
2026. 07. 21. · 19분 읽기Concept Walkthrough
RAG에서 청크 개수와 임베딩 차원을 헷갈린 이유
문서 청크 수와 임베딩 차원을 같은 크기로 보던 오해에서 출발해, Pooling과 저장·검색·생성 단계를 분리하며 RAG의 데이터 흐름을 다시 정리했다.
2026. 07. 21. · 22분 읽기