FIELD / RAG / RAG-EVALUATION
RAG Evaluation
검색 실패와 생성 실패를 분리해 측정한다
retrieval과 generation의 오류를 나누고 답변 근거성과 재현성을 확인하는 기준을 만듭니다.
RecallFaithfulnessGroundednessDatasetRegression
세부 주제 소개Planned
retrieval과 generation의 오류를 나누고 답변 근거성과 재현성을 확인하는 기준을 만듭니다.
RecallFaithfulnessGroundednessDatasetRegression
RAG 세부 주제4개 보기
최신글/ 03
01
Deep Dive
02MES·SCM 업무 AI의 RAG baseline — Multi-query, Think mode, MCP를 같은 것으로 보지 않는 설계
MES·SCM 업무 AI에서 Multi-query를 기본 경로로 두면 왜 위험한지, 현재 코드의 실제 호출 경로와 Think mode·MCP tool loop의 차이, Exact·BM25 중심 baseline과 데이터 기반 확장·평가 기준을 정리한다.
2026. 07. 24. · 45분 읽기Study Note
03nDCG@10은 상위 열 개의 순서를 어떻게 점수로 바꾸는가
nDCG@10의 gain과 discount, ideal ranking, 정규화를 손으로 계산하고 trec_eval의 실제 구현 차이와 검색 평가에서 놓치기 쉬운 조건을 확인한다.
2026. 07. 21. · 11분 읽기Study Note
Recall@100은 reranker가 살릴 수 있는 정답의 상한선이다
Recall@100의 numerator와 denominator를 qrels 기준으로 계산하고 후보 검색의 상한선, macro average, 불완전한 relevance judgment의 함정을 확인한다.
2026. 07. 21. · 10분 읽기