FIELD / AI-LLM / EVALUATION
Evaluation
정확도 한 줄보다 실패 유형을 먼저 정의한다
재현 가능한 평가셋과 실패 분류를 통해 모델과 시스템의 품질을 구분해 측정합니다.
DatasetMetricsFailure CaseJudgeRegression
Published logs / 00
Evaluation 기록
이 세부 주제는 탐구 중입니다. 직접 확인을 마친 글부터 공개합니다.
재현 가능한 평가셋과 실패 분류를 통해 모델과 시스템의 품질을 구분해 측정합니다.