FIELD / AI-LLM / EVALUATION

Evaluation

정확도 한 줄보다 실패 유형을 먼저 정의한다

재현 가능한 평가셋과 실패 분류를 통해 모델과 시스템의 품질을 구분해 측정합니다.

DatasetMetricsFailure CaseJudgeRegression
Published logs / 00

Evaluation 기록

이 세부 주제는 탐구 중입니다. 직접 확인을 마친 글부터 공개합니다.