FIELD / AI-LLM / EVALUATION
Evaluation
정확도 한 줄보다 실패 유형을 먼저 정의한다
재현 가능한 평가셋과 실패 분류를 통해 모델과 시스템의 품질을 구분해 측정합니다.
DatasetMetricsFailure CaseJudgeRegression
세부 주제 소개Planned
재현 가능한 평가셋과 실패 분류를 통해 모델과 시스템의 품질을 구분해 측정합니다.
DatasetMetricsFailure CaseJudgeRegression
AI / LLM 세부 주제11개 보기
최신글/ 00
이 세부 주제는 탐구 중입니다. 직접 확인을 마친 글부터 공개합니다.