모델 평가(Evaluation, 줄여서 Eval·Evals)는 정해진 데이터·과제·채점 기준으로 모델이나 AI 시스템의 성능을 측정하는 과정입니다. 머신러닝의 기본 평가 원리부터 대규모 언어 모델(LLM)의 답변 품질과 에이전트 작업 수행 평가까지 이어지는 자료를 모았습니다.
벤치마크 점수를 비교할 때는 데이터셋 버전, 프롬프트와 예시, 도구 사용, 추론 예산과 채점 방식을 함께 살펴야 합니다. 실제 서비스에 적용할 때는 해당 서비스의 입력과 실패 사례를 반영한 평가도 필요합니다.
평가 목적과 설계
-
Evaluation best practices — OpenAI · 영문
목표·데이터·지표를 정하는 절차와 자동 채점·사람 평가·LLM 채점의 차이, 변경 후 반복 평가하는 방법을 설명합니다.
-
Holistic Evaluation of Language Models — HELM · 영문
정확도·확률 보정·견고성·공정성·편향·유해성·효율을 함께 평가하고 동일한 조건에서 모델을 비교하는 접근을 제시합니다.
데이터 분리와 평가 지표
-
Cross-validation: evaluating estimator performance — scikit-learn · 영문
학습·검증·테스트 데이터의 역할, 교차 검증과 모델 선택에 사용하지 않은 테스트 데이터가 필요한 이유를 설명합니다.
-
분류의 정확도·재현율·정밀도·F1 — Google · 한국어
혼동 행렬을 바탕으로 분류 지표를 계산하고 클래스 불균형과 오탐·미탐의 비용에 따라 지표를 선택하는 방법을 설명합니다.
사람 평가와 LLM 채점
-
Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena — Zheng 외 · 영문
LLM을 평가자로 사용하는 방법과 사람 선호와의 일치도를 연구하고, 답변 순서·길이와 자신의 답변을 선호하는 경향 등의 채점 편향을 다룹니다.
대표 벤치마크
-
Measuring Massive Multitask Language Understanding — MMLU · 영문
수학·역사·컴퓨터과학 등 여러 분야의 지식과 문제 해결 능력을 측정하는 다중 과제 평가를 제안한 논문입니다.
-
Training Verifiers to Solve Math Word Problems — GSM8K · 영문
여러 단계의 계산이 필요한 수학 문장제 데이터셋 GSM8K와 후보 풀이의 정답 여부를 판별하는 검증 모델을 소개합니다.
-
SWE-bench: Can Language Models Resolve Real-World GitHub Issues? — Jimenez 외 · 영문
실제 Python 저장소의 이슈와 코드베이스를 주고 문제를 해결하도록 수정하는 소프트웨어 공학 평가를 제안합니다.
평가 실행 도구
-
Language Model Evaluation Harness — EleutherAI · 영문
여러 언어 모델과 평가 과제를 공통 인터페이스로 실행하고 프롬프트·예시 수·채점 조건을 설정하는 프레임워크입니다.
-
Inspect — UK AI Security Institute·Meridian Labs · 영문
데이터셋·과제·모델 실행 절차·채점기를 조합해 언어 모델과 도구를 사용하는 에이전트의 평가를 구성하는 프레임워크입니다.
데이터 누출과 벤치마크 오염
-
Common pitfalls and recommended practices — scikit-learn · 영문
테스트 데이터가 전처리·특징 선택·모델 선택에 섞여 성능이 과대평가되는 데이터 누출과 이를 줄이는 방법을 설명합니다.
-
LiveBench: A Challenging, Contamination-Limited LLM Benchmark — White 외 · 영문
평가 문제가 학습 데이터에 섞이는 오염을 줄이기 위해 최근 자료에서 문제를 갱신하고 객관적 정답으로 채점하는 설계를 제안합니다.