| 분류 | 인공지능과 머신러닝의 시스템 평가 방법[1] |
|---|---|
| 정의 | 공통 조건에서 시스템을 비교하기 위해 정한 평가 명세(과제, 절차, 채점 규칙, 보고 방식 포함)[2] [3] [4] |
| 구성 요소 | 목표 능력이나 속성, 과제 또는 시험 항목, 평가 절차, 채점 규칙 하나 이상, 보고 절차[2] [3] |
| 주요 쓰임 | 실험 결과 비교, 모델 약점 파악, 발전 추적[2] [3] |
| 해석 한계 | 점수는 특정 설계에서의 성능 근거일 뿐이며, 지능이나 배포에 필요한 모든 속성을 직접 재지는 않는다[2] [4] |
쉽게 말하면, 벤치마크는 여러 AI 시스템을 같은 조건과 같은 채점 방식으로 겨뤄 보게 하는 정해진 평가 틀이다. 시험 문제, 채점 규칙, 결과를 적는 방식까지 미리 정해 두어야 점수를 서로 비교할 수 있다. 다만 벤치마크 점수는 그 시험 설계 안에서의 성능을 보여 줄 뿐, 지능 전체나 실제 현장에서 필요한 모든 능력을 직접 보여 주지는 않는다.[1]
1. 개요
AI와 머신러닝에서 벤치마크(benchmark)는 공통 조건에서 시스템을 비교하기 위해 정한 평가 명세다. AI와 머신러닝 분야에서 쓰이며, 보통 목표 능력이나 속성, 과제 또는 시험 항목 묶음, 평가 절차, 하나 이상의 채점 규칙, 결과 보고 절차를 함께 담는다. 따라서 점수는 그 설계에서 나온 성능의 근거일 뿐, 지능이나 배포에 필요한 모든 속성을 직접 재는 값은 아니다.[2][3][4][1]
벤치마크는 실험 결과를 비교하기 쉽게 만들고, 모델의 약점을 드러내며, 발전 추이를 추적하는 데 쓰인다. 과제, 지표, 집계 규칙의 선택이 어떤 개선이 드러나는지를 정하므로 연구의 방향에도 영향을 준다. 유용한 벤치마크는 무엇을 재려는지, 무엇을 제외했는지, 예시를 어떻게 뽑고 검증했는지, 시스템이 시험과 어떻게 상호작용할 수 있는지, 불확실성이 비교에 어떻게 반영돼야 하는지를 밝힌다.[2][3][1]
2. 정의와 범위
벤치마크라는 말은 서로 관련된 여러 대상을 가리키는 데 쓰인다. 관례적인 지표를 가진 고정 데이터셋, 비공개 테스트 서버를 쓰는 경쟁, 여러 데이터셋을 묶은 묶음, 에이전트가 행동하고 관찰 결과를 받는 대화형 환경을 뜻할 수 있다. 보고된 결과 자체를 느슨하게 가리키기도 한다. 데이터셋만으로는 평가 방식이 정해지지 않으므로 이 뜻들을 구분해 두는 것이 중요하다.[1]
벤치마크는 일반적인 모델 평가와도 다르다. 평가(evaluation)는 시스템이 특정 목적에 적합한지를 판단하는 더 넓은 과정으로, 벤치마크 결과 외에도 안전성 시험, 레드팀 평가, 사용자 연구, 비용 측정, 모니터링, 응용 분야별 검증을 포함할 수 있다. 벤치마크는 그 과정 안에서 반복 가능한 측정 절차를 제공한다.[1]
벤치마크는 과학적 주장과도 다르다. '82퍼센트 정확도'처럼 결과는 항목 모집단, 응답 형식, 모델 설정, 채점 코드가 정해진 뒤에야 성능을 나타낸다. '모델이 추론을 잘한다'처럼 더 넓은 진술에는 측정한 과제가 실제로 추론을 나타낸다는 논거, 그리고 그 과제가 주로 암기, 형식 준수, 언어 익숙함 같은 다른 요인을 재는 것이 아니라는 근거가 추가로 필요하다. 의도한 현상과 시험이 만든 근거를 잇는 이 연결을 구성 타당도(construct validity)라고 한다.[2][4][1]
3. 구성 요소
3.1. 목표 현상과 용도
설계는 벤치마크가 알려 주려는 현상이나 결정을 정하는 데서 시작한다. 예를 들어 사진 속 사물 인식, 과제 사이의 언어 지식 전이, 기능적으로 올바른 프로그램 생성, 도구를 쓰면서 정책 따르기, 사람의 선호 충족 등이 있다. 추론, 도움됨, 안전성, 범용 능력 같은 넓은 이름표는 정의가 달라지면 과제와 해석도 달라지므로 조작적 정의(operational definition)가 필요하다.[2][1]
용도를 정할 때는 관련 시스템과 적용 환경을 밝혀야 한다. 도구 없이 사전 학습된 언어 모델을 비교하도록 설계된 시험은 검색 기능을 갖춘 어시스턴트에 관한 주장을 자동으로 뒷받침하지 않으며, 샌드박스에서 돌린 대화형 에이전트 시험이 변화하는 실제 운영 환경의 신뢰성을 그 자체로 보여 주지는 않는다. 벤치마크 문서는 포함된 모집단, 언어, 모달리티, 분야, 배포 조건과 함께 제외된 사례도 적어야 한다.[1]
3.2. 과제, 항목, 데이터
과제는 평가 대상 시스템이 무엇을 받고 무엇을 산출하거나 수행해야 하는지를 정한다. 항목은 이미지와 분류 라벨, 질문과 허용 정답, 입력 문장과 참조 번역, 저장소 상태와 이슈 설명, 초기 컴퓨터 환경과 목표 등이 될 수 있다. 대화형 벤치마크는 허용 행동, 도구, 관찰 결과, 시간 제한, 종료 조건도 함께 정하기도 한다.[1]
항목은 더 큰 과제 공간에서 뽑은 표본이다. 표본을 얻고 고르는 방식이 점수로 무엇을 추론할 수 있는지를 좌우한다. 표집 틀이 적절할 때 무작위 표집이나 층화 표집은 정의된 모집단에 대한 주장을 뒷받침할 수 있다. 목표 표집은 알려진 실패 유형을 탐색할 수 있다. 전문가가 쓰거나 적대적으로 만든 항목은 난도를 높이지만 더 좁거나 의도적으로 특이한 분포를 나타낼 수 있다. 편의 표본은 모으기 쉬우나 중요한 사례를 빠뜨릴 수 있다. 최근 대규모 언어 모델 벤치마크 445개를 검토한 연구는 대표성 있는 표집, 항목 품질 점검, 명시적인 포괄 범위 경계를 구성 타당도의 핵심으로 꼽았다.[2][1]
주석에는 분류 라벨, 허용 정답, 근거 설명, 선호도, 단위 테스트, 환경 상태 등이 포함될 수 있다. 신뢰도는 지시문, 주석자 자격, 조정 절차, 모호한 사례의 처리 방식에 달려 있다. 의견 불일치를 버리는 벤치마크는 실제 모호함을 가릴 수 있고, 모든 주석자 투표를 똑같이 권위 있게 다루면 잡음이 늘 수 있다. 과제에 여러 정답이 가능한데 지표나 조정 절차가 대안을 인정하지 않으면, 참조 정답 하나로는 성능이 과소평가될 수 있다.[1]
3.3. 평가 절차
프로토콜은 시스템을 어떻게 실행하는지 정한다. 전처리, 프롬프트 템플릿, 문맥에 보여 주는 예시, 디코딩 설정, 난수 시드, 도구 접근 권한, 검색 출처, 시간과 연산 예산, 재시도 규칙, 후처리나 답안 파서가 포함된다. 에이전트의 경우 환경 버전, 초기 상태, 사용 가능한 인터페이스, 행동 제한, 초기화 절차도 프로토콜에 들어간다.[1]
이 세부 사항들은 측정의 일부다. 의미는 같아도 프롬프트 형식, 퓨샷 예시, 샘플링 온도가 다르면 모델이 다른 점수를 받을 수 있다. 도구 접근을 허용하면 측정 대상이 도구 없는 기억에서 정보 탐색이나 실행으로 바뀐다. 여러 번 시도를 허용하는 것은 한 번만 허용하는 것과 다른 운영점을 측정한다. 따라서 결과에는 제품군 이름만 붙이지 말고 정확한 모델 버전과 설정을 밝혀야 한다.[1]
3.4. 채점과 집계
채점 함수는 출력이나 행동 궤적을 항목 단위 결과로 바꾼다. 지표는 이진 성공 여부, 정확도, F1, 중첩 측정, 실행 성공 여부, 연속적인 품질 점수, 사람의 선호, 비용을 반영한 값일 수 있다. 이후 집계 단계에서 항목, 과제, 주석자, 반복 실행 결과를 합친다. 매크로 평균은 각 집단에 같은 가중치를 주고 마이크로 평균은 관측치에 가중치를 준다. 기하평균과 최소 점수는 또 다른 절충 관계를 만든다. 하나의 집계 값은 분야별, 인구통계 집단별, 언어 집단별로 중요한 차이를 가릴 수 있다.[1]
모든 점수의 방향, 범위, 단위, 기준값은 명시해야 한다. 여러 지표를 보고할 때는 어느 것이 주 지표인지, 지표 사이에 절충이 예상되는지를 설명해야 한다. 예를 들어 HELM은 정확도를 유일한 관련 차원으로 보지 않고, 정확도, 보정(calibration), 강건성, 공정성, 편향, 독성, 효율성 등 여러 측정치로 일반적인 언어 모델 시나리오를 평가하도록 설계됐다.[5][1]
3.5. 보고와 비교
완전한 보고서에는 대표 평균만이 아니라 과제별 또는 하위 집단별 결과를 포함해야 한다. 기준선, 불확실성 추정치, 평가 날짜, 코드와 데이터 버전, 제외한 항목, 실패한 실행, 시도 횟수도 함께 적어야 한다. 결과가 유료 API나 계속 바뀌는 서비스에 의존한다면, 나중의 호출이 같은 시스템을 재현하지 못할 수 있으므로 접근 날짜와 반환된 모델 식별자가 중요하다.[1]
BetterBench 연구(2024년)는 AI 벤치마크 표본 전반의 수명 주기 관행을 평가했다. 연구진은 벤치마크 품질의 차이가 크다는 것을 발견했고, 평가한 벤치마크 대다수가 통계적 유의성을 보고하지 않았고 결과를 재현하기 쉽게 만들지도 않았다고 보고했다. 이 연구의 점검표는 명확한 지표 정의, 불확실성 보고, 라이선스, 유지 관리, 피드백 채널을 선택 사항인 표현 세부 사항이 아니라 벤치마크 품질의 일부로 다룬다.[1][3]
4. 데이터 분할과 정보 경계
4.1. 학습·개발·시험 데이터
전통적인 지도 학습형 벤치마크에서는 학습 분할로 모델 매개변수를 맞추고, 개발(검증) 분할로 모델과 설정을 고르며, 시험 세트로 최종 성능을 추정할 수 있다. 시험 세트가 본 적 없는 예시에 대한 성능을 추정하려는 것이라면 학습이나 모델 선택에 참여하지 않아야 한다. 팀이 시험 세트의 피드백을 보며 반복해서 조정하면 시험 세트는 점차 개발 데이터처럼 작동하게 된다.[1]
모든 벤치마크가 학습 데이터를 제공하는 것은 아니다. 제로샷과 퓨샷 평가는 예시나 지시문만 공개할 수 있다. 에이전트 벤치마크는 라벨이 붙은 학습 분할 대신 환경을 제공하기도 한다. 벤치마크는 어떤 데이터를 쓸 수 있는지, 외부 데이터나 검색이 허용되는지, 평가 분포에서 나온 시범 예시를 프롬프트에 넣어도 되는지를 명시해야 한다.[1]
4.2. 공개 시험과 비공개 시험
공개 시험 항목은 검사, 오류 분석, 독립적인 구현을 쉽게 만든다. 그러나 특히 학습 말뭉치를 공개 웹에서 모을 때 항목이 그대로 노출될 가능성도 커진다. 숨긴 라벨이나 숨긴 항목은 직접 접근을 줄이지만 타당성을 보장하지는 않는다. 항목이 여전히 학습 출처와 겹칠 수 있고, 서버에 반복해서 질의하면 홀드아웃 항목에 대한 정보가 드러날 수도 있다.[1]
비공개 평가는 제출 횟수 제한, 감사된 코드 실행, 지연되거나 거친 피드백, 개발 중 쓰이지 않은 최종 비공개 시험과 함께 쓸 때 가장 유용하다. 반대로 비밀이 유지되면 주석 오류나 인구통계적 공백을 찾기 어려워진다. 적절한 설계는 위협 모델, 원하는 재현성, 참가자나 모델 개발자를 시험에 얼마나 신뢰할 수 있는지에 따라 달라진다.[1]
4.3. 교차 검증과 중첩 선택
데이터가 제한적이면 교차 검증은 보류(held-out) 폴드를 돌려 가며 성능을 추정한다. 하이퍼파라미터는 나중에 편향 없는 최종 평가로 취급되는 보류 관측값을 쓰지 않고 골라야 한다. Cawley와 Talbot은 잡음이 있는 모델 선택 기준을 최적화하면 그 기준에 과적합될 수 있고, 일부 설정에서는 그 선택 편향의 크기가 학습 알고리즘 사이에 보고된 차이와 비슷할 수 있음을 보였다.[6] 중첩 교차 검증이나 별도의 최종 시험을 쓰면 선택과 추정을 분리할 수 있다.[1]
분할 단위도 중요하다. 관련된 관측치가 같은 환자, 문서, 화자, 코드 저장소, 시기, 원본 템플릿을 공유하면 행을 무작위로 나누는 것만으로는 부족하다. 목표 일반화 대상이 새로운 집단이나 미래 시기라면 집단별 분할이나 시간순 분할이 필요하다. 분할 사이에 거의 중복된 항목이 있으면 라벨을 명시적으로 재사용하지 않았더라도 평가가 쉬워질 수 있다.[1]
5. 공통 지표
보편적으로 적합한 지표는 없다. 지표는 의도한 속성에 대응해야 하고, 의미 있는 변화에 예측 가능하게 반응해야 하며, 무관한 행동에 보상하지 않아야 한다.[1]
5.1. 분류와 검색
정확도는 허용된 라벨을 올바르게 부여받은 항목의 비율이다. 라벨이 믿을 만하고 클래스나 오류 비용이 어느 정도 균형 잡혀 있을 때 해석하기 쉽다. 심한 불균형이 있으면 정확도가 높아도 드문 클래스를 잘 찾지 못할 수 있다. 정밀도와 재현율, F1 점수는 서로 다른 오류 유형을 구분하지만 여전히 클래스 정의와 임곗값에 달려 있다.[1]
AUC 계열 지표는 여러 임계값에 걸친 성능을 요약한다. 보정 지표는 제시된 확률이 관찰된 빈도와 맞는지 묻는다. 순위와 검색 과제에서는 평균 역순위(MRR), 기준 순위까지의 재현율, 정규화 할인 누적 이득(nDCG)을 쓸 수 있다. 각 측정치는 어떤 위치와 오류가 중요한지에 대한 관점을 담고 있다. 따라서 상호 보완적인 여러 측정치를 보고하는 편이 너무 일찍 하나로 합치는 것보다 흔히 더 많은 정보를 준다.[1]
5.2. 텍스트 생성
BLEU는 수정된 n-그램 정밀도와 짧기 패널티(brevity penalty)를 써서 후보 번역을 참조 번역과 비교한다.[7] ROUGE는 요약 평가를 위해 개발된 중첩 기반 측정치 계열이다.[8] METEOR는 후보 단어와 참조 단어를 정렬하고 정확 일치, 어간, 동의어 자원을 쓸 수 있으며, 단순히 또 하나의 n-그램 정밀도 점수가 아니다.[9]
참조 중첩 지표는 재현 가능하고 비용이 적게 든다. 그러나 중첩이 낮은 출력도 타당할 수 있고, 중첩이 높은 출력도 사실상 틀릴 수 있다. 유용성은 과제, 언어, 토큰화 방식, 참조 집합, 의미 변이의 정도에 따라 달라진다. 개방형 출력에서는 사람 평가나 과제별 사실성, 유용성 점검이 필요할 수 있다.[1]
정확 일치는 정답이 하나로 정해진 짧은 답을 안정적으로 정규화할 수 있을 때 적합하다. 정규화 절차 자체가 지표의 일부다. 대소문자 통일, 구두점 제거, 단위 변환, 수치 허용 오차, 인정되는 별칭이 결과를 바꿀 수 있다. 자동 파서는 특히 모델에게 JSON 같은 구조화된 형식을 요구할 때 잘못된 거부와 잘못된 수락이 없는지 시험해야 한다.[2][1]
5.3. 코드와 검증 가능한 출력
실행 기반 지표는 생성된 코드, 증명, 데이터베이스 질의, 행동을 평가기에 넣어 돌려 본다. HumanEval은 사람이 직접 작성한 프로그래밍 문제를 도입하고 단위 테스트로 기능적 정확성을 측정했다.[10] 관련된 Pass@k 계열은 샘플링한 여러 해 가운데 적어도 하나가 통과할 확률을 추정하므로, k 값, 생성한 샘플 수, 샘플링 분포를 점수와 함께 제시해야 한다.[1]
기능적 과제에서는 실행이 텍스트 유사도보다 강한 기준이지만, 평가기만큼만 완전하다. 단위 테스트가 부족하면 잘못된 구현을 통과시킬 수 있고, 비결정적 의존성은 결과를 바꿀 수 있으며, 안전하지 않은 코드는 격리가 필요하다. 테스트를 통과해도 효율, 보안, 유지보수성, 이슈 의도에 대한 부합 여부는 측정되지 않은 채 남을 수 있다.[1]
5.4. 사람 선호와 쌍별 비교
개방형 어시스턴트는 흔히 블라인드 쌍별 선택으로 비교한다. Chatbot Arena는 두 모델의 익명 응답을 보여 주고 크라우드소싱으로 모은 선호 투표를 집계했다. 2024년 논문은 이 단계에서 수집된 24만 건 이상의 투표를 분석했다.[11] 쌍별 데이터는 레이팅이나 추정 승률로 바꿀 수 있지만, 통계 모델, 표본 추출 정책, 동점 처리, 사용자 집단, 신뢰 구간이 모두 순위에 영향을 준다.[1]
선호는 단일한 객관적 사실이 아니다. 평가자는 정확성, 문체, 안전성, 간결함, 창의성을 서로 다르게 중시하므로 의견이 갈릴 수 있다. 자발적으로 참여한 사용자가 제시한 프롬프트는 실제 배포 집단을 대표하지 않을 수 있다. 선호 리더보드는 평가자와 프롬프트 분포를 문서화해야 하며, 작은 레이팅 차이를 보편적인 능력 차이로 해석하지 않아야 한다.[1]
5.5. 자동 판정기
언어 모델은 루브릭을 써서 개방형 응답을 채점하거나 비교할 수 있다. 이렇게 하면 비용이 줄고 대규모 실험이 가능해지지만, 측정 과정에 또 다른 모델이 끼어든다. NeurIPS 2023 발표의 LLM 평가자 연구는 위치 편향, 장황함 편향, 추론의 한계를 기록했다. 동시에 시험 조건에서는 사람의 선호와 유용한 수준으로 일치한다는 결과도 보고했다. 연구진은 자기 강화(self-enhancement) 효과의 가능성도 살펴봤지만, 자료가 제한적이고 차이가 작아 그 편향이 있다고 확정할 수 없다고 밝혔다.[12]
판정기 평가는 판정기 버전, 프롬프트, 루브릭, 샘플링 설정, 참조 정보, 동점 정책을 밝혀야 한다. 응답 순서를 바꿔 보면 위치에 대한 민감도를 확인할 수 있다. 사람의 감사를 통해 일치도를 추정하고 체계적 오류를 찾을 수 있다. 점수가 수치이고 재현 가능하다는 이유만으로 판정기를 정답으로 취급해서는 안 된다.[1]
5.6. 에이전트 성공률, 신뢰성, 비용
대화형 에이전트는 흔히 최종 상태나 과제 성공 여부로 채점한다. GAIA는 추론, 다중 모달 입력, 웹 탐색, 도구 사용을 요구할 수 있는 질문을 결합한다.[13] WebArena는 기능이 실제로 작동하는 웹사이트를 제공하고, 웹 과제가 완료됐는지 확인한다.[14] OSWorld는 초기 상태 설정과 실행 기반 평가기로 데스크톱 애플리케이션에 걸친 컴퓨터 과제를 정의한다.[15] Tau-bench는 정책 제약이 있는 대화에서 도구를 쓰는 에이전트를 평가하며, 최종 데이터베이스 상태를 주석이 달린 목표와 비교하고 반복 시행 신뢰성 지표를 도입했다.[16][1]
AI 에이전트의 점수는 환경 및 자원 예산과 떼어 놓을 수 없다. 브라우저 버전, 사이트 데이터, 자격 증명, 네트워크 접근, 지연 시간, 도구 오류, 초기화 방식이 성공률에 영향을 줄 수 있다. 해당 값이 중요하다면 토큰 사용량, 도구 호출 횟수, 경과 시간, 금전 비용, 재시도 횟수, 실패 범주를 함께 보고해야 한다. 여러 번 시도한 끝에 한 번 성공한 시스템은 고정된 예산에서 일관되게 성공하는 시스템과 다른 질문에 답한다.[1]
6. 불확실성과 통계 비교
벤치마크 점수는 채점 프로그램이 결정적이더라도 추정치다. 불확실성은 유한한 항목 표본, 무작위 학습, 확률적 추론 실행, 주석자, 변화하는 환경, 모델이나 서비스의 업데이트에서 생긴다. 소수점 자리의 차이가 곧 의미 있는 차이인 것은 아니다.[1]
항목 단위 평균에는 적절한 독립 단위를 재표집하는 부트스트랩 구간을 쓸 수 있다. 두 시스템이 같은 항목을 평가했다면 항목 단위의 대응 관계를 보존하는 대응 방법이 대체로 더 적합하다. 예시가 묶여 있다면 재표집 단위도 그 묶음을 반영해야 한다. 확률적 시스템에서는 반복 실행으로 실행 간 변동을 추정할 수 있고, 반복 학습 시드는 다른 종류의 변동을 다룬다.[1]
많은 시스템, 과제, 지표를 비교하면 우연히 그럴듯한 우위를 찾을 확률이 높아진다. 분석 계획은 탐색적 비교와 확증적 비교를 구분하고, 형식적 추론을 주장할 때는 다중성을 고려해야 한다. Demsar는 여러 데이터셋에 걸쳐 분류기를 비교하는 비모수 방법을 검토했고, 이 설정에서 두 방법에는 대응 검정을, 여러 방법에는 Friedman 계열 절차와 사후 비교를 권장했다.[17] 이 권고가 과제별 통계 판단을 대신하지는 않지만, 리더보드 순서만으로는 불확실성 분석이 되지 않는다는 점을 보여 준다.[1]
실제적 유의성도 중요하다. 매우 큰 시험에서 통계적으로 감지되는 개선이 사용자에게 영향을 주기에는 너무 작을 수 있고, 드문 안전성 결과에 대한 넓은 구간은 배포 관련 위험을 가릴 수 있다. 벤치마크 보고서는 추정치에 구간, 효과 크기, 비용, 분야별 결과를 함께 붙여야 한다.[1]
7. 역사적 발전
초기 머신러닝 비교는 흔히 MNIST처럼 여러 연구가 함께 쓰는 데이터셋을 사용했다. MNIST는 경사 기반 필기 문서 인식 연구와 함께 소개됐다.[18] 이런 데이터셋은 알고리즘 비교 비용을 낮췄지만, 고정된 이미지와 라벨 집합은 전처리와 모델 선택 같은 많은 선택을 개별 연구에 남겼다.[1]
대규모 공동체 챌린지는 프로토콜을 더 명시적으로 만들었다. ImageNet 대규모 시각 인식 챌린지(ImageNet Large Scale Visual Recognition Challenge)는 수백 개 범주와 수백만 장의 이미지에 걸쳐 분류와 탐지를 평가했고, 2010년부터 매년 대회가 열렸다.[19] 크리제프스키(Krizhevsky), 수츠케버(Sutskever), 힌턴(Hinton)의 2012년 심층 합성곱 신경망은 이전 접근보다 ImageNet 분류 오류를 크게 낮췄다고 보고했고, GPU로 학습한 딥러닝의 영향력 있는 시연이 됐다.[20] 지속적인 역사적 요점은 공통 챌린지 아래에서 방법과 결과가 바뀌었다는 점이지, 하나의 점수가 연구 시대 전체를 만들었다는 주장이 아니다.[1]
GLUE 벤치마크는 자연어 이해 과제 9개, 진단용 데이터셋, 온라인 평가 플랫폼을 묶었다. 구성 과제 가운데 4개는 비공개 시험 데이터를 사용했다.[21] 빠른 성능 향상으로 여지가 줄어들자 SuperGLUE가 더 어려운 과제 세트, 도구 키트, 리더보드와 함께 나왔다.[22] 이 흐름은 고정된 묶음의 가치와 수명이 제한적임을 보여 준다. 벤치마크는 비교를 체계화하지만, 나중에는 강한 시스템들 사이를 더 이상 구분하지 못할 수 있다.[1]
MMLU는 객관식 평가를 57개 학술·전문 분야로 넓혔고, 제로샷과 퓨샷 설정에서 평가했다.[23] BIG-Bench는 대규모 공동 연구진이 기여한 다양한 과제 204개를 모았고, 모델 규모에 따른 성능을 연구했다.[24] HELM은 단일 집계 점수에서 벗어나 표준화된 다중 시나리오, 다중 지표 평가로 강조점을 옮겼으며, 분석을 위해 프롬프트와 완성 결과를 함께 공개했다.[5]
이 묶음들은 같은 구성 개념을 재지 않는다. MMLU는 주제별 문항 성능을 강조하고, BIG-Bench는 연구자들이 기여한 많은 과제를 표본으로 삼으며, HELM은 시나리오와 원하는 속성을 중심으로 짠 평가 틀이다. 함께 보고하면 상호 보완적인 행동이 드러날 수 있지만, 임의의 묶음을 평균 낸다고 이론에 기대지 않는 일반 지능 측정치가 생기지는 않는다.[1]
모델이 어시스턴트와 에이전트의 구성 요소가 되면서 벤치마크는 저장소, 브라우저, 도구, 운영체제를 포함하기 시작했다. SWE-bench는 실제 GitHub 이슈와 대응하는 풀 리퀘스트에서 가져온 소프트웨어 공학 문제로 구성되며, 저장소 환경에서 평가된다.[25] GAIA는 정보 탐색과 도구 사용이 필요할 수 있는 질문을 던진다.[13] WebArena와 OSWorld는 재현 가능한 웹 또는 데스크톱 환경에서 행동 순서를 평가한다.[14][15]
이 평가들은 일부 응용에 더 가까워지지만, 변동 요인과 새로운 설계 선택도 늘린다. 과제는 인식, 계획, 도구 문법, 환경 상태, 정책 해석, 평가기 버그 중 어느 것 때문에도 실패할 수 있다. 따라서 의미 있는 진전에는 최종 성공률에 더해 궤적 분석과 구성 요소별 진단이 필요하다.[1]
8. 대표 벤치마크 계열
| 계열 | 전형적인 항목 또는 환경 | 흔한 채점 방식 | 해석 한계 |
|---|---|---|---|
| 이미지 분류 | 라벨이 붙은 이미지 | 상위 1위 또는 상위 k 정확도 | 라벨 집합과 이미지 분포에 민감함[1] |
| 언어 분류 | 라벨이 붙은 문장이나 단락 | 정확도, F1, 상관계수 | 형식과 데이터셋 인공물이 의도한 이해를 대신할 수 있음[1] |
| 지식·시험 문제 | 객관식 또는 단답형 | 정확도 또는 정확 일치 | 지식, 언어, 추론, 시험 요령이 뒤섞임[1] |
| 생성 | 프롬프트와 하나 이상의 참조 | 중첩 지표, 루브릭, 사람 평가 | 유효한 출력이 많고 참조가 불완전함[1] |
| 코드 생성 | 명세와 실행 가능한 테스트 | 단위 테스트 성공률 또는 pass@k | 테스트가 기능·비기능 요구를 모두 덮지 못할 수 있음[1] |
| 소프트웨어 공학 | 저장소 상태와 이슈 | 테스트를 통과한 패치 | 환경 구축과 테스트 품질이 타당성을 제약함[1] |
| 사람 선호 | 블라인드 출력 두 개 | 승률 또는 적합된 레이팅 | 프롬프트, 평가자, 레이팅 모델에 따라 달라짐[1] |
| 도구 사용 어시스턴트 | 질문과 도구 | 정답, 상태 일치, 루브릭 | 도구 접근과 예산이 평가 대상 시스템을 바꿈[1] |
| 웹 또는 데스크톱 에이전트 | 초기 환경과 목표 | 최종 상태 또는 실행 성공 | 환경 변화와 긴 과정의 오류 누적[1] |
| 안전성 또는 공정성 탐침 | 시나리오, 인구통계 변형, 적대적 프롬프트 | 비율, 격차, 심각도, 루브릭 | 포괄 범위가 본질적으로 불완전하고 맥락에 의존함[1] |
이 표는 흔한 패턴을 보여 줄 뿐, 벤치마크 품질의 순위가 아니다. 좁은 벤치마크는 정밀한 주장에 대해 매우 타당할 수 있고, 넓은 묶음은 정의되지 않은 일반 주장에 대해 약한 근거일 수 있다.[1]
9. 타당도, 신뢰도, 포괄 범위
구성 타당도는 점수가 의도한 해석을 뒷받침하는지 묻는다. Bean 등은 현상에서 과제, 지표, 주장으로 이어지는 연쇄를 설명했고, 어느 한 고리가 약하면 결론도 약해진다.[2] 예를 들어 정확 일치 방식의 산술 문항은 지정된 프롬프트에서의 정답에 관한 주장을 뒷받침할 수 있지만, 일반적인 수학 추론에 관한 주장에는 암기, 답 파싱, 답 형식이 결과를 이끌지 않는다는 증거가 추가로 필요하다.[1]
타당성의 근거에는 같은 현상을 재는 다른 측정치와의 상관, 관련 없는 속성과의 약한 상관, 관련 환경에서의 성능 예측, 그럴듯한 교란 변수에 대한 통제 시험, 과제 공간에 대한 전문가 분석이 포함될 수 있다. 어떤 단일 검사도 모든 용도에 대한 타당성을 증명하지 못하며, 주장의 강도는 근거의 강도와 범위에 맞아야 한다.[1]
신뢰도는 측정의 안정성을 다룬다. 같은 시스템을 다시 평가했을 때 점수가 바뀌는지는 재검사 설계로 확인할 수 있다. 평가자 간 일치도는 주석자나 판정기 사이의 일관성을 측정한다. 내적 일관성 측정치는 항목들이 하나의 일관된 척도로 작동하는지를 다루지만, 다양한 벤치마크가 단일 잠재 특성을 대표할 필요는 없다.[1]
신뢰도가 높다고 타당한 것은 아니다. 결정적인 정답 키는 의도하지 않은 지름길을 재면서도 같은 점수를 재현할 수 있다. 반대로 가치 있는 개방형 속성은 신뢰성 있게 재기 어려울 수 있다. 벤치마크 설계는 반복 가능성을 의미의 증거로 여기지 않고 두 문제를 모두 다뤄야 한다.[1]
전체 점수는 벤치마크가 고른 사례들의 혼합을 기술한다. 그 혼합을 바꾸면 추정 대상도 바뀐다. 언어, 분야, 난이도, 인구통계 집단, 모달리티, 과제 유형에 따라 성능이 달라진다면 결과를 세분해야 한다. 공정성 지표는 격차를 드러낼 수 있으나, 서로 다른 공정성 정의는 다른 질문에 답하며 서로 충돌할 수도 있다.[1]
포괄 범위 진술은 구체적이어야 한다. '다국어'는 두 언어를 뜻할 수도 많은 언어를 뜻할 수도 있으며, 번역된 시험 문항의 성능이 실제 발생하는 과제를 대표하지 않을 수 있다. '멀티모달'은 음성, 영상, 공간 상호작용, 접근성 맥락을 다루지 않은 좁은 이미지-질문 형식을 뜻할 수 있다. 빠진 집단은 조용히 일반화하지 말고 보고해야 한다.[1]
10. 실패 양상
데이터 오염은 평가 항목의 정보가 학습이나 개발 과정에 들어가 의도한 시험을 훼손할 때 생긴다. 시험 항목이 그대로 포함되는 경우가 가장 명확하지만, 거의 중복된 문장, 답 설명, 벤치마크 저장소, 번역본, 합성 재구성도 유용한 정보를 옮길 수 있다. Sainz 등은 오염의 수준을 구분했고, 광범위하고 일부만 공개된 말뭉치로 학습된 대규모 언어 모델에서는 그 정도를 측정하기 어렵다고 지적했다.[26][1]
높은 성능이 그 자체로 오염의 증거는 아니며, 문자열 일치 탐지기가 실패했다고 깨끗하다는 증명도 아니다. 근거는 학습 데이터 기록, 시간 기준 절단점, 카나리 문자열, 멤버십이나 노출 시험, 말바꿈에 대한 성능, 학습 이후에 나온 항목과의 비교에서 얻을 수 있다. 각 방법에는 거짓 양성과 거짓 음성이 있으므로, 보고서는 무엇을 점검했고 무엇이 여전히 알려지지 않았는지 밝혀야 한다.[1]
홀드아웃을 반복해서 쓰면 개발 결정이 점점 그 홀드아웃에 의존하게 된다. Blum과 Hardt는 적응형 리더보드 문제를 형식화하고, 유용한 순위를 유지하면서 공개되는 정보를 제한하는 Ladder 방식을 제안했다.[27] 참가자가 많은 제출을 하고 상세한 피드백을 받을 수 있을 때 위험이 가장 크다.[1]
이 효과는 모든 벤치마크에서 같지 않다. Feldman, Frostig, Hardt는 다중 클래스 설정이 일부 공격을 줄일 수 있는 이론적·실증적 이유를 찾았고, 당시 널리 쓰이던 다중 클래스 벤치마크에서 심각한 재사용 과적합의 증거는 제한적이라고 밝혔다.[28] 새 시험 세트를 쓴 연구는 적응성과 분포 이동도 구분한다. 새 ImageNet 시험 세트에서는 절대 정확도가 크게 떨어졌지만 상대 순서는 대체로 유지됐고, 저자들은 하락을 적응형 과적합이 아니라 이미지 난이도 차이로 설명했다.[29] SQuAD 재현 연구는 같은 분야의 새 세트에서 적응형 과적합의 증거를 찾지 못했지만, 다른 텍스트 분야로 자연스럽게 이동했을 때는 더 큰 하락을 확인했다.[30][1]
적절한 결론은 재사용된 시험이 항상 무효이거나 항상 안전하다는 것이 아니다. 제출 이력, 피드백의 정밀도, 클래스 수, 항목 수, 모델 개발 과정, 분포 이동이 모두 중요하다.[1]
연구자는 과제, 데이터셋, 전처리 규칙, 지표, 시드, 집계 방식 중에서 고를 수 있다. 유리한 조합만 보고하면 선택된 결과는 전형적인 우위를 과장한다. '벤치마크 복권(benchmark lottery)' 연구는 선택된 과제에 따라 알고리즘의 상대 순위가 상당히 바뀔 수 있음을 보였고, 벤치마크 선택이 공동체가 발전으로 여기는 것을 좌우한다고 주장했다.[31][1]
사전 등록, 완전한 보고, 공통 평가 하네스, 민감도 분석은 선택적 제시를 줄일 수 있다. 주장된 방법 개선은 하나의 편리한 묶음이 아니라 정당화된 여러 과제와 설정에 걸쳐 나타날 때 더 강하다.[1]
모델은 과제를 수행하지 않고도 라벨을 맞힐 수 있는 상관관계를 악용할 수 있다. 예로는 주석 패턴, 정답 위치의 불균형, 이미지 배경, 어휘 중첩, 출처 메타데이터, 경직된 템플릿이 있다. 벤치마크는 어려우면서도 지름길에 보상할 수 있으며, 적대적 난이도가 자동으로 더 나은 구성 타당도를 뜻하지는 않는다.[1]
반사실 예시, 교란 시험, 인공물 기준선, 오류 분석으로 일부 지름길을 드러낼 수 있다. 그러나 교란은 의도한 라벨과 과제를 보존해야 한다. 교란으로 합리적인 시스템이 해야 할 행동이 바뀌면, 성능 저하가 결함을 보여 주는 것은 아니다.[1]
벤치마크는 점수가 상한 근처에 몰리거나 의도한 용도에서 시스템을 구분하는 능력을 잃을 때 포화된다. 포화는 실제 진전, 항목 노출, 좁은 포괄 범위, 주석 잡음, 쉬운 항목, 거친 지표에서 생길 수 있다. 포화가 더 넓은 문제가 해결됐다는 뜻은 아니다.[1]
Bowman과 Dahl은 유용한 언어 이해 벤치마크에 필요한 조건으로 견고한 분야 내 타당도, 정확하고 모호하지 않은 주석, 충분한 통계적 검정력, 해로운 사회적 편향에 대한 주의를 꼽았다.[32] 2026년 연구는 언어 모델 벤치마크 60개를 대상으로 포화를 정의하고 분석했는데, 표본의 거의 절반이 포화됐고 포화는 연식이 늘수록 증가했다. 이 분석에서 전문가가 큐레이션한 벤치마크는 비슷한 연식에서 더 잘 버텼지만, 비공개 시험 데이터만으로는 포화에 대한 보호 효과가 나타나지 않았다. 이는 그 연구 표본에 대한 발견이며, 모든 벤치마크에 적용되는 법칙은 아니다.[1]
벤치마크 데이터는 특정 시점과 장소, 특정 절차에서 수집된다. 배포 데이터는 내용, 사용자, 센서, 정책, 환경 상태에서 다를 수 있다. 같은 분포의 시험 성능은 자연스럽거나 적대적인 이동에 대한 견고성보다 좁은 가정 아래의 성능을 추정한다.[1]
새 시험 세트와 이동된 시험 세트는 이 질문들을 구분하는 데 도움이 된다. ImageNet과 SQuAD 재현 연구는 성능 하락을 자동으로 시험 과적합으로 간주하지 말고 새 분포를 고려해 해석해야 함을 보여 준다.[29][30] 시간순, 지역별, 기관별, 출처별 분할은 일부 배포 이동을 더 잘 나타낼 수 있지만, 유한한 묶음이 미래의 모든 조건을 덮을 수는 없다.[1]
라벨은 틀리거나 모호하거나 오래됐거나 논쟁적인 전문성에 기반할 수 있다. 단위 테스트는 불완전할 수 있고, 상태 검사기는 부작용을 놓칠 수 있다. 사람 평가자는 일관성이 떨어질 수 있고, 자동 판정기는 체계적 편향을 낳을 수 있다. 모델이 평가기의 오류율에 가까워질수록 추가 점수 향상은 기저 속성의 개선이 아니라 평가기에 맞춘 결과일 수 있다.[1]
항목 감사, 중복 주석, 전문가 조정, 공개 오류 보고, 버전 관리된 수정이 품질을 높인다. 정답 키를 바꾸거나 항목을 제거하면 새 벤치마크 버전이 생기므로, 재계산 없이 이전 점수와 새 점수를 섞어 쓰면 안 된다. 수정은 결과의 출처를 보존해야 한다.[1]
집계 점수에는 가중치가 내포된다. 과제 동일 가중, 항목 동일 가중, 분야 동일 가중은 서로 다른 순위를 낳을 수 있다. 인간 점수, 무작위 기준선, 이전 최고 성능으로 정규화하면 또 다른 가정이 들어간다. 시스템이 실행할 수 있었던 과제만 평균하면 결측값 때문에 생존 편향이 생길 수 있다.[1]
보고서는 독자가 정당화된 대안을 다시 계산할 수 있도록 구성 요소 점수와 공식을 공개해야 한다. 가능하면 순위의 불확실성도 보여 줘야 한다. 데이터가 인접한 시스템을 구분하지 못한다면 리더보드는 동점이나 불확실성 범위를 허용해야 한다.[1]
사람과 자동 선호 평가는 응답 길이, 순서, 문체, 익숙함, 평가자 신원의 영향을 받을 수 있다. LLM 평가자 연구는 답변 순서를 바꾸면 일부 판단이 달라지고, 반복적으로 길게 늘린 응답이 일부 판정기에서 더 높은 평점을 받을 수 있음을 발견했다.[12] 이런 결과는 순서 무작위화, 신원 가리기, 보정된 루브릭, 평가자 품질 점검, 사람 감사 표본의 필요성을 보여 준다.[1]
크라우드소싱 투표 시스템에는 보안 통제도 필요하다. 2025년 ICML 연구는 과거 Chatbot Arena 투표를 대상으로 한 오프라인 실험에서, 표적 투표 조작이 비교적 적은 수의 조작된 투표만으로도 순위를 바꿀 수 있음을 보였고, 이는 남용 탐지와 견고한 집계의 필요성을 드러낸다.[33] 이것이 관찰된 모든 리더보드 결과가 조작됐다는 뜻은 아니며, 운영자가 다뤄야 할 공격 표면을 보여 준다.[1]
11. 벤치마크 설계와 운영
벤치마크는 편리한 데이터셋이 아니라 결정이나 과학적 질문에서 시작해야 한다. 설계자는 목표 현상, 관련 모집단, 분석 단위, 예상되는 변동 요인, 허용 용도를 정의해야 한다. 특정 과제에 대한 주장은 좁은 시험으로 뒷받침할 수 있지만, 넓은 능력 주장에는 대표성 있는 포괄 범위와 교란 요인을 통제했다는 근거가 필요하다.[1]
벤치마크에는 부정적 범위 진술도 포함해야 한다. 예를 들어 코드 벤치마크는 생성된 패치가 제공된 테스트를 통과하는지는 재도, 보안이나 유지보수성은 재지 않을 수 있다. 에이전트 벤치마크는 샌드박스에서의 성공은 재지만 악성 웹사이트에 대한 회복력은 재지 않을 수 있다. 경계를 명확히 하면 정밀한 결과가 근거 없는 결론으로 부풀려지는 것을 막을 수 있다.[1]
데이터 수집 과정에서는 출처, 동의 또는 라이선스, 표집, 필터링, 중복 제거, 주석을 문서화해야 한다. 항목은 풀 수 있는지, 누출되지 않았는지, 모호하지 않은지, 유해한 내용이 없는지 점검해야 한다. 기준선 시스템은 사소한 인공물을 드러낼 수 있고, 분야 전문가는 항목이 의도한 작업을 대표하는지 평가할 수 있다.[1]
데이터시트(Datasheets for Datasets)는 동기, 구성, 수집, 전처리, 용도, 배포, 유지 관리를 구조화해 기록하도록 제안했다.[34] 이런 기록은 벤치마크 사용자가 데이터셋과 응용 사이의 불일치를 찾는 데 도움이 된다. 문서화가 표본의 결함을 고치지는 못하지만, 한계를 점검할 수 있게 만든다.[1]
비교 전에 설계자는 프롬프트, 전처리, 디코딩, 허용 도구, 자원 제한, 점수 코드, 의존성 버전을 고정해야 한다. 평가기는 알려진 긍정, 부정, 경계 사례로 시험해야 한다. 실행 벤치마크에서는 컨테이너나 재현 가능한 환경이 변동을 줄이고, 로그는 실패를 감사할 수 있게 한다.[1]
벤치마크가 시간에 따라 의도적으로 바뀐다면 업데이트 방식을 정의해야 한다. 동적 평가는 현재 시스템을 상대로 새 예시를 모을 수 있다. Dynabench는 주석자가 대상 모델을 속이면서도 다른 사람에게는 타당한 예시를 찾는 사람-모델 참여형 방식을 보였다.[35] 동적 설계는 일부 노후화를 줄이지만 표본 분포를 바꾸고 라운드 간 비교 가능성 문제를 만든다. 버전이 붙은 라운드와 앵커 항목이 도움이 될 수 있다.[1]
기준선은 의미가 있는 경우에 한해 무작위, 다수 클래스, 검색, 휴리스틱, 이전 모델, 사람 성능을 포함할 수 있다. 사람 기준선을 모델과 직접 비교하려면 같은 지시문과 접근 조건이 필요하다. 비전문가가 시간 제한 속에서 낸 추정치는 보편적인 사람 상한이 아니다. 평가 계획은 목표 비교에 필요한 정밀도에 맞춰 항목 수와 반복 실행 횟수를 정해야 한다. 값비싼 모델 실행 전에 신뢰 구간, 짝지은 차이, 하위 집단 추정, 검정력 계산을 고려해야 한다. 계획된 모든 조건을 보고하면 유리한 변형만 고르려는 유혹이 줄어든다.[1]
공개 릴리스에는 라이선스, 데이터 카드 또는 이에 준하는 문서, 평가기 코드, 환경 명세, 기준선 출력, 알려진 문제, 연락 창구가 포함돼야 한다. 비공개 시험 벤치마크도 정확한 시험 내용을 보호하면서 프로토콜과 항목 생성 과정은 공개할 수 있다. 유지 관리에는 오류 보고 검토, 갱신된 의존성에 맞춘 코드 점검, 누출 감시, 항목의 은퇴와 갱신 결정이 포함된다. 모든 변경에는 버전을 붙여야 하며, 리더보드는 각 제출을 벤치마크 버전, 모델 버전, 프로토콜, 날짜, 연산 또는 도구 예산과 연결해야 한다.[1]
모델 카드에는 의도된 용도, 한계, 학습 맥락, 관련 집단과 조건에 따른 성능을 기록할 수 있다.[36] 벤치마크 결과는 이런 시스템 문서와 연결될 때 가장 유용하다. 모델 식별자, 기준 시점, 프롬프트, 도구 설정이 없는 점수는 재현하기 어렵고 오용되기 쉽다.[1]
벤치마크 실패를 줄이는 방법은 하나로 해결되지 않는다. 다음과 같은 보완적 설계가 흔히 쓰인다.
- 비공개 최종 시험: 특히 제출 피드백이 제한될 때 항목에 대한 직접 접근을 줄인다.
- 시간 기준 시험: 문서화된 모델이나 데이터 기준 시점 이후에 만들어진 자료로 평가한다. 다만 나중에 재사용되면 결국 오염될 수 있다.
- 동적 수집: 여러 라운드에 걸쳐 항목을 추가하며 현재의 실패 양상을 겨냥할 수 있다.[35]
- 새 복제: 수집 과정을 다시 만들어 결과가 새 표본에도 옮겨 가는지 시험한다.[29][30]
- 적대적 또는 대비 세트: 알려진 민감성을 탐색하되, 변환된 항목이 여전히 타당해야 한다.
- 실행 기반 채점: 코드, 도구, 환경의 관찰 가능한 행동을 확인하지만 평가기의 완전성에 의존한다.[10][25][15]
- 다중 지표 보고: 정확도, 강건성, 공정성, 효율성 같은 절충을 하나의 숫자에 숨기지 않고 드러낸다.[5]
- 제출 통제: 리더보드에서 적응형 누출을 줄인다.[27]
- 독립 감사: 항목, 코드, 주석, 보안 가정을 점검한다.[1]
선택은 위협 모델을 따라야 한다. 숨겨진 정적 시험은 답을 보호하지만 응용을 대표하지 못할 수 있다. 동적 벤치마크는 어려움을 유지하면서도 점수의 의미를 바꿀 수 있다. 실행 벤치마크는 최종 상태를 확인하지만 중간의 위험한 행동을 놓칠 수 있다. 따라서 복원력은 하나의 기능이 보장하는 표지가 아니라 수명 주기 속성이다.[1]
책임 있는 비교는 다음을 묻는다.
- 정확히 어떤 시스템, 설정, 접근 조건을 평가했는가?
- 벤치마크가 대표한다고 주장하는 현상과 모집단은 무엇인가?
- 항목은 어떻게 표집, 주석, 분할, 버전 관리됐는가?
- 모델이나 개발자가 항목이나 상세 피드백을 볼 수 있었는가?
- 지표가 중요한 행동에 보상하고 중요한 실패에 감점을 주는가?
- 구성 요소별 결과와 하위 집단 결과가 있는가?
- 시스템 간 차이를 둘러싼 불확실성은 얼마인가?
- 연산, 도구, 재시도, 비용이 비교 가능하게 통제됐는가?
- 평가기가 오류, 편향, 불완전한 포괄 범위에 대해 감사됐는가?
- 성능이 관련 있는 독립적이거나 배포에 가까운 시험으로 옮겨 가는가?[1]
이 질문들은 '어떤 벤치마크가 가장 어려운가'라는 질문보다 유익하다. 난이도는 평가 대상 시스템, 프로토콜, 지표, 날짜에 따라 달라진다. 벤치마크가 어려운 이유는 가치 있는 능력을 재기 때문일 수도, 라벨 잡음이나 모호한 지시문 때문일 수도, 분포가 의도적으로 적대적이기 때문일 수도 있다. 낮은 점수만으로는 이런 설명을 구분할 수 없다.[1]
마찬가지로 1위 순위가 전체 평가를 뜻하지는 않는다. 격차가 불확실성 범위 안에 있을 수 있고, 한 과제가 만든 결과일 수 있으며, 더 큰 샘플링 예산으로 얻었을 수 있고, 목표 응용과 무관할 수도 있다. 넓은 언어 모델 비교는 전담 LLM 평가 절차에서 여러 벤치마크, 응용 시험, 질적 분석, 자원 보고를 결합해야 한다. 대화형 시스템의 경우 에이전트 평가는 추가로 궤적, 환경 가정, 신뢰성, 부작용을 점검해야 한다.[1]
리더보드는 벤치마크 자체가 아니라 보고 인터페이스다. 제출물과 설정을 보존해 투명성을 높일 수 있지만, 순위를 위한 최적화를 부추기고, 불확실성을 숨기며, 작거나 비교 불가능한 차이를 증폭할 수 있다. '리더보드 착시(The Leaderboard Illusion)'는 평가 맥락 없이 공개 순위를 해석하는 데 따르는 더 넓은 우려를 다룬다.[1]
평가 하네스는 모델 전반에 걸쳐 데이터 로딩, 프롬프트, 추론 실행, 채점을 표준화할 수 있다. LM Evaluation Harness는 언어 모델 과제의 한 예다. 표준화는 우연한 변동을 줄이지만, 포함된 과제가 모든 주장에 타당하다는 뜻은 아니다. 버그 수정이나 프롬프트 변경이 점수를 바꿀 수 있으므로 하네스 버전, 과제 구현, 모델 어댑터를 기록해야 한다.[1]
리더보드가 가장 강력한 경우는 다음과 같다.
- 재현 가능한 설정과 모델 버전 공개를 요구한다.
- 벤치마크 버전과 평가 트랙을 구분한다.
- 구간, 동점, 구성 요소 점수를 보여 준다.
- 공개, 감사, 자기 보고 제출을 구분한다.
- 자원 예산과 도구 접근을 공개한다.
- 요청 제한을 걸고 남용을 감시한다.
- 수정되거나 대체된 결과를 출처와 함께 보존한다.
- 항목과 평가기 오류를 신고하는 절차를 둔다.[1]
과학적 역할과 함께 벤치마킹은 2020년대 중반 상업 산업으로 발전했다. 평가는 무료 학술 데이터셋과 자원봉사식 리더보드를 넘어 유료 제품으로 옮겨 갔다. 모델 개발사, 기업 구매자, 투자자가 독립 측정에 비용을 치르기 시작했고, 여러 평가 프로젝트가 벤처 투자를 받는 회사로 전환됐다.[1]
LMArena는 Chatbot Arena를 운영하는 곳으로 가장 두드러진 사례다. 이 플랫폼은 2023년 주로 UC 버클리 소속 연구자들이 운영한 연구 프로젝트로 시작했고, 2025년 4월 회사로 법인화됐다. 2025년 5월에는 Andreessen Horowitz와 UC Investments가 공동 주도한 1억 달러 시드 라운드를 받았으며, 보도된 기업 가치는 6억 달러였다. 2026년 1월에는 1억 5,000만 달러 시리즈 A를 발표했고 사후 기업 가치는 17억 달러였다. 회사는 150개국에 걸쳐 월간 사용자가 500만 명을 넘는다고 밝혔고, 2025년 9월 출시한 유료 평가 제품의 연간 환산 소비액 런레이트가 2025년 12월까지 3,000만 달러를 넘었다고 공개했다. 2026년 6월 Arena로 리브랜딩한 회사는 이 평가 제품이 출시 8개월 만에 연간 매출 1억 달러 런레이트에 도달했고, 평가 작업을 장기 실행 에이전트로 확장한다고 밝혔다.[37][1]
다른 기업들은 다른 출발점에서 평가를 판매한다. 주로 학습 데이터 회사인 Scale AI는 2024년 5월 SEAL 리더보드를 출시해, 검증된 분야 전문가가 쓰고 채점한 비공개 보류 프롬프트 세트로 최전선 모델을 순위 매겼다. 시험 항목이 학습 말뭉치에 들어갈 수 없게 하기 위해서다.[38] Artificial Analysis는 2023년 설립됐으며, 공급사가 발표한 점수를 다시 싣는 대신 모델과 API 제공자를 표준화된 방식으로 자체 평가한다.[1] TechCrunch는 2025년 4월 이 회사의 데이터를 인용해, OpenAI o1을 벤치마크 7개 묶음으로 평가하는 데 2,767.05달러가 들었고 추론을 하지 않는 GPT-4o는 108.85달러였다고 보도했다. 또 이 회사는 추론 모델 12개 정도를 평가하는 데 약 5,200달러를 썼는데, 이는 80개가 넘는 비추론 모델에 쓴 금액의 거의 두 배다.[39] 이런 모델별 비용 상승은 독립 검증을 학계가 감당하기 어렵게 만들고, 재현하기보다 구매하기 쉽게 만드는 상업적 힘이기도 하다.[39]
가장 큰 금액은 시험 항목이 아니라 전문 인력을 공급하는 기업에 흘러갔다. Mercor는 AI 연구소와 과학자, 의사, 변호사 등 모델을 학습시키고 평가하는 분야 전문가를 연결하는 마켓플레이스인데, 2025년 10월 3억 5,000만 달러 시리즈 C를 기업 가치 100억 달러로 조달했다. 이는 같은 해 초 시리즈 B 때 기업 가치 20억 달러의 5배다.[40] 이 기업들의 공통점은 사람에 의한 유료 평가다. Arena는 크라우드소싱 선호 투표를 집계하고, Scale은 검증된 전문가로 채점하며, Mercor는 전문 평가자를 공급한다. 고정된 시험 세트가 아니라 사람을 상대로 모델을 시험하려는 수요를 보여 준다.[37][38][40]
상업화는 평가자의 독립성에 대한 질문을 날카롭게 만들었다. 비영리 단체 Epoch AI는 2024년 12월, OpenAI가 자사의 FrontierMath 벤치마크 제작에 자금을 댔고 많은 문제와 풀이를 볼 수 있었다고 공개했다. 기여자들은 늦은 공개를 비판했고, Epoch는 실수였다고 인정하며 OpenAI가 문제로 학습하지 않겠다고 구두로 동의했고 독립 검증을 위한 별도의 홀드아웃 세트가 있다고 설명했다. 2025년 6월 Meta는 Scale AI 지분 49%를 약 143억 달러에 사들였고, 이는 Scale AI의 기업 가치를 290억 달러로 평가한 것이다. Scale 창업자 Alexandr Wang은 Meta로 옮겼고, OpenAI와 Google은 이후 이 데이터 제공사와 협력을 중단하겠다고 밝혔다. 2025년 Chatbot Arena를 분석한 논문 The Leaderboard Illusion은 비공개 테스트, 선택적 점수 공개, 비대칭적 데이터 접근이 '왜곡된 경기장'을 만들었고, 일반적인 모델 품질이 아니라 'Arena 고유의 역학에 대한 과적합'에 보상이 돌아갔다고 주장했다. LMArena는 공개 블로그 응답에서 이 논문의 여러 수치를 반박했다.[1]
각주·출처 40개
- ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12 ↩13 ↩14 ↩15 ↩16 ↩17 ↩18 ↩19 ↩20 ↩21 ↩22 ↩23 ↩24 ↩25 ↩26 ↩27 ↩28 ↩29 ↩30 ↩31 ↩32 ↩33 ↩34 ↩35 ↩36 ↩37 ↩38 ↩39 ↩40 ↩41 ↩42 ↩43 ↩44 ↩45 ↩46 ↩47 ↩48 ↩49 ↩50 ↩51 ↩52 ↩53 ↩54 ↩55 ↩56 ↩57 ↩58 ↩59 ↩60 ↩61 ↩62 ↩63 ↩64 ↩65 ↩66 ↩67 ↩68 ↩69 ↩70 ↩71 ↩72 ↩73 ↩74 ↩75 ↩76 ↩77 ↩78 ↩79 ↩80 ↩81 ↩82 ↩83 ↩84 ↩85 ↩86 ↩87 ↩88 ↩89 ↩90 ↩91 ↩92 ↩93 ↩94 ↩95 ↩96 ↩97 ↩98 ↩99 ↩100 ↩101 ↩102 AI Wiki: Benchmark (AI) (2026-07-29 수정본) · CC BY 4.0 · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 Measuring what Matters: Construct Validity in Large Language Model Benchmarks · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 BetterBench: Assessing AI Benchmarks, Uncovering Issues, and Establishing Best Practices · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 AI and the Everything in the Whole Wide World Benchmark · 확인 2026-10-11
- ↩1 ↩2 ↩3 Holistic Evaluation of Language Models · 확인 2026-10-11
- ↩1 On Over-fitting in Model Selection and Subsequent Selection Bias in Performance Evaluation · 확인 2026-10-11
- ↩1 Bleu: a Method for Automatic Evaluation of Machine Translation · 확인 2026-10-11
- ↩1 ROUGE: A Package for Automatic Evaluation of Summaries · 확인 2026-10-11
- ↩1 METEOR: An Automatic Metric for MT Evaluation with Improved Correlation with Human Judgments · 확인 2026-10-11
- ↩1 ↩2 Evaluating Large Language Models Trained on Code · 확인 2026-10-11
- ↩1 Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference · 확인 2026-10-11
- ↩1 ↩2 Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena · 확인 2026-10-11
- ↩1 ↩2 GAIA: a benchmark for General AI Assistants · 확인 2026-10-11
- ↩1 ↩2 WebArena: A Realistic Web Environment for Building Autonomous Agents · 확인 2026-10-11
- ↩1 ↩2 ↩3 OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments · 확인 2026-10-11
- ↩1 Tau-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains · 확인 2026-10-11
- ↩1 Statistical Comparisons of Classifiers over Multiple Data Sets · 확인 2026-10-11
- ↩1 Gradient-Based Learning Applied to Document Recognition · 확인 2026-10-11
- ↩1 ImageNet Large Scale Visual Recognition Challenge · 확인 2026-10-11
- ↩1 ImageNet Classification with Deep Convolutional Neural Networks · 확인 2026-10-11
- ↩1 GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding · 확인 2026-10-11
- ↩1 SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems · 확인 2026-10-11
- ↩1 Measuring Massive Multitask Language Understanding · 확인 2026-10-11
- ↩1 Beyond the Imitation Game: Quantifying and Extrapolating the Capabilities of Language Models · 확인 2026-10-11
- ↩1 ↩2 SWE-bench: Can Language Models Resolve Real-World GitHub Issues? · 확인 2026-10-11
- ↩1 NLP Evaluation in Trouble: On the Need to Measure LLM Data Contamination for Each Benchmark · 확인 2026-10-11
- ↩1 ↩2 The Ladder: A Reliable Leaderboard for Machine Learning Competitions · 확인 2026-10-11
- ↩1 The Advantages of Multiple Classes for Reducing Overfitting from Test Set Reuse · 확인 2026-10-11
- ↩1 ↩2 ↩3 Do ImageNet Classifiers Generalize to ImageNet? · 확인 2026-10-11
- ↩1 ↩2 ↩3 The Effect of Natural Distribution Shift on Question Answering Models · 확인 2026-10-11
- ↩1 The Benchmark Lottery · 확인 2026-10-11
- ↩1 What Will it Take to Fix Benchmarking in Natural Language Understanding? · 확인 2026-10-11
- ↩1 Improving Your Model Ranking on Chatbot Arena by Vote Rigging · 확인 2026-10-11
- ↩1 Datasheets for Datasets · 확인 2026-10-11
- ↩1 ↩2 Dynabench: Rethinking Benchmarking in NLP · 확인 2026-10-11
- ↩1 Model Cards for Model Reporting · 확인 2026-10-11
- ↩1 ↩2 Arena reached a $100M annual revenue run rate just 8 months after launching our evaluation product · 확인 2026-10-11
- ↩1 ↩2 Scale's SEAL Leaderboards · 확인 2026-10-11
- ↩1 ↩2 The rise of AI 'reasoning' models is making benchmarking more expensive · 확인 2026-10-11
- ↩1 ↩2 Mercor quintuples valuation to $10B with $350M Series C · 확인 2026-10-11