AI의 변화, 근거와 맥락까지.AI NEWS & CONTEXT
OpenAI벤치마크

AI 성능표를 제대로 읽는 법: GPT의 오류율부터 학습 규모까지

GPT의 오류율, 코딩 시험의 문제 수, 학습 연산량은 서로 다른 질문에 답하는 지표입니다.

이 기사에서 읽을 내용
글자 크기

먼저 읽는 핵심 포인트

  • GPT의 오류율, 코딩 시험의 문제 수, 학습 연산량은 서로 다른 질문에 답하는 지표입니다.
  • 공식 수치와 원본 차트에 한국어 해설을 붙여, 비교 가능한 범위와 남아 있는 조건을 살펴봅니다.
  • 평가 조건과 이미지 출처를 따라갈 수 있어야 숫자의 의미도 다시 확인할 수 있습니다.
독자 안내 · 일반 사용자 · 개발자 · 연구자

왜 중요한가

AI 소식에서 큰 숫자는 빠르게 눈에 들어오지만, 수치가 측정한 대상은 서로 다릅니다. 시험 조건과 원본 시각자료를 함께 읽으면 새로운 모델 발표가 자신의 업무에 어떤 의미인지 더 차분하게 판단할 수 있습니다.

편집부 제안 · 변화 확인

관심 있는 수치의 출처를 열고 모델 버전·단위·평가 조건부터 확인해 보세요. 본문의 목차와 원본 수치 보기를 이용하면 필요한 부분부터 읽을 수 있습니다.

성능표를 읽는 순서를 바꿔 보자

새 AI 모델이 등장할 때 가장 먼저 보게 되는 것은 대개 이름과 점수다. 막대가 길어지고 순위가 올라가면 이전보다 나아졌다는 인상을 받는다. 하지만 그 숫자가 실제로 답하는 질문은 생각보다 좁다. 어려운 질문에서 사실 오류를 덜 내는지, 특정 코드 저장소의 문제를 해결하는지, 더 많은 데이터를 학습했는지는 각각 다른 이야기다. 이 글은 어느 모델이 무조건 최고인지를 정하는 대신, 발표문과 도표를 읽을 때 놓치기 쉬운 구분을 하나씩 살펴본다.

편집부 해설

한국어 독자가 먼저 확인할 것은 세 가지다. 내가 쓰려는 제품과 시험한 모델이 같은지, 점수가 어떤 작업에서 나왔는지, 그리고 공개된 조건만으로 비교가 가능한지다. 영문 원문을 자연스럽게 번역하는 일도 여기서 시작한다. 실험 결과의 문장을 자신감 있는 한국어로 바꾸는 과정에서 ‘일부’, ‘특정 설정’, ‘회사에 따르면’ 같은 조건이 빠지면 같은 숫자로 전혀 다른 이야기를 하게 된다. 이 글의 원본 이미지는 영어 표기를 보존하고, 각 그림 뒤에서 읽는 법을 한국어로 풀었다.

편집부 해설
대상, 문제, 조건, 해석의 네 단계로 AI 성능표를 읽도록 안내하는 한국어 도식
모델 이름에서 결론으로 바로 넘어가지 않고, 문제와 조건을 거쳐 읽는 순서.LUCAS AI News 편집부 제작이 기사의 읽기 순서를 설명하기 위해 직접 제작했습니다.크게 보기 ↗

GPT의 오류율: 숫자와 실험의 범위를 함께

OpenAI는 GPT-6.1 Sol 소개에서 낮은 추론 설정의 사실성 평가 결과를 제시했다. 사실 오류가 하나 이상 포함된 응답 비율은 GPT-6 Sol 11.4%, GPT-6.1 Sol 7.7%로 보고했다. 원문은 이 평가가 사용자가 이전 모델의 오류를 지적했던 대화를 바탕으로 한 어려운 질문들이며, 일반적인 이용 상황을 대표하지 않는다고 설명한다. 따라서 7.7%를 모든 ChatGPT 대화의 오류 확률처럼 읽으면 평가 범위를 벗어난다.

출처상 확인
모델

GPT-6.1 Sol

OpenAI · GPT-6.1 Sol

텍스트 작업

비공개 · 라이선스: 미확인

직접 비교 불가 · 참고 수치

사실 오류가 포함된 응답 비율

OpenAI factuality evaluation

이전 오류 신고 대화에서 오류가 하나 이상 포함된 응답 비율.

회사 발표의 참고 수치. 정확한 평가 버전·표본 수·전체 실행 조건 미확인.

표를 좌우로 밀면 평가 주체와 전체 수치를 볼 수 있습니다.

오류 포함 응답 · ↓ 낮을수록 좋은 지표
평가 대상보고 수치평가 주체
GPT-6 SolGPT-6 Sol11.4 %구간 미제공회사 발표 수치OpenAI · 출처상 확인
GPT-6.1 SolGPT-6.1 Sol7.7 %구간 미제공회사 발표 수치OpenAI · 출처상 확인
이 수치로 알 수 없는 것
  • 일반 사용을 대표하지 않는 고난도 프롬프트다.
  • 전체 평가 설정이 확인되지 않아 직접 비교 막대를 표시하지 않는다.
평가 조건과 출처 확인

GPT-6 Sol

기반 모델: 해당 없음 또는 미확인
평가 시각: 미확인

시험 버전
미확인
평가 세트
미확인
평가 코드
미확인
에이전트 구성
미확인
점수 산정
미확인
평가 예산·시간 제한
미확인
사용 도구
미확인
예시 개수
미확인
문제당 시도
미확인
추론 설정
low
샘플링
미확인
시스템 프롬프트
미확인
입력 조건
미확인
평가 표본 수
미확인
하드웨어
미확인
수치 정밀도
미확인
동시 요청 수
미확인
심판 모델
미확인

GPT-6.1 Sol

기반 모델: 해당 없음 또는 미확인
평가 시각: 미확인

시험 버전
미확인
평가 세트
미확인
평가 코드
미확인
에이전트 구성
미확인
점수 산정
미확인
평가 예산·시간 제한
미확인
사용 도구
미확인
예시 개수
미확인
문제당 시도
미확인
추론 설정
low
샘플링
미확인
시스템 프롬프트
미확인
입력 조건
미확인
평가 표본 수
미확인
하드웨어
미확인
수치 정밀도
미확인
동시 요청 수
미확인
심판 모델
미확인

여기서는 발표 수치를 참고 표로만 실었다. 원문에 실린 결과라는 점과 독립적으로 재현된 결과라는 점은 다르기 때문이다. 독자가 필요한 조건을 펼쳐 보면 확인된 항목과 비어 있는 항목을 구분할 수 있다. 표본 수나 전체 실행 설정을 확인하지 못했다면 그 칸은 미확인으로 남기는 편이 낫다. 보기에 완벽한 표를 만들기 위해 빈칸을 추측으로 채우면, 오히려 독자가 다시 확인할 길을 막는다.

편집부 해설

이 사례를 읽을 때 절대 차이와 상대 변화의 표현도 구분해야 한다. 두 비율의 뺄셈과, 처음 수치에 비해 얼마나 변했는지를 계산하는 방식은 같은 뜻이 아니다. 다만 산술 계산이 가능하다는 사실만으로 실험 조건의 비교 가능성까지 확인되는 것은 아니다. 이 페이지는 표에 원래 보고된 값을 보존하고 추가 순위나 개선 막대를 만들지 않았다. 수치의 방향이 낮을수록 좋은지, 높을수록 좋은지 역시 지표 이름과 함께 읽어야 한다.

편집부 해설
발표 내용에서 실험 범위, 독립 확인, 나의 작업으로 이어지는 네 층위의 한국어 설명 도식
공식 발표의 존재, 실험 조건, 독립 확인, 개인의 활용 판단은 별도로 살펴야 한다.LUCAS AI News 편집부 제작이 기사의 읽기 순서를 설명하기 위해 직접 제작했습니다.크게 보기 ↗

평가 결과를 따라갈 수 있어야 한다

Hugging Face는 2026년 2월 Community Evals를 소개하며 벤치마크 데이터셋의 평가 정의와 모델 저장소의 결과를 연결하는 방식을 제시했다. 결과를 제출한 사람과 근거, 변경 이력을 따라갈 수 있게 하는 접근이다. 이 발표의 의미는 새로운 단일 점수 하나를 더 만드는 데만 있지 않다. 평가가 무엇을 시험했고 누가 어떤 자료를 제출했는지를 독자가 확인하는 경로가 중요해졌다는 점에 있다.

출처상 확인

뉴스를 읽는 입장에서도 결과표의 끝에 붙은 출처는 부록이 아니다. 같은 모델 이름 아래 여러 결과가 있으면 모델 카드의 수치인지, 독립 평가기관의 측정인지, 커뮤니티가 제출한 실행 결과인지부터 나눠 봐야 한다. 제출 기록이 공개되어 있다는 것만으로 모든 결과의 조건이 같아지지는 않는다. 이 글은 발표의 방향을 소개하는 해설이며 현재 리더보드의 모든 결과를 감사하거나 재현한 보고서는 아니다.

편집부 해설

같은 SWE-bench라도 어떤 문제 묶음인가

코딩 평가에서는 데이터셋 이름 뒤에 붙는 단어도 중요하다. SWE-bench는 저장소와 이슈를 바탕으로 소프트웨어 문제 해결을 평가하는 자료이며, 전체 평가와 Lite·Verified 같은 변형을 제공한다. 아래는 점수 비교가 아니라 시험 문제 수를 읽는 표다. 모델이 풀어야 했던 모집단과 문제 구성부터 확인해야 같은 퍼센트라도 어떤 범위의 결과인지 이해할 수 있다.

출처상 확인
SWE-bench 평가 묶음의 문제 수
평가 묶음test 문제 수 (개)읽을 때 주의할 점
Full2,294전체 test 평가 묶음
Lite300공식 데이터셋의 test split 기준
Verified500전문가가 검토한 문제 묶음

문제 수이며 모델 점수가 아닙니다. 서로 다른 평가 묶음의 크기를 보여 줍니다. · Full·Verified는 공식 안내, Lite는 실제 test split을 확인했습니다. 부분집합 간 중복이 있으므로 합계나 시장점유율로 해석하지 않습니다.

평가 묶음의 크기

test 문제 수 (개)

평가 묶음의 크기02294 개Full2,294Lite300Verified500
원본 수치 보기
SWE-bench 평가 묶음의 문제 수
평가 묶음test 문제 수 (개)읽을 때 주의할 점
Full2,294전체 test 평가 묶음
Lite300공식 데이터셋의 test split 기준
Verified500전문가가 검토한 문제 묶음

막대가 길다고 모델이 우수하거나 시험이 반드시 더 어렵다는 뜻은 아닙니다. · Full·Verified는 공식 안내, Lite는 실제 test split을 확인했습니다. 부분집합 간 중복이 있으므로 합계나 시장점유율로 해석하지 않습니다.

자료를 확인하는 과정에서 SWE-bench 안내 문서의 Lite 크기 표기와 공식 데이터셋 test split의 표기가 달랐다. 이 표는 실제 test split에 표시된 300개를 기준으로 삼고, 그 판단 경로를 함께 남겼다. 공식 페이지라고 해서 모든 문서가 항상 같은 속도로 갱신되는 것은 아니다. 숫자가 충돌할 때 한쪽을 조용히 고르거나 두 숫자를 평균 내기보다, 무엇을 세고 있는지와 어느 자료를 기준으로 했는지를 밝히는 것이 독자에게 더 유용하다.

편집부 해설

이런 묶음을 하나의 도넛으로 그리면 전체를 나눠 가진 독립된 부분처럼 보이기 쉽다. 하지만 부분집합 사이에는 겹침이 있을 수 있다. 그래서 여기서는 표와 가로 막대로 각 규모만 보여 주었다. 그래프 유형도 해석의 일부다. 시각자료가 많아질수록 예쁘게 보이는 도형보다, 그 도형이 무엇을 암시하는지를 먼저 확인해야 한다. 독자는 그래프 아래 원본 수치 보기를 열어 표시값을 표와 대조할 수 있다.

편집부 해설

학습 연산량은 성능 순위가 아니다

다음 그림은 Our World in Data가 Epoch AI 자료를 바탕으로 만든 학습 연산량 차트다. 가로축은 모델 발표 시점, 세로축은 학습에 사용된 연산량이다. 세로축은 로그 눈금이므로 같은 길이만큼 올라가는 것이 같은 양의 연산을 더했다는 뜻은 아니다. 아주 작은 규모와 아주 큰 규모를 한 그림 안에서 살피기 위한 표현이다. 원본 그림의 제목·축·출처와 재사용 표시를 그대로 보존했다.

출처상 확인
발표 시점에 따른 AI 학습 연산량을 로그 세로축에 표시한 OWID 산점도. 최근 시기로 갈수록 큰 규모의 관측이 늘어남
AI 모델 학습 연산량의 장기적 변화. 세로축은 로그 눈금이며 성능 점수가 아니다.Our World in Data — Edouard Mathieu, Charlie Giattino, Veronika Samborska, Max Roser · 데이터: Epoch AI · CC BY 4.0원본 PNG를 수정하지 않았습니다. 영문 축과 범례의 의미는 아래 한국어 본문에서 설명합니다.크게 보기 ↗ · 원문 ↗ · 원본 이미지 ↗ · 사용 조건 ↗

이 차트에서 눈에 띄는 것은 학습 규모의 폭과 장기적 변화다. 하지만 한 점이 더 높은 곳에 있다는 이유만으로 한국어 답변이 더 정확하거나 코드 수정이 더 안전하다고 말할 수는 없다. 학습에 투입한 자원과 독자가 실제로 체감하는 능력 사이에는 데이터 구성, 학습 방법, 제품 설정 등 이 그림이 직접 설명하지 않는 요소가 남아 있다. 뉴스 제목을 정할 때도 ‘연산 규모가 커졌다’와 ‘모든 작업에서 더 뛰어나다’를 같은 문장으로 처리해서는 안 된다.

편집부 해설

또한 관측값이 모두 동일한 수준으로 공개되고 측정된 것은 아니다. 원본 차트는 문헌 기반 추정의 불확실성을 설명한다. 독자는 점의 위치를 소수점까지 확정된 회계 수치처럼 받아들이기보다 자료의 수집 방식과 추정 범위를 함께 봐야 한다. 원문 링크를 제공하는 이유도 여기에 있다. 한국어 기사만 읽어도 큰 흐름은 이해할 수 있어야 하고, 세부 조건이 궁금하면 원본의 방법론으로 돌아갈 수 있어야 한다.

편집부 해설

‘데이터가 많다’의 단위부터 확인하기

학습 데이터의 크기도 숫자만 비교하면 헷갈릴 수 있다. OWID의 다음 그림은 분야별 데이터 포인트를 표시한다. 원문은 언어·시각·게임처럼 분야가 달라지면 세는 단위도 달라지므로 직접 비교는 같은 분야 안에서 해야 한다고 설명한다. 큰 숫자가 적혀 있다는 이유만으로 서로 다른 분야의 모델을 한 줄로 순위 매기는 것은 이 자료가 허용하는 해석이 아니다.

출처상 확인
발표 시점과 학습 데이터 포인트 수를 나타낸 산점도. 언어, 시각, 게임 등 분야가 서로 다른 색으로 구분됨
분야마다 다른 단위를 세는 학습 데이터. 원본 범례의 색은 모델의 우열을 뜻하지 않는다.Our World in Data — Edouard Mathieu, Charlie Giattino, Veronika Samborska, Max Roser · 데이터: Epoch AI · CC BY 4.0원본 PNG를 수정하지 않았습니다. 영문 축과 범례의 의미는 아래 한국어 본문에서 설명합니다.크게 보기 ↗ · 원문 ↗ · 원본 이미지 ↗ · 사용 조건 ↗

한국어 캡션에서는 원문의 data points를 단순히 ‘데이터 양’이라고만 옮기지 않고 무엇을 세는지 설명해야 한다. 파일 용량인지, 토큰인지, 이미지 수인지에 따라 독자의 이해가 달라진다. 서로 다른 단위를 하나의 막대그래프 축에 억지로 올리는 대신 자료를 나누거나 원본의 범주를 유지하는 것이 좋다. 표현을 단순하게 만들더라도 측정 대상까지 지워서는 안 된다. 범례는 그래프를 꾸미는 장식이 아니라 비교 범위를 알려 주는 정보다.

편집부 해설

공개 차트가 계속 갱신되는 경우에는 기사에 들어간 그림과 나중에 열어 본 원문이 달라질 수 있다. 이번 그림은 확인한 원본 파일을 기사와 함께 저장한 스냅샷이다. 원문 페이지와 실제 이미지 주소를 별도로 남겨 현재 자료로 돌아갈 길도 보존했다. 따라서 기사 안의 시각자료를 오래 보관하는 것과 원 제공자의 최신 자료를 찾아보는 일은 함께 가능하다. 업데이트된 그림으로 바꾸면 기사 수정 이력에도 그 변화를 설명하는 것이 적절하다.

편집부 해설

매개변수와 연산량을 함께 보면

세 번째 원본 그림은 가로축에 매개변수 수, 세로축에 학습 연산량을 놓았다. 두 축 모두 로그 눈금이다. 앞의 시계열 그림과 달리 모델 규모의 두 측면을 한 번에 볼 수 있다. 원본에 포함된 범례와 각주를 보존했으며, 일부 값이 추정치이고 자료가 없는 경우 표시 방식에 제약이 있다는 설명도 그림 안에서 확인할 수 있다.

출처상 확인
AI 시스템의 매개변수 수와 학습 연산량 관계를 두 로그 축에 나타낸 산점도. 추정과 결측 처리에 관한 원본 각주가 포함됨
학습 연산량과 매개변수 규모의 관계. 두 축의 단위와 로그 눈금을 함께 읽어야 한다.Our World in Data — Edouard Mathieu, Charlie Giattino, Veronika Samborska, Max Roser · 데이터: Epoch AI · CC BY 4.0원본 PNG를 수정하지 않았습니다. 영문 축과 범례의 의미는 아래 한국어 본문에서 설명합니다.크게 보기 ↗ · 원문 ↗ · 원본 이미지 ↗ · 사용 조건 ↗

두 변수가 함께 움직이는 경향이 보인다고 해서 그림 하나만으로 원인과 결과를 단정할 수는 없다. 특정 모델이 어떤 방식으로 학습되었는지, 자료가 얼마나 공개되어 있는지는 별도의 질문이다. 이 그림은 ‘크기’라는 말을 더 구체적인 두 측정값으로 나누어 읽는 데 유용하다. 반대로 두 축의 내용을 생략하고 ‘AI는 갈수록 똑똑해진다’는 문장만 붙이면 시각자료가 실제로 보여 주는 범위를 넘어선다.

편집부 해설

영문 원본을 사이트 색상에 맞춘다는 이유로 다시 칠하지 않은 것도 같은 맥락이다. 범주의 색과 표시 방식은 작성자의 설명 체계에 속한다. 사이트는 바깥의 제목·캡션·출처 링크를 통일하고 원본은 온전히 보여 준다. 본문이 더 좁은 휴대폰에서는 그림 전체를 먼저 보고, 필요하면 이미지를 눌러 저장된 큰 그림을 새 탭에서 확인할 수 있다. 원본의 출처 표시를 가리거나 워터마크를 제거하지 않았다.

편집부 해설

같은 70점이어도 계산 방식이 다를 수 있다

벤치마크 점수에는 정규화가 적용되기도 한다. Hugging Face의 Open LLM Leaderboard 문서는 무작위 선택의 기준점을 고려해 원 점수를 다시 표현하는 방식을 설명한다. 아래는 그 원리를 읽기 위한 산술 예다. 어떤 실제 모델의 측정 결과도 아니다. 선택지가 네 개라 무작위 기준점이 25%라고 두고, 원 정답률에서 기준점을 뺀 뒤 남은 구간의 비율을 계산한다.

출처상 확인

원 점수를 다시 표현하면

정규화 점수 (점)

원 점수를 다시 표현하면100.0 점025100
원본 수치 보기
정규화 계산을 이해하기 위한 산술 예
원 정답률 (%)정규화 점수 (점)
250.0
4020.0
5540.0
7060.0
8580.0
100100.0

가로축은 원 정답률(%), 세로축은 정규화 점수(점). 시간에 따른 성능 향상 그래프가 아닙니다. · 편집부 산술 예: max(0, (원 정답률−25)÷75×100). 4지선다의 무작위 기준점을 가정했으며 실제 모델 측정값이 아닙니다.

선이 오른쪽 위로 올라간다고 해서 새로운 모델이 시간에 따라 발전했다는 뜻은 아니다. 이 그림은 같은 계산식에 서로 다른 입력값을 넣었을 때 출력이 어떻게 바뀌는지를 보여 준다. 그래프의 가로축이 날짜인지, 모델 이름인지, 계산의 입력인지부터 읽어야 하는 이유다. 기사를 옮길 때도 원문이 정규화 점수를 썼다면 이를 곧바로 정답률이라고 번역하지 않는다. 숫자 뒤의 단어 하나가 독자의 해석을 바꿀 수 있다.

편집부 해설

세 지점의 정규화 결과

정규화 점수 (점)

세 지점의 정규화 결과100 점0원 정답률 40%원 정답률 70%원 정답률 100%
원본 수치 보기
정규화 계산 예의 세 지점
가정한 원 정답률정규화 점수 (점)
원 정답률 40%20.0
원 정답률 70%60.0
원 정답률 100%100.0

앞의 선 그래프 중 세 지점을 같은 단위의 세로 막대로 표현했습니다. 모델의 성능 순위가 아닙니다. · 앞의 산술 예에서 세 지점만 뽑았습니다. 모든 막대는 같은 방식으로 계산한 정규화 점수입니다. 실제 모델을 측정한 수치가 아닙니다.

이 세로 막대는 앞의 계산을 범주별로 다시 읽는 예다. 범주 이름에는 가정한 원 정답률을 적고, 모든 막대의 높이는 같은 단위의 정규화 점수로 표현했다. 단위가 다른 원 정답률과 정규화 점수를 같은 막대 계열로 경쟁시키지 않은 것이다. 원본 수치 보기를 열면 세 지점의 계산 결과를 확인할 수 있다. 일반 뉴스의 모델 성능 비교에는 이 설명용 계산을 복사해 쓰지 말고, 실제로 확인한 결과와 조건을 담은 벤치마크 표를 사용해야 한다.

편집부 해설

해외 그림을 한국어 독자에게 옮기는 방법

시각자료가 있는 기사는 핵심을 빠르게 이해하는 데 도움이 될 수 있다. 다만 그림이 많다는 이유만으로 정보가 풍부해지지는 않는다. 제품 기능을 설명하는 화면, 수치의 범위를 보여 주는 그래프, 복잡한 과정을 정리하는 도식은 서로 역할이 다르다. 본문에서 무엇을 설명하려는지 먼저 정한 뒤 그 역할에 맞는 자료를 찾아야 한다. 같은 AI 주제라는 이유로 관련 없는 로봇 사진을 반복하면 오히려 핵심을 흐릴 수 있다.

편집부 해설
원문 확인, 파일 확인, 한국어 설명, 기사 배치의 네 단계로 원본 이미지를 기사에 가져오는 절차
원문과 파일을 확인한 뒤 한국어 설명을 붙이고 필요한 문단 옆에 배치하는 흐름.LUCAS AI News 편집부 제작이 기사의 읽기 순서를 설명하기 위해 직접 제작했습니다.크게 보기 ↗

이번 글의 OWID 원본 차트는 출처와 재사용 조건을 확인한 뒤 포함했다. OWID는 자체 제작한 자료와 제3자가 만든 자료의 조건을 구분하므로 같은 사이트 안의 모든 그림을 똑같이 취급해서는 안 된다. 이미지 아래의 원문·원본 이미지·사용 조건 링크는 각각 다른 확인 경로다. CC BY 자료를 옮길 때는 제작자와 라이선스를 밝히고 바꾼 부분이 있다면 그 사실도 표시한다.

출처상 확인

한국어 독자를 위한 번역은 원문의 영어 문장을 한 문장씩 바꾸는 데 그치지 않는다. 숫자에 낯선 단위가 붙어 있으면 먼저 단위를 풀고, 제품명이 비슷하면 버전의 차이를 알려 주고, 표의 조건이 생략되어 있으면 그 한계를 먼저 짚는 것이 더 도움이 된다. 원본 도표 위에 번역 글자를 무리하게 덮어씌우면 작은 각주나 눈금이 가려질 수 있다. 이 글은 원본을 보존하고 읽는 방법을 별도 한국어 문장으로 설명하는 방식을 택했다.

편집부 해설

원본 파일을 저장하는 단계에서도 실제 그림을 열어 보는 과정이 필요하다. 검색 결과의 썸네일이나 기사 대표 이미지가 본문에서 다루는 결과와 같은 자료라는 보장은 없다. 다운로드한 파일이 너무 작거나, 다른 발표의 그림이거나, 오류 페이지라면 기사에 넣기 전에 발견해야 한다. 해시는 파일 바이트를 구별하는 도구이고 내용의 진실성이나 재사용 권리를 자동으로 판정해 주지는 않는다. 기계가 검사할 부분과 사람이 확인할 부분을 나누면 검수의 빈틈을 줄일 수 있다.

편집부 해설

원본 자료와 한국어 설명을 함께

이미지 (장)

원본 자료와 한국어 설명을 함께원본 차트: 3 장 · 50.0%편집부 설명 도식: 3 장 · 50.0%
원본 수치 보기
이 글에 포함된 이미지의 구성
제작 방식이미지 (장)
원본 차트3
편집부 설명 도식3

이 글의 이미지 6장만 세었습니다. 원본 차트 3장과 편집부 도식 3장은 겹치지 않는 분류입니다. · 이 ZIP의 실제 PNG 6장을 집계했습니다. native 표·그래프는 PNG가 아니므로 제외했습니다. 산업 통계나 전체 AI 뉴스의 비율이 아닙니다.

새로운 AI 소식을 읽을 때 모든 논문과 실행 로그를 처음부터 검토할 필요는 없다. 먼저 내가 궁금한 질문을 정하고, 그 질문에 답하는 지표인지 확인한 뒤, 중요한 주장일수록 원문으로 한 단계 더 들어가면 된다. 기사에서도 같은 순서를 제공할 수 있다. 제목과 요약으로 변화를 훑고, 그림과 표로 구조를 이해하고, 조건과 출처에서 확인 범위를 점검하는 것이다. 이 글의 시각자료와 긴 본문은 그 읽기 과정을 실제로 따라갈 수 있도록 구성했다.

편집부 해설

확인된 정보와 남은 질문

출처상 확인된 내용

  • OpenAI는 낮은 추론 설정의 특정 사실성 평가에서 오류 포함 응답 비율을 11.4%와 7.7%로 보고했습니다.
  • Hugging Face는 Community Evals에서 모델 결과와 벤치마크 정의를 연결하는 방식을 소개했습니다.
  • SWE-bench Lite의 공식 데이터셋 화면은 test split을 300개로 표시합니다.
  • OWID의 학습 데이터 차트는 분야마다 데이터 포인트 단위가 다르다고 명시합니다.

확인이 더 필요한 내용

  • 이번 글에서 독립 성능 실험을 수행하지 않았습니다. 회사 발표를 재현한 결과가 아닙니다.
  • GPT 사실성 평가의 전체 표본·실행 설정을 확보하지 않아 직접 비교 막대와 순위를 만들지 않았습니다.
  • OWID의 학습 규모 자료에는 추정치와 수집 범위의 한계가 있습니다. 최신 모델 전체를 포함한 순위가 아닙니다.
  • SWE-bench 안내 문서의 Lite 크기 표기와 실제 test split 표기가 달라, 표에서는 실제 test split을 기준으로 했습니다.

출처와 확인 범위

  1. OpenAI

  2. Hugging Face

  3. Our World in Data · Epoch AI

  4. Our World in Data · Epoch AI

  5. Our World in Data · Epoch AI

  6. SWE-bench

  7. SWE-bench

  8. Hugging Face

  9. Our World in Data

  10. Creative Commons

RELATED STORYAI 평가를 읽는 기준 ↗

1개의 기록으로 이전 맥락까지 읽기

함께 읽을 기사

독자의 생각

직접 써 본 경험과 다른 관점을 나눠 주세요. 주장에는 근거를, 서로에게는 존중을 부탁드립니다.

독자 의견을 불러오고 있습니다.