MODELS / AI 모델 비교
AI 모델 비교
GPT-1부터 GPT-6 Astra까지, GPT·Claude·Gemini·Grok 모델의 공개일과 독립 벤치마크 점수, 사람 투표 순위를 그래프로 비교합니다.
- 모델
- 118개
- 독립 벤치마크
- 14종
- 최신 공개 모델
- Claude Haiku 5.5
- 자료 기준일
- 2026-10-11
AI 성능은 어떻게 올라왔나
점 하나가 모델 하나입니다. 가로는 공개일, 세로는 Epoch AI의 종합 능력 지수(ECI)입니다. 선은 개발사별로 그때까지의 최고 기록을 잇습니다. 점을 누르면 모델 페이지로 갑니다.
- OpenAI
- Anthropic
Google- xAI
- Claude Opus 5.5 167.3
- GPT-6 Astra 166.5
- Gemini 3.7 Flash 157.3
- Grok 4.6 156.4
GPT-1에서 GPT-6 Astra까지, 모델은 얼마나 커졌나
모델을 학습시키는 데 쓴 계산량을 로그 눈금(10ⁿ은 10을 n번 곱한 수)으로 그렸습니다. GPT-1에서 GPT-6 Astra까지 약 5,689만 배 늘었습니다. 대부분 Epoch AI가 공개 자료로 추정한 값이라 오차가 있습니다.
- GPT-6 Astra 1.0×10²⁷
- Grok 4 5.0×10²⁶
- Gemini 1.0 Ultra 5.0×10²⁵
- Claude 3.7 Sonnet 3.4×10²⁵
종합 지수 상위 10
사람 투표(Arena) 상위 10
벤치마크별 순위
과학GPQA Diamond
- GPT-6 Astra95.8%
- Claude Sonnet 5.595.6%
- GPT-6.1 Sol95.4%
- GPT-598.1%
- GPT-5 mini97.9%
- o4-mini97.8%
- GPT-6.1 Sol100%
- Claude Sonnet 5.5100%
- GPT-6 Sol100%
- GPT-5.5 Pro52.4%
- GPT-5.551.7%
- GPT-5.4 Pro50%
- GPT-6.1 Sol93.7%
- GPT-6 Astra93.7%
- Claude Opus 5.591.2%
- GPT-6.1 Sol100%
- GPT-6 Astra97.6%
- Claude Opus 5.595%
- Claude Opus 4.783.5%
- GPT-5.580.6%
Gemini 3.5 Flash79.3%
- Claude Opus 5.577.4%
- Claude Fable 5.173.3%
- Claude Fable 563.9%
- GPT-6 Astra75.6%
- GPT-6.1 Sol73.9%
Gemini 3.1 Pro73.5%
- GPT-6 Astra72%
- GPT-5.6 Sol64%
- GPT-5.5 Pro64%
- GPT-6 Astra84%
- GPT-6.1 Sol80%
- Claude Opus 5.571%
- Claude Opus 5.583.3%
- GPT-6.1 Sol80%
- GPT-6 Astra80%
- GPT-6 Astra76.2%
- Claude Opus 5.571.4%
- Claude Fable 5.157.1%
- GPT-588%
- o3-pro84.9%
Gemini 2.5 Pro (Jun 2025)83.1%
전체 모델
점수 읽는 법
- 종합 지수(ECI)는 Epoch AI가 여러 벤치마크 결과를 하나의 척도로 묶은 값입니다. 높을수록 전반적으로 어려운 문제를 더 잘 풉니다.
- Arena는 사람들이 두 모델의 답을 나란히 보고 더 나은 쪽을 고른 투표로 매긴 점수입니다. 정답률이 아니라 선호도입니다.
- 독립 벤치마크는 Epoch AI와 Aider가 같은 방식으로 직접 잰 점수입니다. 개발사가 발표한 점수는 평가 방식이 달라 모델 페이지에 따로 표시합니다.
- 한 모델을 여러 생각 수준(낮음~최대)으로 잰 경우 가장 높은 점수를 씁니다. 같은 이름이라도 날짜별 버전은 따로 나눴습니다.