BENCHMARK · 수학
MATH Level 5 순위
MATH 데이터셋에서 가장 어려운 단계. AMC 10·12, AIME 같은 경시대회 문제다.
상위 모델 여러 개가 95% 이상을 받아 이 시험은 최신 모델끼리의 차이를 가리기 어려워졌습니다(포화). 최신 모델 비교에는 다른 벤치마크를 함께 보세요.
상위 모델
- OpenAI
- Anthropic
Google- xAI
공개일에 따른 점수
선은 개발사별로 그때까지의 최고 점수를 잇습니다. 오른쪽 위로 갈수록 최근에 나온 높은 점수입니다.
- GPT-5 98%
- Claude Sonnet 4.5 98%
- Gemini 2.5 Pro (May 2025) 96%
- Grok-3 mini 91%
전체 순위
| 순위 | 모델 | 점수 | 생각 수준 | 공개일 |
|---|---|---|---|---|
| 1 | GPT-5OpenAI | 98.1%±0.3% | 높음 | 2025-08-07 |
| 2 | GPT-5 miniOpenAI | 97.9%±0.3% | 높음 | 2025-08-07 |
| 3 | o4-miniOpenAI | 97.8%±0.3% | 높음 | 2025-04-16 |
| 4 | o3OpenAI | 97.8%±0.3% | 높음 | 2025-04-16 |
| 5 | Claude Sonnet 4.5Anthropic | 97.7%±0.4% | — | 2025-09-29 |
| 6 | o3-miniOpenAI | 96.5%±0.4% | 높음 | 2025-01-31 |
| 7 | Claude Haiku 4.5Anthropic | 96.4%±0.5% | — | 2025-10-15 |
| 8 | 95.9%±0.4% | — | 2025-05-06 | |
| 9 | 95.6%±0.4% | — | 2025-03-25 | |
| 10 | GPT-5 nanoOpenAI | 95.2%±0.5% | 중간 | 2025-08-07 |
| 11 | o1OpenAI | 94.7%±0.6% | 높음 | 2024-12-17 |
| 12 | Claude 3.7 SonnetAnthropic | 91.2%±0.8% | — | 2025-02-24 |
| 13 | Grok-3 minixAI | 90.9%±0.8% | — | 2025-06-24 |
| 14 | o1-miniOpenAI | 89.2%±0.7% | 높음 | 2024-09-12 |
| 15 | Grok 3xAI | 88.8%±0.9% | — | 2025-04-09 |
| 16 | GPT-4.1 miniOpenAI | 87.3%±0.7% | — | 2025-04-14 |
| 17 | Claude Opus 4Anthropic | 85%±1% | — | 2025-05-22 |
| 18 | Claude Sonnet 4Anthropic | 84.4%±1% | — | 2025-05-22 |
| 19 | 83.5%±1% | — | 2025-02-05 | |
| 20 | GPT-4.1OpenAI | 83%±0.9% | — | 2025-04-14 |
| 21 | o1-previewOpenAI | 81.7%±1.1% | — | 2024-09-12 |
| 22 | GPT-4.5OpenAI | 78.6%±1.1% | — | 2025-02-27 |
| 23 | 70.4%±1% | — | 2024-09-24 | |
| 24 | GPT-4.1 nanoOpenAI | 70%±1% | — | 2025-04-14 |
| 25 | Grok-2 (Dec 2024)xAI | 63.5%±1.3% | — | 2024-12-12 |
| 26 | 61.9%±1.1% | — | 2024-09-24 | |
| 27 | Claude 3.5 Sonnet (October 2024)Anthropic | 57%±1.1% | — | 2024-10-22 |
| 28 | GPT-4o (Aug 2024)OpenAI | 53.3%±1.1% | — | 2024-08-06 |
| 29 | GPT-4o miniOpenAI | 52.6%±1.1% | — | 2024-07-18 |
| 30 | Claude 3.5 SonnetAnthropic | 51.7%±1.2% | — | 2024-06-20 |
| 31 | GPT-4o (May 2024)OpenAI | 51%±1.1% | — | 2024-05-13 |
| 32 | GPT-4o (Nov 2024)OpenAI | 49.8%±1.1% | — | 2024-11-20 |
| 33 | GPT-4 Turbo (Apr 2024)OpenAI | 46.7%±1.1% | — | 2024-04-09 |
| 34 | Claude 3.5 HaikuAnthropic | 46.4%±1.2% | — | 2024-10-22 |
| 35 | 40.8%±1.1% | — | 2024-05-14 | |
| 36 | GPT-4 Turbo (Nov 2023)OpenAI | 40%±1.1% | — | 2024-01-25 |
| 37 | Claude 3 OpusAnthropic | 37.5%±1.1% | — | 2024-02-29 |
| 38 | 25.1%±0.9% | — | 2024-05-23 | |
| 39 | GPT-4 (Jun 2023)OpenAI | 23%±0.9% | — | 2023-06-13 |
| 40 | Claude 3 SonnetAnthropic | 18.2%±0.8% | — | 2024-02-29 |
| 41 | GPT-3.5 Turbo (Nov 2023)OpenAI | 15.9%±0.7% | — | 2023-11-06 |
| 42 | Claude 3 HaikuAnthropic | 14.9%±0.7% | — | 2024-03-07 |
| 43 | Claude 2Anthropic | 11.7%±0.7% | — | 2023-07-11 |
| 44 | GPT-3.5 Turbo (Jan 2024)OpenAI | 11.6%±0.5% | — | 2024-01-25 |
| 45 | 11.2%±0.6% | — | 2023-12-13 |
다른 벤치마크
- GPQA Diamond 과학
- OTIS 모의 AIME 수학
- FrontierMath(2025판) 수학
- FrontierMath 1~3단계 수학
- FrontierMath 4단계 수학
- SWE-bench Verified 코딩
- MirrorCode 코딩
- SimpleQA Verified 지식
- 체스 퍼즐 추론
- 미공개 게임 퍼즐 추론
- 가구 조립 검사 공간·학습
- EBR-bench 공간·학습
- Aider Polyglot 코딩