BENCHMARK · 수학
FrontierMath(2025판) 순위
연구 수준의 매우 어려운 수학 문제(비공개). 2026년 6월 새 판으로 바뀌기 전 기록이다.
상위 모델
- OpenAI
- Anthropic
Google- xAI
공개일에 따른 점수
선은 개발사별로 그때까지의 최고 점수를 잇습니다. 오른쪽 위로 갈수록 최근에 나온 높은 점수입니다.
- GPT-5.5 Pro 52%
- Claude Opus 4.8 47%
- Gemini 3.5 Flash 39%
- Grok 4 20%
전체 순위
| 순위 | 모델 | 점수 | 생각 수준 | 공개일 |
|---|---|---|---|---|
| 1 | GPT-5.5 ProOpenAI | 52.4%±2.9% | 높음 | 2026-04-23 |
| 2 | GPT-5.5OpenAI | 51.7%±2.9% | 매우 높음 | 2026-04-23 |
| 3 | GPT-5.4 ProOpenAI | 50%±2.9% | 매우 높음 | 2026-03-05 |
| 4 | GPT-5.4OpenAI | 47.6%±2.9% | 매우 높음 | 2026-03-05 |
| 5 | Claude Opus 4.8Anthropic | 47.2%±2.9% | — | 2026-05-28 |
| 6 | Claude Opus 4.7Anthropic | 43.8%±2.9% | 매우 높음 | 2026-04-16 |
| 7 | Claude Opus 4.6Anthropic | 40.7%±2.9% | 최대 | 2026-02-05 |
| 7 | GPT-5.2OpenAI | 40.7%±2.9% | 매우 높음 | 2025-12-11 |
| 9 | 39%±2.9% | — | 2026-05-19 | |
| 10 | 37.6%±2.8% | — | 2025-11-18 | |
| 11 | 36.9%±2.8% | — | 2026-02-19 | |
| 12 | 35.6%±2.8% | — | 2025-12-17 | |
| 13 | GPT-5OpenAI | 32.4%±2.8% | 높음 | 2025-08-07 |
| 14 | Claude Sonnet 4.6Anthropic | 32.4%±2.8% | — | 2026-02-17 |
| 15 | GPT-5.1OpenAI | 31%±2.7% | 높음 | 2025-11-13 |
| 16 | GPT-5.4 MiniOpenAI | 28.3%±2.1% | 높음 | 2026-03-17 |
| 17 | GPT-5 miniOpenAI | 27.2%±2.6% | 높음 | 2025-08-07 |
| 18 | GPT-5.4 NanoOpenAI | 25.9%±2.6% | 높음 | 2026-03-17 |
| 19 | o4-miniOpenAI | 24.8%±2.5% | 높음 | 2025-04-16 |
| 20 | Claude Opus 4.5Anthropic | 20.7%±2.4% | — | 2025-11-24 |
| 21 | Grok 4xAI | 19.7%±2.3% | — | 2025-07-09 |
| 22 | o3OpenAI | 18.7%±2.3% | 높음 | 2025-04-16 |
| 23 | Claude Sonnet 4.5Anthropic | 15.2%±2.1% | — | 2025-09-29 |
| 24 | 14.1%±2.1% | — | 2025-06-05 | |
| 25 | o3-miniOpenAI | 12.4%±1.9% | 높음 | 2025-01-31 |
| 26 | o1OpenAI | 9.3%±1.7% | 높음 | 2024-12-17 |
| 27 | GPT-5 nanoOpenAI | 8.3%±1.6% | 높음 | 2025-08-07 |
| 28 | Claude Opus 4.1Anthropic | 7.2%±1.5% | — | 2025-08-05 |
| 29 | Claude Haiku 4.5Anthropic | 5.9%±1.4% | — | 2025-10-15 |
| 30 | Grok-3 minixAI | 5.9%±1.4% | — | 2025-06-24 |
| 31 | GPT-4.1OpenAI | 5.5%±1.3% | — | 2025-04-14 |
| 32 | 4.8%±1.3% | — | 2025-06-17 | |
| 33 | Claude Opus 4Anthropic | 4.5%±1.2% | — | 2025-05-22 |
| 33 | GPT-4.1 miniOpenAI | 4.5%±1.2% | — | 2025-04-14 |
| 35 | Claude Sonnet 4Anthropic | 4.1%±1.2% | — | 2025-05-22 |
| 35 | Claude 3.7 SonnetAnthropic | 4.1%±1.2% | — | 2025-02-24 |
| 37 | Grok 3xAI | 3.8%±1.1% | — | 2025-04-09 |
| 38 | Claude 3.5 Sonnet (October 2024)Anthropic | 2.1%±0.8% | — | 2024-10-22 |
| 39 | o1-miniOpenAI | 1.7%±0.8% | 중간 | 2024-09-12 |
| 40 | GPT-4.1 nanoOpenAI | 1%±0.6% | — | 2025-04-14 |
| 40 | Claude 3.5 SonnetAnthropic | 1%±0.6% | — | 2024-06-20 |
| 42 | Grok-2 (Dec 2024)xAI | 0.7%±0.5% | — | 2024-12-12 |
| 43 | GPT-4o (Nov 2024)OpenAI | 0.3%±0.3% | — | 2024-11-20 |
| 43 | Claude 3.5 HaikuAnthropic | 0.3%±0.3% | — | 2024-10-22 |
| 43 | GPT-4o (Aug 2024)OpenAI | 0.3%±0.3% | — | 2024-08-06 |
| 46 | 0% | — | 2024-09-24 |
다른 벤치마크
- GPQA Diamond 과학
- MATH Level 5 수학
- OTIS 모의 AIME 수학
- FrontierMath 1~3단계 수학
- FrontierMath 4단계 수학
- SWE-bench Verified 코딩
- MirrorCode 코딩
- SimpleQA Verified 지식
- 체스 퍼즐 추론
- 미공개 게임 퍼즐 추론
- 가구 조립 검사 공간·학습
- EBR-bench 공간·학습
- Aider Polyglot 코딩