BENCHMARK · 수학
FrontierMath 4단계 순위
FrontierMath 2026년 판에서 가장 어려운 4단계 문제(비공개).
상위 모델 여러 개가 95% 이상을 받아 이 시험은 최신 모델끼리의 차이를 가리기 어려워졌습니다(포화). 최신 모델 비교에는 다른 벤치마크를 함께 보세요.
상위 모델
- OpenAI
- Anthropic
Google- xAI
공개일에 따른 점수
선은 개발사별로 그때까지의 최고 점수를 잇습니다. 오른쪽 위로 갈수록 최근에 나온 높은 점수입니다.
- GPT-6.1 Sol 100%
- Claude Opus 5.5 95%
- Gemini 3.7 Flash 37%
- Grok 4.6 32%
전체 순위
| 순위 | 모델 | 점수 | 생각 수준 | 공개일 |
|---|---|---|---|---|
| 1 | GPT-6.1 SolOpenAI | 100% | 최대 | 2026-09-29 |
| 2 | GPT-6 AstraOpenAI | 97.6%±2.4% | 높음 | 2026-09-03 |
| 3 | Claude Opus 5.5Anthropic | 95%±4.1% | 최대 | 2026-09-22 |
| 4 | Claude Fable 5Anthropic | 90.2%±4.6% | 최대 | 2026-06-09 |
| 5 | GPT-6 SolOpenAI | 90%±5.2% | 최대 | 2026-09-22 |
| 6 | Claude Fable 5.1Anthropic | 87.8%±5.2% | 최대 | 2026-09-01 |
| 7 | GPT-5.6 SolOpenAI | 82.9%±5.9% | 최대 | 2026-07-09 |
| 8 | Claude Sonnet 5.5Anthropic | 80.5%±6.3% | 최대 | 2026-09-28 |
| 9 | GPT-5.5 ProOpenAI | 78%±6.5% | 매우 높음 | 2026-04-23 |
| 10 | Claude Opus 5Anthropic | 73.2%±7% | 최대 | 2026-07-24 |
| 11 | GPT-5.5OpenAI | 72.5%±7.1% | 매우 높음 | 2026-04-23 |
| 12 | GPT-5.6 TerraOpenAI | 70.7%±7.2% | 최대 | 2026-07-09 |
| 13 | GPT-5.6 LunaOpenAI | 61%±7.7% | 최대 | 2026-07-09 |
| 14 | GPT-5.4 ProOpenAI | 58.5%±7.8% | 매우 높음 | 2026-03-05 |
| 15 | GPT-6 LunaOpenAI | 56.1%±7.8% | 최대 | 2026-09-22 |
| 15 | Claude Opus 4.8Anthropic | 56.1%±7.8% | — | 2026-05-28 |
| 17 | GPT-5.4OpenAI | 49%±8% | 매우 높음 | 2026-03-05 |
| 18 | Claude Haiku 5.5Anthropic | 46.3%±7.9% | 최대 | 2026-10-07 |
| 19 | GPT-5.2 ProOpenAI | 46%±7.8% | — | 2025-12-11 |
| 20 | 36.6%±7.6% | 높음 | 2026-08-13 | |
| 21 | Grok 4.6xAI | 31.7%±7.4% | 매우 높음 | 2026-08-12 |
| 21 | Claude Opus 4.7Anthropic | 31.7%±7.4% | 최대 | 2026-04-16 |
| 23 | GPT-5.2OpenAI | 31.7%±7.3% | 매우 높음 | 2025-12-11 |
| 24 | Claude Sonnet 5Anthropic | 29.3%±7.2% | 최대 | 2026-06-30 |
| 25 | 26.8%±7% | — | 2026-05-19 | |
| 25 | 26.8%±7% | — | 2026-02-19 | |
| 25 | Claude Opus 4.6Anthropic | 26.8%±7% | 최대 | 2026-02-05 |
| 28 | Grok 4.5xAI | 24.4%±6.8% | 높음 | 2026-07-08 |
| 29 | 21.9%±6.5% | 높음 | 2026-09-02 | |
| 29 | 21.9%±6.5% | — | 2026-07-21 | |
| 29 | GPT-5OpenAI | 21.9%±6.5% | 높음 | 2025-08-07 |
| 32 | GPT-5 ProOpenAI | 19.5%±6.3% | — | 2025-10-07 |
| 33 | Grok 4.7xAI | 17.1%±5.9% | 매우 높음 | 2026-09-21 |
| 33 | Grok 4.20xAI | 17.1%±5.9% | — | 2026-02-17 |
| 33 | 17.1%±5.9% | — | 2025-12-17 | |
| 36 | Grok 4.3 BetaxAI | 14.6%±5.6% | — | 2026-04-17 |
| 37 | GPT-5.4 NanoOpenAI | 12.2%±5.2% | 높음 | 2026-03-17 |
| 37 | GPT-5 miniOpenAI | 12.2%±5.2% | 높음 | 2025-08-07 |
| 39 | GPT-5.4 MiniOpenAI | 9.8%±4.7% | 매우 높음 | 2026-03-17 |
| 40 | Claude Opus 4.5Anthropic | 4.9%±3.4% | — | 2025-11-24 |
| 40 | o4-miniOpenAI | 4.9%±3.4% | 높음 | 2025-04-16 |
| 42 | GPT-5.5 InstantOpenAI | 2.4%±2.4% | — | 2026-05-05 |
| 42 | Claude Sonnet 4.5Anthropic | 2.4%±2.4% | — | 2025-09-29 |
| 42 | GPT-5 nanoOpenAI | 2.4%±2.4% | 높음 | 2025-08-07 |
| 42 | Claude Opus 4.1Anthropic | 2.4%±2.4% | — | 2025-08-05 |
| 46 | 0% | — | 2026-07-21 | |
| 46 | 0% | — | 2025-06-05 | |
| 46 | o3-miniOpenAI | 0% | 높음 | 2025-01-31 |
다른 벤치마크
- GPQA Diamond 과학
- MATH Level 5 수학
- OTIS 모의 AIME 수학
- FrontierMath(2025판) 수학
- FrontierMath 1~3단계 수학
- SWE-bench Verified 코딩
- MirrorCode 코딩
- SimpleQA Verified 지식
- 체스 퍼즐 추론
- 미공개 게임 퍼즐 추론
- 가구 조립 검사 공간·학습
- EBR-bench 공간·학습
- Aider Polyglot 코딩