BENCHMARK · 코딩
Aider Polyglot 순위
C++·Go·Java·JavaScript·Python·Rust의 어려운 연습 문제 225개를 코드 편집으로 푸는 시험(두 번째 시도까지 통과율).
상위 모델
- OpenAI
- Anthropic
Google- xAI
공개일에 따른 점수
선은 개발사별로 그때까지의 최고 점수를 잇습니다. 오른쪽 위로 갈수록 최근에 나온 높은 점수입니다.
- GPT-5 88%
- Gemini 2.5 Pro (Jun 2025) 83%
- Grok 4 80%
- Claude Opus 4 72%
전체 순위
| 순위 | 모델 | 점수 | 생각 수준 | 공개일 |
|---|---|---|---|---|
| 1 | GPT-5OpenAI | 88% | 높음 | 2025-08-07 |
| 2 | o3-proOpenAI | 84.9% | 높음 | 2025-06-10 |
| 3 | 83.1% | — | 2025-06-05 | |
| 4 | o3OpenAI | 81.3% | 높음 | 2025-04-16 |
| 5 | Grok 4xAI | 79.6% | 높음 | 2025-07-09 |
| 6 | 76.9% | — | 2025-05-06 | |
| 7 | 72.9% | — | 2025-03-25 | |
| 8 | Claude Opus 4Anthropic | 72% | — | 2025-05-22 |
| 8 | o4-miniOpenAI | 72% | 높음 | 2025-04-16 |
| 10 | Claude 3.7 SonnetAnthropic | 64.9% | — | 2025-02-24 |
| 11 | o1OpenAI | 61.7% | 높음 | 2024-12-17 |
| 12 | Claude Sonnet 4Anthropic | 61.3% | — | 2025-05-22 |
| 13 | o3-miniOpenAI | 60.4% | 높음 | 2025-01-31 |
| 14 | 55.1% | — | 2025-05-20 | |
| 15 | Grok 3xAI | 53.3% | — | 2025-04-09 |
| 16 | GPT-4.1OpenAI | 52.4% | — | 2025-04-14 |
| 17 | Claude 3.5 Sonnet (October 2024)Anthropic | 51.6% | — | 2024-10-22 |
| 18 | Grok-3 minixAI | 49.3% | 높음 | 2025-06-24 |
| 19 | 47.1% | — | 2025-04-17 | |
| 20 | GPT-4.5OpenAI | 44.9% | — | 2025-02-27 |
| 21 | gpt-oss-120bOpenAI | 41.8% | 높음 | 2025-08-05 |
| 22 | 35.6% | — | 2025-02-05 | |
| 23 | o1-miniOpenAI | 32.9% | — | 2024-09-12 |
| 24 | GPT-4.1 miniOpenAI | 32.4% | — | 2025-04-14 |
| 25 | Claude 3.5 HaikuAnthropic | 28% | — | 2024-10-22 |
| 26 | GPT-4o (Aug 2024)OpenAI | 23.1% | — | 2024-08-06 |
| 27 | GPT-4o (Nov 2024)OpenAI | 18.2% | — | 2024-11-20 |
| 28 | GPT-4.1 nanoOpenAI | 8.9% | — | 2025-04-14 |
| 29 | GPT-4o miniOpenAI | 3.6% | — | 2024-07-18 |
다른 벤치마크
- GPQA Diamond 과학
- MATH Level 5 수학
- OTIS 모의 AIME 수학
- FrontierMath(2025판) 수학
- FrontierMath 1~3단계 수학
- FrontierMath 4단계 수학
- SWE-bench Verified 코딩
- MirrorCode 코딩
- SimpleQA Verified 지식
- 체스 퍼즐 추론
- 미공개 게임 퍼즐 추론
- 가구 조립 검사 공간·학습
- EBR-bench 공간·학습