BENCHMARK · 코딩
SWE-bench Verified 순위
실제 오픈소스 저장소의 이슈를 고치는 과제. 사람이 검증한 500개 문항이다.
상위 모델
- OpenAI
- Anthropic
Google- xAI
공개일에 따른 점수
선은 개발사별로 그때까지의 최고 점수를 잇습니다. 오른쪽 위로 갈수록 최근에 나온 높은 점수입니다.
- Claude Opus 4.7 83%
- GPT-5.5 81%
- Gemini 3.5 Flash 79%
전체 순위
| 순위 | 모델 | 점수 | 생각 수준 | 공개일 |
|---|---|---|---|---|
| 1 | Claude Opus 4.7Anthropic | 83.5%±1.7% | 최대 | 2026-04-16 |
| 2 | GPT-5.5OpenAI | 80.6%±1.8% | 매우 높음 | 2026-04-23 |
| 3 | 79.3%±1.8% | — | 2026-05-19 | |
| 4 | Claude Opus 4.6Anthropic | 78.7%±1.9% | — | 2026-02-05 |
| 5 | GPT-5.4OpenAI | 76.9%±1.9% | 높음 | 2026-03-05 |
| 6 | Claude Opus 4.5Anthropic | 76.6%±1.9% | — | 2025-11-24 |
| 7 | 75.6%±1.9% | — | 2026-02-19 | |
| 8 | 75.4%±2% | — | 2025-12-17 | |
| 9 | Claude Sonnet 4.6Anthropic | 75.2%±2% | — | 2026-02-17 |
| 10 | GPT-5.3 CodexOpenAI | 74.8%±2% | 높음 | 2026-02-05 |
| 11 | GPT-5.2OpenAI | 73.8%±2% | 높음 | 2025-12-11 |
| 12 | GPT-5OpenAI | 73.6%±2% | 높음 | 2025-08-07 |
| 13 | Claude Opus 4.1Anthropic | 73.4%±2% | — | 2025-08-05 |
| 14 | 72.9%±2% | — | 2025-11-18 | |
| 15 | Claude Sonnet 4.5Anthropic | 71.3%±2.1% | — | 2025-09-29 |
| 16 | Claude Opus 4Anthropic | 70.7%±2.1% | — | 2025-05-22 |
| 17 | GPT-5.1OpenAI | 68%±2.1% | 높음 | 2025-11-13 |
| 18 | GPT-5 miniOpenAI | 64.7%±2.2% | 중간 | 2025-08-07 |
| 19 | o3OpenAI | 62.3%±2.2% | 중간 | 2025-04-16 |
| 20 | Claude 3.7 SonnetAnthropic | 61%±2.2% | — | 2025-02-24 |
| 21 | 57.6%±2.3% | — | 2025-06-05 | |
| 22 | GPT-4.1OpenAI | 48.5%±2.3% | — | 2025-04-14 |
| 23 | GPT-4o (Nov 2024)OpenAI | 31%±2.1% | — | 2024-11-20 |
다른 벤치마크
- GPQA Diamond 과학
- MATH Level 5 수학
- OTIS 모의 AIME 수학
- FrontierMath(2025판) 수학
- FrontierMath 1~3단계 수학
- FrontierMath 4단계 수학
- MirrorCode 코딩
- SimpleQA Verified 지식
- 체스 퍼즐 추론
- 미공개 게임 퍼즐 추론
- 가구 조립 검사 공간·학습
- EBR-bench 공간·학습
- Aider Polyglot 코딩