AI의 변화, 근거와 맥락까지.AI NEWS & CONTEXT
BENCHMARK · 코딩

SWE-bench Verified 순위

실제 오픈소스 저장소의 이슈를 고치는 과제. 사람이 검증한 500개 문항이다.

평가: Epoch AI · 측정한 모델 23개· 평가 기관 설명 보기

상위 모델

  • OpenAI
  • Anthropic
  • Google
  • xAI
Claude Opus 4.7Claude Opus 4.7 · 83.5% · 생각 수준 최대83.5%GPT-5.5GPT-5.5 · 80.6% · 생각 수준 매우 높음80.6%Gemini 3.5 FlashGemini 3.5 Flash · 79.3%79.3%Claude Opus 4.6Claude Opus 4.6 · 78.7%78.7%GPT-5.4GPT-5.4 · 76.9% · 생각 수준 높음76.9%Claude Opus 4.5Claude Opus 4.5 · 76.6%76.6%Gemini 3.1 ProGemini 3.1 Pro · 75.6%75.6%Gemini 3 FlashGemini 3 Flash · 75.4%75.4%Claude Sonnet 4.6Claude Sonnet 4.6 · 75.2%75.2%GPT-5.3 CodexGPT-5.3 Codex · 74.8% · 생각 수준 높음74.8%GPT-5.2GPT-5.2 · 73.8% · 생각 수준 높음73.8%GPT-5GPT-5 · 73.6% · 생각 수준 높음73.6%Claude Opus 4.1Claude Opus 4.1 · 73.4%73.4%Gemini 3 ProGemini 3 Pro · 72.9%72.9%Claude Sonnet 4.5Claude Sonnet 4.5 · 71.3%71.3%Claude Opus 4Claude Opus 4 · 70.7%70.7%GPT-5.1GPT-5.1 · 68% · 생각 수준 높음68%GPT-5 miniGPT-5 mini · 64.7% · 생각 수준 중간64.7%o3o3 · 62.3% · 생각 수준 중간62.3%Claude 3.7 SonnetClaude 3.7 Sonnet · 61%61%
Claude Opus 4.7Claude Opus 4.7 · 83.5% · 생각 수준 최대83.5%GPT-5.5GPT-5.5 · 80.6% · 생각 수준 매우 높음80.6%Gemini 3.5 FlashGemini 3.5 Flash · 79.3%79.3%Claude Opus 4.6Claude Opus 4.6 · 78.7%78.7%GPT-5.4GPT-5.4 · 76.9% · 생각 수준 높음76.9%Claude Opus 4.5Claude Opus 4.5 · 76.6%76.6%Gemini 3.1 ProGemini 3.1 Pro · 75.6%75.6%Gemini 3 FlashGemini 3 Flash · 75.4%75.4%Claude Sonnet 4.6Claude Sonnet 4.6 · 75.2%75.2%GPT-5.3 CodexGPT-5.3 Codex · 74.8% · 생각 수준 높음74.8%GPT-5.2GPT-5.2 · 73.8% · 생각 수준 높음73.8%GPT-5GPT-5 · 73.6% · 생각 수준 높음73.6%Claude Opus 4.1Claude Opus 4.1 · 73.4%73.4%Gemini 3 ProGemini 3 Pro · 72.9%72.9%Claude Sonnet 4.5Claude Sonnet 4.5 · 71.3%71.3%Claude Opus 4Claude Opus 4 · 70.7%70.7%GPT-5.1GPT-5.1 · 68% · 생각 수준 높음68%GPT-5 miniGPT-5 mini · 64.7% · 생각 수준 중간64.7%o3o3 · 62.3% · 생각 수준 중간62.3%Claude 3.7 SonnetClaude 3.7 Sonnet · 61%61%

공개일에 따른 점수

선은 개발사별로 그때까지의 최고 점수를 잇습니다. 오른쪽 위로 갈수록 최근에 나온 높은 점수입니다.

전체 순위

순위모델점수생각 수준공개일
1Claude Opus 4.7Anthropic83.5%±1.7%최대2026-04-16
2GPT-5.5OpenAI80.6%±1.8%매우 높음2026-04-23
3Gemini 3.5 FlashGoogle79.3%±1.8%—2026-05-19
4Claude Opus 4.6Anthropic78.7%±1.9%—2026-02-05
5GPT-5.4OpenAI76.9%±1.9%높음2026-03-05
6Claude Opus 4.5Anthropic76.6%±1.9%—2025-11-24
7Gemini 3.1 ProGoogle75.6%±1.9%—2026-02-19
8Gemini 3 FlashGoogle75.4%±2%—2025-12-17
9Claude Sonnet 4.6Anthropic75.2%±2%—2026-02-17
10GPT-5.3 CodexOpenAI74.8%±2%높음2026-02-05
11GPT-5.2OpenAI73.8%±2%높음2025-12-11
12GPT-5OpenAI73.6%±2%높음2025-08-07
13Claude Opus 4.1Anthropic73.4%±2%—2025-08-05
14Gemini 3 ProGoogle72.9%±2%—2025-11-18
15Claude Sonnet 4.5Anthropic71.3%±2.1%—2025-09-29
16Claude Opus 4Anthropic70.7%±2.1%—2025-05-22
17GPT-5.1OpenAI68%±2.1%높음2025-11-13
18GPT-5 miniOpenAI64.7%±2.2%중간2025-08-07
19o3OpenAI62.3%±2.2%중간2025-04-16
20Claude 3.7 SonnetAnthropic61%±2.2%—2025-02-24
21Gemini 2.5 Pro (Jun 2025)Google57.6%±2.3%—2025-06-05
22GPT-4.1OpenAI48.5%±2.3%—2025-04-14
23GPT-4o (Nov 2024)OpenAI31%±2.1%—2024-11-20

다른 벤치마크