AI의 변화, 근거와 맥락까지.AI NEWS & CONTEXT
BENCHMARK · 코딩

Aider Polyglot 순위

C++·Go·Java·JavaScript·Python·Rust의 어려운 연습 문제 225개를 코드 편집으로 푸는 시험(두 번째 시도까지 통과율).

평가: Aider · 측정한 모델 29개· 평가 기관 설명 보기

상위 모델

  • OpenAI
  • Anthropic
  • Google
  • xAI
GPT-5GPT-5 · 88% · 생각 수준 높음88%o3-proo3-pro · 84.9% · 생각 수준 높음84.9%Gemini 2.5 Pro (Jun 2025)Gemini 2.5 Pro (Jun 2025) · 83.1%83.1%o3o3 · 81.3% · 생각 수준 높음81.3%Grok 4Grok 4 · 79.6% · 생각 수준 높음79.6%Gemini 2.5 Pro (May 2025)Gemini 2.5 Pro (May 2025) · 76.9%76.9%Gemini 2.5 Pro (Mar 2025)Gemini 2.5 Pro (Mar 2025) · 72.9%72.9%Claude Opus 4Claude Opus 4 · 72%72%o4-minio4-mini · 72% · 생각 수준 높음72%Claude 3.7 SonnetClaude 3.7 Sonnet · 64.9%64.9%o1o1 · 61.7% · 생각 수준 높음61.7%Claude Sonnet 4Claude Sonnet 4 · 61.3%61.3%o3-minio3-mini · 60.4% · 생각 수준 높음60.4%Gemini 2.5 Flash (May 2025)Gemini 2.5 Flash (May 2025) · 55.1%55.1%Grok 3Grok 3 · 53.3%53.3%GPT-4.1GPT-4.1 · 52.4%52.4%Claude 3.5 Sonnet (October 20…Claude 3.5 Sonnet (October 2024) · 51.6%51.6%Grok-3 miniGrok-3 mini · 49.3% · 생각 수준 높음49.3%Gemini 2.5 Flash (Apr 2025)Gemini 2.5 Flash (Apr 2025) · 47.1%47.1%GPT-4.5GPT-4.5 · 44.9%44.9%
GPT-5GPT-5 · 88% · 생각 수준 높음88%o3-proo3-pro · 84.9% · 생각 수준 높음84.9%Gemini 2.5 Pro (Jun 2025)Gemini 2.5 Pro (Jun 2025) · 83.1%83.1%o3o3 · 81.3% · 생각 수준 높음81.3%Grok 4Grok 4 · 79.6% · 생각 수준 높음79.6%Gemini 2.5 Pro (May 2025)Gemini 2.5 Pro (May 2025) · 76.9%76.9%Gemini 2.5 Pro (Mar 2025)Gemini 2.5 Pro (Mar 2025) · 72.9%72.9%Claude Opus 4Claude Opus 4 · 72%72%o4-minio4-mini · 72% · 생각 수준 높음72%Claude 3.7 SonnetClaude 3.7 Sonnet · 64.9%64.9%o1o1 · 61.7% · 생각 수준 높음61.7%Claude Sonnet 4Claude Sonnet 4 · 61.3%61.3%o3-minio3-mini · 60.4% · 생각 수준 높음60.4%Gemini 2.5 Flash (May 2025)Gemini 2.5 Flash (May 2025) · 55.1%55.1%Grok 3Grok 3 · 53.3%53.3%GPT-4.1GPT-4.1 · 52.4%52.4%Claude 3.5 Sonnet (October 2024)Claude 3.5 Sonnet (October 2024) · 51.6%51.6%Grok-3 miniGrok-3 mini · 49.3% · 생각 수준 높음49.3%Gemini 2.5 Flash (Apr 2025)Gemini 2.5 Flash (Apr 2025) · 47.1%47.1%GPT-4.5GPT-4.5 · 44.9%44.9%

공개일에 따른 점수

선은 개발사별로 그때까지의 최고 점수를 잇습니다. 오른쪽 위로 갈수록 최근에 나온 높은 점수입니다.

전체 순위

순위모델점수생각 수준공개일
1GPT-5OpenAI88%높음2025-08-07
2o3-proOpenAI84.9%높음2025-06-10
3Gemini 2.5 Pro (Jun 2025)Google83.1%—2025-06-05
4o3OpenAI81.3%높음2025-04-16
5Grok 4xAI79.6%높음2025-07-09
6Gemini 2.5 Pro (May 2025)Google76.9%—2025-05-06
7Gemini 2.5 Pro (Mar 2025)Google72.9%—2025-03-25
8Claude Opus 4Anthropic72%—2025-05-22
8o4-miniOpenAI72%높음2025-04-16
10Claude 3.7 SonnetAnthropic64.9%—2025-02-24
11o1OpenAI61.7%높음2024-12-17
12Claude Sonnet 4Anthropic61.3%—2025-05-22
13o3-miniOpenAI60.4%높음2025-01-31
14Gemini 2.5 Flash (May 2025)Google55.1%—2025-05-20
15Grok 3xAI53.3%—2025-04-09
16GPT-4.1OpenAI52.4%—2025-04-14
17Claude 3.5 Sonnet (October 2024)Anthropic51.6%—2024-10-22
18Grok-3 minixAI49.3%높음2025-06-24
19Gemini 2.5 Flash (Apr 2025)Google47.1%—2025-04-17
20GPT-4.5OpenAI44.9%—2025-02-27
21gpt-oss-120bOpenAI41.8%높음2025-08-05
22Gemini 2.0 ProGoogle35.6%—2025-02-05
23o1-miniOpenAI32.9%—2024-09-12
24GPT-4.1 miniOpenAI32.4%—2025-04-14
25Claude 3.5 HaikuAnthropic28%—2024-10-22
26GPT-4o (Aug 2024)OpenAI23.1%—2024-08-06
27GPT-4o (Nov 2024)OpenAI18.2%—2024-11-20
28GPT-4.1 nanoOpenAI8.9%—2025-04-14
29GPT-4o miniOpenAI3.6%—2024-07-18

다른 벤치마크