BENCHMARK · 코딩
MirrorCode 순위
원본 소스 코드 없이 프로그램 전체를 처음부터 다시 구현하는 장기 코딩 과제.
상위 모델
- OpenAI
- Anthropic
Google- xAI
공개일에 따른 점수
선은 개발사별로 그때까지의 최고 점수를 잇습니다. 오른쪽 위로 갈수록 최근에 나온 높은 점수입니다.
- Claude Opus 5.5 77%
- GPT-6 Astra 47%
- Gemini 3.1 Pro 9%
전체 순위
| 순위 | 모델 | 점수 | 생각 수준 | 공개일 |
|---|---|---|---|---|
| 1 | Claude Opus 5.5Anthropic | 77.4%±8.3% | 최대 | 2026-09-22 |
| 2 | Claude Fable 5.1Anthropic | 73.3%±9.2% | 높음 | 2026-09-01 |
| 3 | Claude Fable 5Anthropic | 63.9%±10.4% | 높음 | 2026-06-09 |
| 4 | GPT-6 AstraOpenAI | 46.7%±11.9% | 높음 | 2026-09-03 |
| 5 | Claude Opus 4.7Anthropic | 31.1%±9% | 높음 | 2026-04-16 |
| 6 | GPT-5.6 SolOpenAI | 20%±9.2% | 높음 | 2026-07-09 |
| 7 | GPT-5.4OpenAI | 15.6%±7.7% | 높음 | 2026-03-05 |
| 8 | GPT-5.5OpenAI | 10%±6% | 높음 | 2026-04-23 |
| 9 | 8.9%±4.6% | — | 2026-02-19 |
다른 벤치마크
- GPQA Diamond 과학
- MATH Level 5 수학
- OTIS 모의 AIME 수학
- FrontierMath(2025판) 수학
- FrontierMath 1~3단계 수학
- FrontierMath 4단계 수학
- SWE-bench Verified 코딩
- SimpleQA Verified 지식
- 체스 퍼즐 추론
- 미공개 게임 퍼즐 추론
- 가구 조립 검사 공간·학습
- EBR-bench 공간·학습
- Aider Polyglot 코딩