AI의 변화, 근거와 맥락까지.AI NEWS & CONTEXT
BENCHMARK · 코딩

MirrorCode 순위

원본 소스 코드 없이 프로그램 전체를 처음부터 다시 구현하는 장기 코딩 과제.

평가: Epoch AI · 측정한 모델 9개· 평가 기관 설명 보기

상위 모델

  • OpenAI
  • Anthropic
  • Google
  • xAI
Claude Opus 5.5Claude Opus 5.5 · 77.4% · 생각 수준 최대77.4%Claude Fable 5.1Claude Fable 5.1 · 73.3% · 생각 수준 높음73.3%Claude Fable 5Claude Fable 5 · 63.9% · 생각 수준 높음63.9%GPT-6 AstraGPT-6 Astra · 46.7% · 생각 수준 높음46.7%Claude Opus 4.7Claude Opus 4.7 · 31.1% · 생각 수준 높음31.1%GPT-5.6 SolGPT-5.6 Sol · 20% · 생각 수준 높음20%GPT-5.4GPT-5.4 · 15.6% · 생각 수준 높음15.6%GPT-5.5GPT-5.5 · 10% · 생각 수준 높음10%Gemini 3.1 ProGemini 3.1 Pro · 8.9%8.9%
Claude Opus 5.5Claude Opus 5.5 · 77.4% · 생각 수준 최대77.4%Claude Fable 5.1Claude Fable 5.1 · 73.3% · 생각 수준 높음73.3%Claude Fable 5Claude Fable 5 · 63.9% · 생각 수준 높음63.9%GPT-6 AstraGPT-6 Astra · 46.7% · 생각 수준 높음46.7%Claude Opus 4.7Claude Opus 4.7 · 31.1% · 생각 수준 높음31.1%GPT-5.6 SolGPT-5.6 Sol · 20% · 생각 수준 높음20%GPT-5.4GPT-5.4 · 15.6% · 생각 수준 높음15.6%GPT-5.5GPT-5.5 · 10% · 생각 수준 높음10%Gemini 3.1 ProGemini 3.1 Pro · 8.9%8.9%

공개일에 따른 점수

선은 개발사별로 그때까지의 최고 점수를 잇습니다. 오른쪽 위로 갈수록 최근에 나온 높은 점수입니다.

전체 순위

순위모델점수생각 수준공개일
1Claude Opus 5.5Anthropic77.4%±8.3%최대2026-09-22
2Claude Fable 5.1Anthropic73.3%±9.2%높음2026-09-01
3Claude Fable 5Anthropic63.9%±10.4%높음2026-06-09
4GPT-6 AstraOpenAI46.7%±11.9%높음2026-09-03
5Claude Opus 4.7Anthropic31.1%±9%높음2026-04-16
6GPT-5.6 SolOpenAI20%±9.2%높음2026-07-09
7GPT-5.4OpenAI15.6%±7.7%높음2026-03-05
8GPT-5.5OpenAI10%±6%높음2026-04-23
9Gemini 3.1 ProGoogle8.9%±4.6%—2026-02-19

다른 벤치마크