AI의 변화, 근거와 맥락까지.AI NEWS & CONTEXT
BENCHMARK · 공간·학습

EBR-bench 순위

덜 알려진 게임 Earthborne Rangers를 반복해서 할수록 점수가 오르는지 보는 학습 능력 시험.

평가: Epoch AI · 측정한 모델 21개· 평가 기관 설명 보기

상위 모델

  • OpenAI
  • Anthropic
  • Google
  • xAI
GPT-6 AstraGPT-6 Astra · 76.2% · 생각 수준 최대76.2%Claude Opus 5.5Claude Opus 5.5 · 71.4% · 생각 수준 최대71.4%Claude Fable 5.1Claude Fable 5.1 · 57.1% · 생각 수준 최대57.1%GPT-6.1 SolGPT-6.1 Sol · 54.3% · 생각 수준 최대54.3%GPT-6 SolGPT-6 Sol · 53.3% · 생각 수준 최대53.3%Claude Opus 5Claude Opus 5 · 45.7% · 생각 수준 최대45.7%GPT-5.6 SolGPT-5.6 Sol · 44.8% · 생각 수준 최대44.8%Claude Fable 5Claude Fable 5 · 39.5% · 생각 수준 최대39.5%GPT-5.5GPT-5.5 · 34.3% · 생각 수준 매우 높음34.3%Grok 4.6Grok 4.6 · 30.5% · 생각 수준 매우 높음30.5%Claude Opus 4.8Claude Opus 4.8 · 28.6%28.6%GPT-5.4GPT-5.4 · 25.4% · 생각 수준 매우 높음25.4%GPT-5.2GPT-5.2 · 23% · 생각 수준 매우 높음23%Claude Opus 4.7Claude Opus 4.7 · 19.1% · 생각 수준 최대19.1%Gemini 3.1 ProGemini 3.1 Pro · 14.3%14.3%Claude Opus 4.5Claude Opus 4.5 · 14.3%14.3%Claude Opus 4.6Claude Opus 4.6 · 12.7% · 생각 수준 최대12.7%GPT-5GPT-5 · 12.7% · 생각 수준 높음12.7%Claude Opus 4.1Claude Opus 4.1 · 7.9%7.9%Gemini 3.5 FlashGemini 3.5 Flash · 4.8%4.8%
GPT-6 AstraGPT-6 Astra · 76.2% · 생각 수준 최대76.2%Claude Opus 5.5Claude Opus 5.5 · 71.4% · 생각 수준 최대71.4%Claude Fable 5.1Claude Fable 5.1 · 57.1% · 생각 수준 최대57.1%GPT-6.1 SolGPT-6.1 Sol · 54.3% · 생각 수준 최대54.3%GPT-6 SolGPT-6 Sol · 53.3% · 생각 수준 최대53.3%Claude Opus 5Claude Opus 5 · 45.7% · 생각 수준 최대45.7%GPT-5.6 SolGPT-5.6 Sol · 44.8% · 생각 수준 최대44.8%Claude Fable 5Claude Fable 5 · 39.5% · 생각 수준 최대39.5%GPT-5.5GPT-5.5 · 34.3% · 생각 수준 매우 높음34.3%Grok 4.6Grok 4.6 · 30.5% · 생각 수준 매우 높음30.5%Claude Opus 4.8Claude Opus 4.8 · 28.6%28.6%GPT-5.4GPT-5.4 · 25.4% · 생각 수준 매우 높음25.4%GPT-5.2GPT-5.2 · 23% · 생각 수준 매우 높음23%Claude Opus 4.7Claude Opus 4.7 · 19.1% · 생각 수준 최대19.1%Gemini 3.1 ProGemini 3.1 Pro · 14.3%14.3%Claude Opus 4.5Claude Opus 4.5 · 14.3%14.3%Claude Opus 4.6Claude Opus 4.6 · 12.7% · 생각 수준 최대12.7%GPT-5GPT-5 · 12.7% · 생각 수준 높음12.7%Claude Opus 4.1Claude Opus 4.1 · 7.9%7.9%Gemini 3.5 FlashGemini 3.5 Flash · 4.8%4.8%

공개일에 따른 점수

선은 개발사별로 그때까지의 최고 점수를 잇습니다. 오른쪽 위로 갈수록 최근에 나온 높은 점수입니다.

전체 순위

순위모델점수생각 수준공개일
1GPT-6 AstraOpenAI76.2%±8.4%최대2026-09-03
2Claude Opus 5.5Anthropic71.4%±7.1%최대2026-09-22
3Claude Fable 5.1Anthropic57.1%±6%최대2026-09-01
4GPT-6.1 SolOpenAI54.3%±5.8%최대2026-09-29
5GPT-6 SolOpenAI53.3%±4.6%최대2026-09-22
6Claude Opus 5Anthropic45.7%±3.6%최대2026-07-24
7GPT-5.6 SolOpenAI44.8%±4.2%최대2026-07-09
8Claude Fable 5Anthropic39.5%±2%최대2026-06-09
9GPT-5.5OpenAI34.3%±2%매우 높음2026-04-23
10Grok 4.6xAI30.5%±1.6%매우 높음2026-08-12
11Claude Opus 4.8Anthropic28.6%±1.4%—2026-05-28
12GPT-5.4OpenAI25.4%매우 높음2026-03-05
13GPT-5.2OpenAI23%매우 높음2025-12-11
14Claude Opus 4.7Anthropic19.1%최대2026-04-16
15Gemini 3.1 ProGoogle14.3%—2026-02-19
15Claude Opus 4.5Anthropic14.3%—2025-11-24
17Claude Opus 4.6Anthropic12.7%최대2026-02-05
17GPT-5OpenAI12.7%높음2025-08-07
19Claude Opus 4.1Anthropic7.9%—2025-08-05
20Gemini 3.5 FlashGoogle4.8%—2026-05-19
21Claude Sonnet 4.5Anthropic2.4%—2025-09-29

다른 벤치마크