AI의 변화, 근거와 맥락까지.AI NEWS & CONTEXT
BENCHMARK · 공간·학습

가구 조립 검사 순위

가구 조립 사진을 보고 조립이 맞는지, 틀렸다면 어느 단계가 틀렸는지 찾는 공간 추론 시험.

평가: Epoch AI · 측정한 모델 27개 · 찍어서 맞힐 때 30%· 평가 기관 설명 보기

상위 모델

  • OpenAI
  • Anthropic
  • Google
  • xAI
Claude Opus 5.5Claude Opus 5.5 · 83.3% · 생각 수준 최대83.3%GPT-6.1 SolGPT-6.1 Sol · 80% · 생각 수준 최대80%GPT-6 AstraGPT-6 Astra · 80% · 생각 수준 최대80%Claude Sonnet 5.5Claude Sonnet 5.5 · 75% · 생각 수준 최대75%Claude Fable 5.1Claude Fable 5.1 · 70% · 생각 수준 최대70%Claude Opus 5Claude Opus 5 · 60.8% · 생각 수준 최대60.8%GPT-6 SolGPT-6 Sol · 58.3% · 생각 수준 최대58.3%GPT-5.6 SolGPT-5.6 Sol · 56.7% · 생각 수준 최대56.7%GPT-5.6 TerraGPT-5.6 Terra · 54.2% · 생각 수준 최대54.2%Claude Haiku 5.5Claude Haiku 5.5 · 47.5% · 생각 수준 최대47.5%GPT-6 LunaGPT-6 Luna · 44.2% · 생각 수준 최대44.2%GPT-5.5GPT-5.5 · 44.2% · 생각 수준 매우 높음44.2%GPT-5.6 LunaGPT-5.6 Luna · 42.5% · 생각 수준 최대42.5%Claude Opus 4.8Claude Opus 4.8 · 42.5%42.5%Grok 4.6Grok 4.6 · 40% · 생각 수준 매우 높음40%GPT-5.2GPT-5.2 · 38.3% · 생각 수준 매우 높음38.3%GPT-5.4GPT-5.4 · 37.5% · 생각 수준 매우 높음37.5%Claude Fable 5Claude Fable 5 · 35.8% · 생각 수준 최대35.8%Claude Opus 4.7Claude Opus 4.7 · 33.3% · 생각 수준 최대33.3%Gemini 3.8 FlashGemini 3.8 Flash · 31.7% · 생각 수준 높음31.7%무작위로 찍었을 때의 점수
Claude Opus 5.5Claude Opus 5.5 · 83.3% · 생각 수준 최대83.3%GPT-6.1 SolGPT-6.1 Sol · 80% · 생각 수준 최대80%GPT-6 AstraGPT-6 Astra · 80% · 생각 수준 최대80%Claude Sonnet 5.5Claude Sonnet 5.5 · 75% · 생각 수준 최대75%Claude Fable 5.1Claude Fable 5.1 · 70% · 생각 수준 최대70%Claude Opus 5Claude Opus 5 · 60.8% · 생각 수준 최대60.8%GPT-6 SolGPT-6 Sol · 58.3% · 생각 수준 최대58.3%GPT-5.6 SolGPT-5.6 Sol · 56.7% · 생각 수준 최대56.7%GPT-5.6 TerraGPT-5.6 Terra · 54.2% · 생각 수준 최대54.2%Claude Haiku 5.5Claude Haiku 5.5 · 47.5% · 생각 수준 최대47.5%GPT-6 LunaGPT-6 Luna · 44.2% · 생각 수준 최대44.2%GPT-5.5GPT-5.5 · 44.2% · 생각 수준 매우 높음44.2%GPT-5.6 LunaGPT-5.6 Luna · 42.5% · 생각 수준 최대42.5%Claude Opus 4.8Claude Opus 4.8 · 42.5%42.5%Grok 4.6Grok 4.6 · 40% · 생각 수준 매우 높음40%GPT-5.2GPT-5.2 · 38.3% · 생각 수준 매우 높음38.3%GPT-5.4GPT-5.4 · 37.5% · 생각 수준 매우 높음37.5%Claude Fable 5Claude Fable 5 · 35.8% · 생각 수준 최대35.8%Claude Opus 4.7Claude Opus 4.7 · 33.3% · 생각 수준 최대33.3%Gemini 3.8 FlashGemini 3.8 Flash · 31.7% · 생각 수준 높음31.7%무작위로 찍었을 때의 점수

세로 점선은 무작위로 찍었을 때 기대되는 점수입니다.

공개일에 따른 점수

선은 개발사별로 그때까지의 최고 점수를 잇습니다. 오른쪽 위로 갈수록 최근에 나온 높은 점수입니다.

전체 순위

순위모델점수생각 수준공개일
1Claude Opus 5.5Anthropic83.3%±4.7%최대2026-09-22
2GPT-6.1 SolOpenAI80%±4.9%최대2026-09-29
2GPT-6 AstraOpenAI80%±4.9%최대2026-09-03
4Claude Sonnet 5.5Anthropic75%±5.5%최대2026-09-28
5Claude Fable 5.1Anthropic70%±5.7%최대2026-09-01
6Claude Opus 5Anthropic60.8%±6.2%최대2026-07-24
7GPT-6 SolOpenAI58.3%±6.4%최대2026-09-22
8GPT-5.6 SolOpenAI56.7%±6.3%최대2026-07-09
9GPT-5.6 TerraOpenAI54.2%±6.4%최대2026-07-09
10Claude Haiku 5.5Anthropic47.5%±6.5%최대2026-10-07
11GPT-6 LunaOpenAI44.2%±6.4%최대2026-09-22
11GPT-5.5OpenAI44.2%±6.4%매우 높음2026-04-23
13GPT-5.6 LunaOpenAI42.5%±6.4%최대2026-07-09
13Claude Opus 4.8Anthropic42.5%±6.4%—2026-05-28
15Grok 4.6xAI40%±6.3%매우 높음2026-08-12
16GPT-5.2OpenAI38.3%±6.3%매우 높음2025-12-11
17GPT-5.4OpenAI37.5%±6.3%매우 높음2026-03-05
18Claude Fable 5Anthropic35.8%±6.2%최대2026-06-09
19Claude Opus 4.7Anthropic33.3%±6.1%최대2026-04-16
20Gemini 3.8 FlashGoogle31.7%±5.9%높음2026-09-02
21Claude Opus 4.6Anthropic28.3%±5.9%최대2026-02-05
21Claude Opus 4.5Anthropic28.3%±5.9%—2025-11-24
23Gemini 3.7 FlashGoogle26.7%±5.6%높음2026-08-13
23Gemini 3.1 ProGoogle26.7%±5.6%—2026-02-19
25Gemini 3.6 FlashGoogle23.3%±5.4%—2026-07-21
26Grok 4.5xAI22.5%±5.4%높음2026-07-08
27Grok 4.7xAI20.8%±5.2%매우 높음2026-09-21

다른 벤치마크