BENCHMARK · 공간·학습
가구 조립 검사 순위
가구 조립 사진을 보고 조립이 맞는지, 틀렸다면 어느 단계가 틀렸는지 찾는 공간 추론 시험.
상위 모델
- OpenAI
- Anthropic
Google- xAI
세로 점선은 무작위로 찍었을 때 기대되는 점수입니다.
공개일에 따른 점수
선은 개발사별로 그때까지의 최고 점수를 잇습니다. 오른쪽 위로 갈수록 최근에 나온 높은 점수입니다.
- Claude Opus 5.5 83%
- GPT-6 Astra 80%
- Grok 4.6 40%
- Gemini 3.8 Flash 32%
전체 순위
| 순위 | 모델 | 점수 | 생각 수준 | 공개일 |
|---|---|---|---|---|
| 1 | Claude Opus 5.5Anthropic | 83.3%±4.7% | 최대 | 2026-09-22 |
| 2 | GPT-6.1 SolOpenAI | 80%±4.9% | 최대 | 2026-09-29 |
| 2 | GPT-6 AstraOpenAI | 80%±4.9% | 최대 | 2026-09-03 |
| 4 | Claude Sonnet 5.5Anthropic | 75%±5.5% | 최대 | 2026-09-28 |
| 5 | Claude Fable 5.1Anthropic | 70%±5.7% | 최대 | 2026-09-01 |
| 6 | Claude Opus 5Anthropic | 60.8%±6.2% | 최대 | 2026-07-24 |
| 7 | GPT-6 SolOpenAI | 58.3%±6.4% | 최대 | 2026-09-22 |
| 8 | GPT-5.6 SolOpenAI | 56.7%±6.3% | 최대 | 2026-07-09 |
| 9 | GPT-5.6 TerraOpenAI | 54.2%±6.4% | 최대 | 2026-07-09 |
| 10 | Claude Haiku 5.5Anthropic | 47.5%±6.5% | 최대 | 2026-10-07 |
| 11 | GPT-6 LunaOpenAI | 44.2%±6.4% | 최대 | 2026-09-22 |
| 11 | GPT-5.5OpenAI | 44.2%±6.4% | 매우 높음 | 2026-04-23 |
| 13 | GPT-5.6 LunaOpenAI | 42.5%±6.4% | 최대 | 2026-07-09 |
| 13 | Claude Opus 4.8Anthropic | 42.5%±6.4% | — | 2026-05-28 |
| 15 | Grok 4.6xAI | 40%±6.3% | 매우 높음 | 2026-08-12 |
| 16 | GPT-5.2OpenAI | 38.3%±6.3% | 매우 높음 | 2025-12-11 |
| 17 | GPT-5.4OpenAI | 37.5%±6.3% | 매우 높음 | 2026-03-05 |
| 18 | Claude Fable 5Anthropic | 35.8%±6.2% | 최대 | 2026-06-09 |
| 19 | Claude Opus 4.7Anthropic | 33.3%±6.1% | 최대 | 2026-04-16 |
| 20 | 31.7%±5.9% | 높음 | 2026-09-02 | |
| 21 | Claude Opus 4.6Anthropic | 28.3%±5.9% | 최대 | 2026-02-05 |
| 21 | Claude Opus 4.5Anthropic | 28.3%±5.9% | — | 2025-11-24 |
| 23 | 26.7%±5.6% | 높음 | 2026-08-13 | |
| 23 | 26.7%±5.6% | — | 2026-02-19 | |
| 25 | 23.3%±5.4% | — | 2026-07-21 | |
| 26 | Grok 4.5xAI | 22.5%±5.4% | 높음 | 2026-07-08 |
| 27 | Grok 4.7xAI | 20.8%±5.2% | 매우 높음 | 2026-09-21 |