AI의 변화, 근거와 맥락까지.AI NEWS & CONTEXT
AI 모델 · Anthropic

Claude Fable 5.1

Anthropic 모델 · 2026년 9월 1일 공개. 독립 벤치마크 점수, 종합 지수, 사람 투표 순위와 개발사 발표 점수를 그래프로 정리했습니다.

개발
Anthropic
공개일
이용 방식
API 제공
종합 능력 지수(ECI)
164.7신뢰구간 161.6~168.8
Arena 점수(사람 투표)
15103위 · 투표 13,063표

비슷한 모델과 비교하기사전에서 Claude 알아보기

주요 반응

Claude Fable 5.1은 Terminal-Bench-Science 등의 큰 점수 향상과 캐시 요금 인하로 주목받았고, 370년 된 암호를 풀었다는 사례도 화제가 됐다. 다만 구독 한도가 빨리 소진되고 토큰 사용량이 늘었다는 비판과 더 싼 대안의 등장이 부담으로 꼽혔다.

  • 호평Anthropic은 Fable 5.1의 캐시 읽기 요금을 100만 토큰당 1달러에서 0.25달러로 낮추고 기본 요금은 그대로 두었다. Terminal-Bench-Science 0.1에서는 52.6%로 Fable 5의 24.7%를 크게 앞섰다고 보고했다.[1]
  • 엇갈림Simon Willison은 최고 노력 수준에서 나온 펠리컨 SVG를 Anthropic 모델 중 최고로 꼽았지만, 다른 벤치마크의 향상 폭은 작다고 지적했다. 노력 수준을 올릴수록 비용이 크게 늘어 Max에서는 한 건에 3.30달러가 들었다.[2]
  • 호평Vals AI는 Fable 5.1이 1653년 책에 실린 암호 Cyphral Distich를 사람의 개입 없이 44분, 약 17만 6천 토큰으로 푼 것으로 보인다고 보고했다. 다만 외부 검증은 되지 않았고 새로운 해독 기법도 아니었다.[3][4]
  • 비판API에서는 캐시 할인으로 저렴해졌지만 구독에서는 이 혜택이 적용되지 않는다. 한 분석은 출력 토큰이 Artificial Analysis 지수에서 Fable 5의 1.7배였다고 전했고, Max 사용자의 5시간 한도가 15~30분 만에 소진된다는 보고도 인용했다.[5]
  • 엇갈림Cognition은 자사 모델 SWE-2가 FrontierCode 1.1에서 Fable 5.1과 1점 이내이면서 64% 저렴하다고 밝혔다. 이후 나온 Opus 5.5는 모든 항목에서 더 싸서 Anthropic도 Opus 5.5부터 쓰기를 권한다.[6][7]
반응 출처 7개
  1. Claude Fable 5.1 and Claude Mythos 5.1 · anthropic.com
  2. Claude Fable 5.1 made me a nice animated pelican · simonwillison.net
  3. Fable 5.1 Solves the Cyphral Distich, a 370-year-old cipher · vals.ai
  4. Claude Fable 5.1 decoded a centuries-old royalist message hidden in plain sight since 1653 · the-decoder.com
  5. Two Meters: Claude Fable 5.1 Is Cheaper on the API and Hungrier on Max, and What to Turn Down · paddo.dev
  6. Cognition launches new SWE-2 model, Rivaling Fable 5.1 and GPT-Astra · cognition.com
  7. What Claude Fable 5.1 Costs, and What It Breaks · digitalapplied.com

출시 기사·리뷰·전문가 평가·개발자 커뮤니티 토론을 LUCAS AI News가 읽고 요약했습니다(2026-10-11 기준). 원문 표현은 옮기지 않았으니 자세한 내용은 출처에서 확인하세요.

영역별 강점

과학수학코딩지식추론공간·학습Claude Fable 5.1Claude Fable 5.1 · 과학: 점수 없음Claude Fable 5.1 · 수학: 95백분위Claude Fable 5.1 · 코딩: 88백분위Claude Fable 5.1 · 지식: 92백분위Claude Fable 5.1 · 추론: 85백분위Claude Fable 5.1 · 공간·학습: 87백분위

같은 시험을 치른 모델 가운데 어디쯤인지(백분위)를 영역별로 평균했습니다. 바깥일수록 상위권이고, 점수가 없는 영역은 가운데 빈 점으로 표시합니다.

Anthropic 모델 흐름

큰 점이 이 모델입니다. 선은 그때까지의 최고 기록입니다.

독립 벤치마크 점수

  • 91개 모델 중 1위. OTIS의 경시대회형 수학 문제 45개. MATH Level 5보다 어렵고 FrontierMath보다 쉽다. 생각 수준 '최대' 기준.

  • 57개 모델 중 4위. 연구 수준의 매우 어려운 수학 문제(비공개) 2026년 판의 1~3단계. 생각 수준 '최대' 기준. 오차 ±1.8%.

  • 48개 모델 중 6위. FrontierMath 2026년 판에서 가장 어려운 4단계 문제(비공개). 생각 수준 '최대' 기준. 오차 ±5.2%.

  • MirrorCode코딩73.3%

    9개 모델 중 2위. 원본 소스 코드 없이 프로그램 전체를 처음부터 다시 구현하는 장기 코딩 과제. 생각 수준 '높음' 기준. 오차 ±9.2%.

  • 52개 모델 중 5위. 정치·과학·예술·스포츠·지리 등 짧은 사실 질문 1,000개에 검색 없이 답한 정확도. 생각 수준 '최대' 기준. 오차 ±1.4%.

  • 체스 퍼즐추론47%

    60개 모델 중 12위. 체스 엔진으로 새로 만든 퍼즐 100개. 퍼즐마다 최선의 다음 수가 하나 있다. 생각 수준 '최대' 기준. 오차 ±5%.

  • 47개 모델 중 6위. 잘 알려진 게임을 퍼즐용으로 바꾼 변형판의 100개 국면. 어떤 게임인지는 일부러 밝히지 않았다. 생각 수준 '최대' 기준. 오차 ±5%.

  • 가구 조립 검사공간·학습70%

    27개 모델 중 5위. 가구 조립 사진을 보고 조립이 맞는지, 틀렸다면 어느 단계가 틀렸는지 찾는 공간 추론 시험. 생각 수준 '최대' 기준. 오차 ±5.7%.

  • EBR-bench공간·학습57.1%

    21개 모델 중 3위. 덜 알려진 게임 Earthborne Rangers를 반복해서 할수록 점수가 오르는지 보는 학습 능력 시험. 생각 수준 '최대' 기준. 오차 ±6%.

세로선은 무작위로 찍었을 때 기대되는 점수입니다. 같은 벤치마크라도 평가 방식과 설정에 따라 점수가 달라지므로 개발사 발표 수치와 다를 수 있습니다.

함께 볼 모델