Claude Fable 5.1
Anthropic 모델 · 2026년 9월 1일 공개. 독립 벤치마크 점수, 종합 지수, 사람 투표 순위와 개발사 발표 점수를 그래프로 정리했습니다.
- 개발
- Anthropic
- 공개일
- 이용 방식
- API 제공
- 종합 능력 지수(ECI)
- 164.7신뢰구간 161.6~168.8
- Arena 점수(사람 투표)
- 15103위 · 투표 13,063표
주요 반응
Claude Fable 5.1은 Terminal-Bench-Science 등의 큰 점수 향상과 캐시 요금 인하로 주목받았고, 370년 된 암호를 풀었다는 사례도 화제가 됐다. 다만 구독 한도가 빨리 소진되고 토큰 사용량이 늘었다는 비판과 더 싼 대안의 등장이 부담으로 꼽혔다.
- 호평Anthropic은 Fable 5.1의 캐시 읽기 요금을 100만 토큰당 1달러에서 0.25달러로 낮추고 기본 요금은 그대로 두었다. Terminal-Bench-Science 0.1에서는 52.6%로 Fable 5의 24.7%를 크게 앞섰다고 보고했다.[1]
- 엇갈림Simon Willison은 최고 노력 수준에서 나온 펠리컨 SVG를 Anthropic 모델 중 최고로 꼽았지만, 다른 벤치마크의 향상 폭은 작다고 지적했다. 노력 수준을 올릴수록 비용이 크게 늘어 Max에서는 한 건에 3.30달러가 들었다.[2]
- 호평Vals AI는 Fable 5.1이 1653년 책에 실린 암호 Cyphral Distich를 사람의 개입 없이 44분, 약 17만 6천 토큰으로 푼 것으로 보인다고 보고했다. 다만 외부 검증은 되지 않았고 새로운 해독 기법도 아니었다.[3][4]
- 비판API에서는 캐시 할인으로 저렴해졌지만 구독에서는 이 혜택이 적용되지 않는다. 한 분석은 출력 토큰이 Artificial Analysis 지수에서 Fable 5의 1.7배였다고 전했고, Max 사용자의 5시간 한도가 15~30분 만에 소진된다는 보고도 인용했다.[5]
- 엇갈림Cognition은 자사 모델 SWE-2가 FrontierCode 1.1에서 Fable 5.1과 1점 이내이면서 64% 저렴하다고 밝혔다. 이후 나온 Opus 5.5는 모든 항목에서 더 싸서 Anthropic도 Opus 5.5부터 쓰기를 권한다.[6][7]
반응 출처 7개
- Claude Fable 5.1 and Claude Mythos 5.1 · anthropic.com
- Claude Fable 5.1 made me a nice animated pelican · simonwillison.net
- Fable 5.1 Solves the Cyphral Distich, a 370-year-old cipher · vals.ai
- Claude Fable 5.1 decoded a centuries-old royalist message hidden in plain sight since 1653 · the-decoder.com
- Two Meters: Claude Fable 5.1 Is Cheaper on the API and Hungrier on Max, and What to Turn Down · paddo.dev
- Cognition launches new SWE-2 model, Rivaling Fable 5.1 and GPT-Astra · cognition.com
- What Claude Fable 5.1 Costs, and What It Breaks · digitalapplied.com
출시 기사·리뷰·전문가 평가·개발자 커뮤니티 토론을 LUCAS AI News가 읽고 요약했습니다(2026-10-11 기준). 원문 표현은 옮기지 않았으니 자세한 내용은 출처에서 확인하세요.
영역별 강점
같은 시험을 치른 모델 가운데 어디쯤인지(백분위)를 영역별로 평균했습니다. 바깥일수록 상위권이고, 점수가 없는 영역은 가운데 빈 점으로 표시합니다.
Anthropic 모델 흐름
큰 점이 이 모델입니다. 선은 그때까지의 최고 기록입니다.
독립 벤치마크 점수
- OTIS 모의 AIME수학100%
91개 모델 중 1위. OTIS의 경시대회형 수학 문제 45개. MATH Level 5보다 어렵고 FrontierMath보다 쉽다. 생각 수준 '최대' 기준.
- FrontierMath 1~3단계수학90.2%
57개 모델 중 4위. 연구 수준의 매우 어려운 수학 문제(비공개) 2026년 판의 1~3단계. 생각 수준 '최대' 기준. 오차 ±1.8%.
- FrontierMath 4단계수학87.8%
48개 모델 중 6위. FrontierMath 2026년 판에서 가장 어려운 4단계 문제(비공개). 생각 수준 '최대' 기준. 오차 ±5.2%.
- MirrorCode코딩73.3%
9개 모델 중 2위. 원본 소스 코드 없이 프로그램 전체를 처음부터 다시 구현하는 장기 코딩 과제. 생각 수준 '높음' 기준. 오차 ±9.2%.
- SimpleQA Verified지식70.8%
52개 모델 중 5위. 정치·과학·예술·스포츠·지리 등 짧은 사실 질문 1,000개에 검색 없이 답한 정확도. 생각 수준 '최대' 기준. 오차 ±1.4%.
- 체스 퍼즐추론47%
60개 모델 중 12위. 체스 엔진으로 새로 만든 퍼즐 100개. 퍼즐마다 최선의 다음 수가 하나 있다. 생각 수준 '최대' 기준. 오차 ±5%.
- 미공개 게임 퍼즐추론58%
47개 모델 중 6위. 잘 알려진 게임을 퍼즐용으로 바꾼 변형판의 100개 국면. 어떤 게임인지는 일부러 밝히지 않았다. 생각 수준 '최대' 기준. 오차 ±5%.
- 가구 조립 검사공간·학습70%
27개 모델 중 5위. 가구 조립 사진을 보고 조립이 맞는지, 틀렸다면 어느 단계가 틀렸는지 찾는 공간 추론 시험. 생각 수준 '최대' 기준. 오차 ±5.7%.
- EBR-bench공간·학습57.1%
21개 모델 중 3위. 덜 알려진 게임 Earthborne Rangers를 반복해서 할수록 점수가 오르는지 보는 학습 능력 시험. 생각 수준 '최대' 기준. 오차 ±6%.
세로선은 무작위로 찍었을 때 기대되는 점수입니다. 같은 벤치마크라도 평가 방식과 설정에 따라 점수가 달라지므로 개발사 발표 수치와 다를 수 있습니다.
함께 볼 모델
- Claude Opus 5.5 Anthropic · 2026-09-22
- Claude Sonnet 5.5 Anthropic · 2026-09-28
Gemini 3.8 Flash Google · 2026-09-02- GPT-6 Astra OpenAI · 2026-09-03