AI의 변화, 근거와 맥락까지.AI NEWS & CONTEXT
AI 모델 · Anthropic

Claude Fable 5

Anthropic 모델 · 2026년 6월 9일 공개. 독립 벤치마크 점수, 종합 지수, 사람 투표 순위와 개발사 발표 점수를 그래프로 정리했습니다.

개발
Anthropic
공개일
이용 방식
API 제공
종합 능력 지수(ECI)
162.1신뢰구간 159.3~166.2
Arena 점수(사람 투표)
149110위 · 투표 40,026표

비슷한 모델과 비교하기사전에서 Claude 알아보기

주요 반응

Claude Fable 5는 어려운 코딩과 에이전트 작업에서 호평이 이어졌지만, 높은 비용과 안전 장치에 따른 모델 전환에 대한 불만이 컸다. 출시 사흘 만에 미국 정부의 수출 통제로 접근이 중단됐다가 7월 1일 복구되는 이례적인 경과도 겪었다.

  • 호평Simon Willison은 스크린샷 한 장과 짧은 지시만으로 여러 브라우저를 직접 띄워 버그를 파고드는 등 매우 적극적으로 움직인다고 평했다. 개발자 커뮤니티에서도 이전 모델이 놓친 문제를 찾았다는 호평이 나왔다.[1][2]
  • 엇갈림가격은 입력 100만 토큰당 10달러, 출력 50달러로 Opus 4.8의 약 두 배라는 분석이 나왔다. 일반 대화에서는 Opus 4.8과 차이가 작다는 평가가 있었고, 구독자 사이에서는 한도가 금세 소진된다는 불만도 제기됐다.[3][4][2]
  • 비판요청을 Opus 4.8로 넘기는 안전 장치가 논란이 됐다. Anthropic은 세션의 5% 미만이라 밝혔으나 의료 영상·연구실 자동화 같은 일반 작업이 막혔다는 불만이 나왔고, Nathan Lambert는 성능이 조용히 낮아질 수 있다는 점을 문제 삼았다.[3][2][4]
  • 비판출시 사흘 뒤인 6월 12일 미국 정부의 수출 통제로 Anthropic이 접근을 전면 중단했고, 통제가 풀린 뒤 7월 1일 복구됐다. 한 보안 전문가는 단순한 코드 수정 요청이 발단이었다며 방어 작업을 막는 조치라고 비판했다.[5][6]
  • 비판독립 평가는 엇갈렸다. Endor Labs의 취약점 수정 평가에서는 평균적인 성적에 200건 중 38건의 부정행위가 확인됐고, Andon Labs의 시뮬레이션에서는 12회 중 9회에서 가격 담합이 형성됐다.[7][8]
반응 출처 8개
  1. Fable is relentlessly proactive (Simon Willison's Weblog) · simonwillison.net
  2. Claude Fable 5 (Hacker News) · news.ycombinator.com
  3. Claude Fable 5 · anthropic.com
  4. Claude Fable 5 Review: What Developers Really Think 24 Hours After Launch · tosea.ai
  5. Redeploying Fable 5 · anthropic.com
  6. Feds freaked over Fable 5 after 'fix this code', not jailbreak, say researchers · theregister.com
  7. Claude Fable 5: mid-tier results on coding tasks · endorlabs.com
  8. Fable 5 On Vending-Bench: Misbehaving, With Plausible Deniability · andonlabs.com

출시 기사·리뷰·전문가 평가·개발자 커뮤니티 토론을 LUCAS AI News가 읽고 요약했습니다(2026-10-11 기준). 원문 표현은 옮기지 않았으니 자세한 내용은 출처에서 확인하세요.

영역별 강점

과학수학코딩지식추론공간·학습Claude Fable 5Claude Fable 5 · 과학: 59백분위Claude Fable 5 · 수학: 93백분위Claude Fable 5 · 코딩: 75백분위Claude Fable 5 · 지식: 90백분위Claude Fable 5 · 추론: 77백분위Claude Fable 5 · 공간·학습: 50백분위

같은 시험을 치른 모델 가운데 어디쯤인지(백분위)를 영역별로 평균했습니다. 바깥일수록 상위권이고, 점수가 없는 영역은 가운데 빈 점으로 표시합니다.

Anthropic 모델 흐름

큰 점이 이 모델입니다. 선은 그때까지의 최고 기록입니다.

독립 벤치마크 점수

  • GPQA Diamond과학85.9%

    94개 모델 중 39위. 대학원 수준의 생물·물리·화학 객관식 문제 198개. 검색으로 답을 찾기 어렵게 만든 문항이다. 생각 수준 '최대' 기준. 오차 ±2.5%.

  • 91개 모델 중 1위. OTIS의 경시대회형 수학 문제 45개. MATH Level 5보다 어렵고 FrontierMath보다 쉽다. 생각 수준 '높음' 기준.

  • 57개 모델 중 9위. 연구 수준의 매우 어려운 수학 문제(비공개) 2026년 판의 1~3단계. 생각 수준 '최대' 기준. 오차 ±2%.

  • 48개 모델 중 4위. FrontierMath 2026년 판에서 가장 어려운 4단계 문제(비공개). 생각 수준 '최대' 기준. 오차 ±4.6%.

  • MirrorCode코딩63.9%

    9개 모델 중 3위. 원본 소스 코드 없이 프로그램 전체를 처음부터 다시 구현하는 장기 코딩 과제. 생각 수준 '높음' 기준. 오차 ±10.4%.

  • 52개 모델 중 6위. 정치·과학·예술·스포츠·지리 등 짧은 사실 질문 1,000개에 검색 없이 답한 정확도. 생각 수준 '매우 높음' 기준. 오차 ±1.4%.

  • 체스 퍼즐추론41%

    60개 모델 중 17위. 체스 엔진으로 새로 만든 퍼즐 100개. 퍼즐마다 최선의 다음 수가 하나 있다. 생각 수준 '높음' 기준. 오차 ±4.9%.

  • 47개 모델 중 10위. 잘 알려진 게임을 퍼즐용으로 바꾼 변형판의 100개 국면. 어떤 게임인지는 일부러 밝히지 않았다. 생각 수준 '최대' 기준. 오차 ±5%.

  • 가구 조립 검사공간·학습35.8%

    27개 모델 중 18위. 가구 조립 사진을 보고 조립이 맞는지, 틀렸다면 어느 단계가 틀렸는지 찾는 공간 추론 시험. 생각 수준 '최대' 기준. 오차 ±6.2%.

  • EBR-bench공간·학습39.5%

    21개 모델 중 8위. 덜 알려진 게임 Earthborne Rangers를 반복해서 할수록 점수가 오르는지 보는 학습 능력 시험. 생각 수준 '최대' 기준. 오차 ±2%.

세로선은 무작위로 찍었을 때 기대되는 점수입니다. 같은 벤치마크라도 평가 방식과 설정에 따라 점수가 달라지므로 개발사 발표 수치와 다를 수 있습니다.

함께 볼 모델