AI의 변화, 근거와 맥락까지.AI NEWS & CONTEXT
AI 모델 · Anthropic

Claude Haiku 5.5

Anthropic 모델 · 2026년 10월 7일 공개. 독립 벤치마크 점수, 종합 지수, 사람 투표 순위와 개발사 발표 점수를 그래프로 정리했습니다.

개발
Anthropic
공개일
이용 방식
API 제공
종합 능력 지수(ECI)
아직 없음
Arena 점수(사람 투표)
아직 없음

비슷한 모델과 비교하기사전에서 Claude 알아보기

주요 반응

Claude Haiku 5.5는 Haiku 4.5보다 크게 저렴해지고 성능이 올라 대량 처리용 소형 모델로 호평받았다. 반면 프롬프트가 10만 토큰을 넘으면 요금이 5배로 뛰는 구조와 복잡한 에이전트 코딩의 한계, 높은 토큰 사용량이 단점으로 꼽혔다.

  • 호평Anthropic은 Haiku 5.5의 요금을 입력 100만 토큰당 0.10달러, 출력 0.50달러로 책정해 Haiku 4.5보다 평균 약 75% 저렴하다고 밝혔다. OSWorld 2.1 점수는 15.7%에서 72.4%로 올랐다고 보고했다.[1]
  • 호평Artificial Analysis 지수에서 43점으로 직전 Haiku보다 26점 올랐고 GPT-6 Luna(38점)와 Gemini 3.8 Flash(41점)를 앞섰다. 사실 지식 평가의 환각률도 40%로 Luna의 77%보다 낮았다.[2]
  • 엇갈림Terminal-Bench 4.0 점수는 39.2%로 Sonnet 5.5의 70.6%에 크게 못 미쳐 Anthropic도 복잡한 에이전트 코딩에는 권하지 않는다. 최고 노력 수준에서는 출력 토큰이 Luna의 약 3배였다.[1][2][3]
  • 비판프롬프트가 10만 토큰을 넘으면 모든 요금이 5배로 오르는 점이 약점으로 지적됐다. 개발자 커뮤니티에서는 기준선이 낮다는 비판과 10만 토큰 이하에서도 Luna보다 비싸다는 지적이 나왔다.[3][4]
  • 호평개발자 커뮤니티에서는 요약, 컨텍스트 압축, 서브에이전트 용도로 Haiku 4.5보다 크게 나아졌다는 반응이 많았다. 한 개발자는 기대가 낮았다가 생각을 바꿨다며, 조회와 요약은 Haiku에 맡기고 계획과 검토는 Opus에 맡긴다고 했다.[4][5]
반응 출처 5개
  1. Introducing Claude Haiku 5.5 · anthropic.com
  2. Anthropic has released Claude Haiku 5.5 · artificialanalysis.ai
  3. Claude Haiku 5.5 review: benchmarks, real costs, and the 100k catch · eesel.ai
  4. Claude Haiku 5.5 (Hacker News) · news.ycombinator.com
  5. Opus 5.5 Took Fable's Job. Haiku 5.5 Proved Me Wrong · thoughts.jock.pl

출시 기사·리뷰·전문가 평가·개발자 커뮤니티 토론을 LUCAS AI News가 읽고 요약했습니다(2026-10-11 기준). 원문 표현은 옮기지 않았으니 자세한 내용은 출처에서 확인하세요.

영역별 강점

과학수학코딩지식추론공간·학습Claude Haiku 5.5Claude Haiku 5.5 · 과학: 70백분위Claude Haiku 5.5 · 수학: 73백분위Claude Haiku 5.5 · 코딩: 점수 없음Claude Haiku 5.5 · 지식: 20백분위Claude Haiku 5.5 · 추론: 59백분위Claude Haiku 5.5 · 공간·학습: 65백분위

같은 시험을 치른 모델 가운데 어디쯤인지(백분위)를 영역별로 평균했습니다. 바깥일수록 상위권이고, 점수가 없는 영역은 가운데 빈 점으로 표시합니다.

독립 벤치마크 점수

  • GPQA Diamond과학89.6%

    94개 모델 중 29위. 대학원 수준의 생물·물리·화학 객관식 문제 198개. 검색으로 답을 찾기 어렵게 만든 문항이다. 생각 수준 '최대' 기준. 오차 ±2%.

  • OTIS 모의 AIME수학98.9%

    91개 모델 중 13위. OTIS의 경시대회형 수학 문제 45개. MATH Level 5보다 어렵고 FrontierMath보다 쉽다. 생각 수준 '매우 높음' 기준. 오차 ±0.5%.

  • 57개 모델 중 18위. 연구 수준의 매우 어려운 수학 문제(비공개) 2026년 판의 1~3단계. 생각 수준 '최대' 기준. 오차 ±2.6%.

  • 48개 모델 중 18위. FrontierMath 2026년 판에서 가장 어려운 4단계 문제(비공개). 생각 수준 '최대' 기준. 오차 ±7.9%.

  • 52개 모델 중 42위. 정치·과학·예술·스포츠·지리 등 짧은 사실 질문 1,000개에 검색 없이 답한 정확도. 생각 수준 '최대' 기준. 오차 ±1.4%.

  • 47개 모델 중 20위. 잘 알려진 게임을 퍼즐용으로 바꾼 변형판의 100개 국면. 어떤 게임인지는 일부러 밝히지 않았다. 생각 수준 '최대' 기준. 오차 ±4.6%.

  • 가구 조립 검사공간·학습47.5%

    27개 모델 중 10위. 가구 조립 사진을 보고 조립이 맞는지, 틀렸다면 어느 단계가 틀렸는지 찾는 공간 추론 시험. 생각 수준 '최대' 기준. 오차 ±6.5%.

세로선은 무작위로 찍었을 때 기대되는 점수입니다. 같은 벤치마크라도 평가 방식과 설정에 따라 점수가 달라지므로 개발사 발표 수치와 다를 수 있습니다.

개발사 발표 점수

개발사가 공식 페이지나 논문에 직접 밝힌 수치입니다. 평가 조건이 서로 달라 다른 모델과 바로 비교하기는 어렵습니다. 항목마다 원문에서 확인할 수 있습니다.

항목발표 값원문
Computer use OSWorld 2.172.4%www.anthropic.com
Multidisciplinary reasoning Humanity’s Last Exam45.9%www.anthropic.com
Agentic coding Terminal-Bench 4.039.2%www.anthropic.com
Agentic coding FrontierCode 1.1 (Main)46.4%www.anthropic.com
Visual reasoning Chartography46.4%www.anthropic.com

함께 볼 모델