AI의 변화, 근거와 맥락까지.AI NEWS & CONTEXT
AI 모델 · Anthropic

Claude Sonnet 5.5

Anthropic 모델 · 2026년 9월 28일 공개. 독립 벤치마크 점수, 종합 지수, 사람 투표 순위와 개발사 발표 점수를 그래프로 정리했습니다.

개발
Anthropic
공개일
이용 방식
API 제공
종합 능력 지수(ECI)
165.0신뢰구간 161.7~169.1
Arena 점수(사람 투표)
147128위 · 투표 4,838표

비슷한 모델과 비교하기사전에서 Claude 알아보기

주요 반응

Claude Sonnet 5.5는 Sonnet 5와 같은 가격에 코딩과 문서 작업 성능이 크게 올라 가성비 모델로 평가받았다. 다만 최고 노력 수준에서는 토큰 소모가 매우 커 비용 이점이 줄고, 가장 어려운 작업에서는 Opus 5.5가 앞선다는 지적이 나왔다.

  • 호평Anthropic은 입력 100만 토큰당 2달러, 출력 10달러의 가격을 유지하면서 Terminal-Bench 4.0 점수를 10.3%에서 70.6%로 끌어올렸다고 밝혔다. 복잡하고 열린 작업에서는 Opus 5.5가 여전히 뚜렷하게 앞선다고 인정했다.[1]
  • 엇갈림Artificial Analysis 지수에서 56점으로 Opus 5.5에 이은 2위였지만, 최고 노력 수준에서 작업당 출력 토큰이 측정한 모델 중 가장 많았다. 작업당 비용도 Sonnet 5보다 약 50% 높게 나왔다.[2]
  • 엇갈림CodeRabbit 평가에서 어려운 13개 사례 중 6건을 잡아 Sonnet 5의 4건을 앞섰고, 리뷰 시간은 절반 수준이었다. 다만 Opus 5.5의 8~10건에는 못 미쳤고 정밀도는 약 41%에 그쳤다.[3]
  • 엇갈림Opus 5.5와 직접 비교한 한 리뷰는 웹 디자인에서 2위, 체스 엔진 과제에서 비용 절감을 확인했다. 그러나 자체 테스트에 기억에 의존한 틀린 값이 들어갔고 절감 폭도 정가 차이보다 작았다고 지적했다.[4]
  • 엇갈림개발자 커뮤니티에서는 Opus 5.5의 효율이 높아 구독 한도로 여러 세션을 돌릴 수 있다면 Sonnet을 언제 쓰느냐는 반응이 나왔다. 가벼운 서브에이전트에는 여전히 유용하다는 의견도 있었다.[5]
반응 출처 5개
  1. Sonnet 5.5 · anthropic.com
  2. Sonnet 5.5 scores just behind Opus 5.5 on Artificial Analysis Intelligence Index · artificialanalysis.ai
  3. Claude Sonnet 5.5 for code review: More catches than Sonnet 5, in half the time · coderabbit.ai
  4. Claude Sonnet 5.5 Review: I Tested It Against Opus 5.5 · thomas-wiegold.com
  5. Sonnet 5.5 (Hacker News) · news.ycombinator.com

출시 기사·리뷰·전문가 평가·개발자 커뮤니티 토론을 LUCAS AI News가 읽고 요약했습니다(2026-10-11 기준). 원문 표현은 옮기지 않았으니 자세한 내용은 출처에서 확인하세요.

영역별 강점

과학수학코딩지식추론공간·학습Claude Sonnet 5.5Claude Sonnet 5.5 · 과학: 99백분위Claude Sonnet 5.5 · 수학: 91백분위Claude Sonnet 5.5 · 코딩: 점수 없음Claude Sonnet 5.5 · 지식: 53백분위Claude Sonnet 5.5 · 추론: 93백분위Claude Sonnet 5.5 · 공간·학습: 88백분위

같은 시험을 치른 모델 가운데 어디쯤인지(백분위)를 영역별로 평균했습니다. 바깥일수록 상위권이고, 점수가 없는 영역은 가운데 빈 점으로 표시합니다.

Anthropic 모델 흐름

큰 점이 이 모델입니다. 선은 그때까지의 최고 기록입니다.

독립 벤치마크 점수

  • GPQA Diamond과학95.6%

    94개 모델 중 2위. 대학원 수준의 생물·물리·화학 객관식 문제 198개. 검색으로 답을 찾기 어렵게 만든 문항이다. 생각 수준 '최대' 기준. 오차 ±1.4%.

  • 91개 모델 중 1위. OTIS의 경시대회형 수학 문제 45개. MATH Level 5보다 어렵고 FrontierMath보다 쉽다. 생각 수준 '최대' 기준.

  • 57개 모델 중 7위. 연구 수준의 매우 어려운 수학 문제(비공개) 2026년 판의 1~3단계. 생각 수준 '최대' 기준. 오차 ±1.9%.

  • 48개 모델 중 8위. FrontierMath 2026년 판에서 가장 어려운 4단계 문제(비공개). 생각 수준 '최대' 기준. 오차 ±6.3%.

  • 52개 모델 중 25위. 정치·과학·예술·스포츠·지리 등 짧은 사실 질문 1,000개에 검색 없이 답한 정확도. 생각 수준 '최대' 기준. 오차 ±1.6%.

  • 47개 모델 중 4위. 잘 알려진 게임을 퍼즐용으로 바꾼 변형판의 100개 국면. 어떤 게임인지는 일부러 밝히지 않았다. 생각 수준 '최대' 기준. 오차 ±4.8%.

  • 가구 조립 검사공간·학습75%

    27개 모델 중 4위. 가구 조립 사진을 보고 조립이 맞는지, 틀렸다면 어느 단계가 틀렸는지 찾는 공간 추론 시험. 생각 수준 '최대' 기준. 오차 ±5.5%.

세로선은 무작위로 찍었을 때 기대되는 점수입니다. 같은 벤치마크라도 평가 방식과 설정에 따라 점수가 달라지므로 개발사 발표 수치와 다를 수 있습니다.

개발사 발표 점수

개발사가 공식 페이지나 논문에 직접 밝힌 수치입니다. 평가 조건이 서로 달라 다른 모델과 바로 비교하기는 어렵습니다. 항목마다 원문에서 확인할 수 있습니다.

항목발표 값원문
Agentic coding Terminal-Bench 4.070.6%www.anthropic.com
Agentic coding FrontierCode 1.1 (Main)46.2%www.anthropic.com
Agentic coding CursorBench 4.055.5%www.anthropic.com
Multidisciplinary reasoning Humanity’s Last Exam64.5%www.anthropic.com
Computer use OSWorld 2.180.1%www.anthropic.com
Visual chart recognition Chartography61.6%www.anthropic.com
Visual reasoning Chartography61.6%www.anthropic.com

함께 볼 모델