AI의 변화, 근거와 맥락까지.AI NEWS & CONTEXT
AI 모델 · Anthropic

Claude 3.5 Sonnet

Anthropic 모델 · 2024년 6월 20일 공개. 독립 벤치마크 점수, 종합 지수, 사람 투표 순위와 개발사 발표 점수를 그래프로 정리했습니다.

개발
Anthropic
공개일
이용 방식
API 제공
학습 연산량
2.7×10²⁵ FLOPEpoch AI 추정치
종합 능력 지수(ECI)
130.0신뢰구간 130.0~130.0
Arena 점수(사람 투표)
1281269위 · 투표 82,419표

비슷한 모델과 비교하기사전에서 Claude 알아보기

주요 반응

Opus보다 빠르고 저렴하면서 성능은 앞선다는 평가가 이어졌고, 코딩과 Artifacts 기능이 특히 호평받았다. 반면 간단한 상식 문제에서의 실수와 가끔 보이는 게으른 답변, 메시지 한도와 과도한 신중함에 대한 불만이 있었고 GPT-4o와의 우열은 작업별로 갈렸다.

  • 호평개발자 Simon Willison은 Claude 3.5 Sonnet이 당시 쓸 수 있는 최고의 LLM일 가능성이 높다고 평가했다. Opus보다 약 2배 빠르고 비용은 5분의 1이며, Artifacts로 만든 앱 결과가 훌륭했다고 했다.[1]
  • 엇갈림출시 직후 파워 유저들은 스크린샷 한 장으로 게임을 만든 사례 등을 공유하며 열광했지만, 간단한 문제에서 엉뚱한 실수를 한다는 지적과 호평 상당수가 독립 검증이 아니라는 한계도 보도됐다.[2]
  • 엇갈림한 개발자는 코딩에서 Opus와 GPT-4o보다 뚜렷이 낫고 Artifacts로 반복 작업이 빨랐다고 평가했으나, 가끔 게으르게 답하거나 지나치게 순응적이고 수학 문제에서 실수한다고 덧붙였다.[3]
  • 엇갈림개발자 커뮤니티에서는 GPT-4o보다 낫다는 의견과 작업별로 갈린다는 의견이 맞섰고, Artifacts는 호평받은 반면 Pro 구독자의 메시지 한도, 과도한 신중함, 미완성 코드 출력에 불만이 나왔다.[4]
반응 출처 4개
  1. Claude 3.5 Sonnet · simonwillison.net
  2. Anthropic's Claude 3.5 Sonnet wows AI power users · venturebeat.com
  3. Is Anthropic's Claude 3.5 Sonnet All You Need - Vibe check · sankalp.bearblog.dev
  4. Claude 3.5 Sonnet (Hacker News) · news.ycombinator.com

출시 기사·리뷰·전문가 평가·개발자 커뮤니티 토론을 LUCAS AI News가 읽고 요약했습니다(2026-10-11 기준). 원문 표현은 옮기지 않았으니 자세한 내용은 출처에서 확인하세요.

Anthropic 모델 흐름

큰 점이 이 모델입니다. 선은 그때까지의 최고 기록입니다.

독립 벤치마크 점수

  • GPQA Diamond과학54%

    94개 모델 중 70위. 대학원 수준의 생물·물리·화학 객관식 문제 198개. 검색으로 답을 찾기 어렵게 만든 문항이다. 오차 ±2.8%.

  • MATH Level 5수학51.7%

    45개 모델 중 30위. MATH 데이터셋에서 가장 어려운 단계. AMC 10·12, AIME 같은 경시대회 문제다. 오차 ±1.2%.

  • 91개 모델 중 76위. OTIS의 경시대회형 수학 문제 45개. MATH Level 5보다 어렵고 FrontierMath보다 쉽다. 오차 ±2.2%.

  • 46개 모델 중 40위. 연구 수준의 매우 어려운 수학 문제(비공개). 2026년 6월 새 판으로 바뀌기 전 기록이다. 오차 ±0.6%.

세로선은 무작위로 찍었을 때 기대되는 점수입니다. 같은 벤치마크라도 평가 방식과 설정에 따라 점수가 달라지므로 개발사 발표 수치와 다를 수 있습니다.

함께 볼 모델