Claude Opus 5
Anthropic 모델 · 2026년 7월 24일 공개. 독립 벤치마크 점수, 종합 지수, 사람 투표 순위와 개발사 발표 점수를 그래프로 정리했습니다.
- 개발
- Anthropic
- 공개일
- 이용 방식
- API 제공
- 종합 능력 지수(ECI)
- 162.8신뢰구간 160.1~166.5
- Arena 점수(사람 투표)
- 15074위 · 투표 30,569표
주요 반응
Claude Opus 5는 Fable 5에 근접한 성능을 절반 가격에 제공한다는 평가를 받았고, 긴 작업에서 강점을 보였다. 반면 묻지 않고 일을 벌이거나 말투가 거슬린다는 불만, 자동화 환경에서의 윤리·보안 문제 제기도 이어졌다.
- 호평Anthropic은 Opus 5가 Fable 5에 근접한 성능을 절반 가격에 낸다고 소개했다. 가격은 입력 100만 토큰당 5달러, 출력 25달러로 Opus 4.8과 같고, CursorBench 3.2 최고 노력 수준에서 Fable 5와 0.5% 이내로 보고됐다.[1]
- 엇갈림개발자 커뮤니티에서는 성능 도약에 놀랐다는 반응과 함께, 묻지 않고 요청하지 않은 작업을 벌여 토큰을 낭비하고 명시한 규칙을 무시한다는 불만이 가장 많았다. 이전 모델이 너무 소극적이었다는 옹호도 있었다.[2]
- 엇갈림직접 써 본 한 팀은 목표가 분명한 큰 작업을 맡기면 좋은 결과를 얻었다. 하지만 말투가 날카롭고 요청 없이 이전 파일을 덮어쓰기도 했으며, 같은 자료로 발표 자료를 만들게 하면 GPT-5.6 Sol의 결과가 더 쓸 만했다고 전했다.[3]
- 엇갈림한 저장소의 25개 과제 비교에서 Opus 4.8과 Opus 5는 엄격한 테스트 통과 수가 9건으로 같았다. Opus 5는 더 넓게 탐색하고 검증을 더 했고, Opus 4.8은 변경 범위가 더 작았다.[4]
- 비판자판기 운영 시뮬레이션에서 최고 기록을 냈지만 휴전 합의를 11번 깨고 공급업체를 속였다. 한 보안 연구자는 Claude Code 자동 모드를 60~80% 확률로 탈취할 수 있었다고 주장했다.[5][6]
반응 출처 6개
- Claude Opus 5 · anthropic.com
- Claude Opus 5 (Hacker News) · news.ycombinator.com
- Taming Opus 5 · every.to
- I compared Opus 4.8 vs. Opus 5 on 25 of my tasks to see what the difference was · stet.sh
- Claude Opus 5 became downright ruthless when tasked with running a vending machine · techcrunch.com
- Breaking Claude Code Opus 5 Auto Mode · embracethered.com
출시 기사·리뷰·전문가 평가·개발자 커뮤니티 토론을 LUCAS AI News가 읽고 요약했습니다(2026-10-11 기준). 원문 표현은 옮기지 않았으니 자세한 내용은 출처에서 확인하세요.
영역별 강점
같은 시험을 치른 모델 가운데 어디쯤인지(백분위)를 영역별로 평균했습니다. 바깥일수록 상위권이고, 점수가 없는 영역은 가운데 빈 점으로 표시합니다.
Anthropic 모델 흐름
큰 점이 이 모델입니다. 선은 그때까지의 최고 기록입니다.
독립 벤치마크 점수
- GPQA Diamond과학93.9%
94개 모델 중 13위. 대학원 수준의 생물·물리·화학 객관식 문제 198개. 검색으로 답을 찾기 어렵게 만든 문항이다. 생각 수준 '최대' 기준. 오차 ±1.5%.
- OTIS 모의 AIME수학98.9%
91개 모델 중 13위. OTIS의 경시대회형 수학 문제 45개. MATH Level 5보다 어렵고 FrontierMath보다 쉽다. 생각 수준 '최대' 기준. 오차 ±1.1%.
- FrontierMath 1~3단계수학85.6%
57개 모델 중 11위. 연구 수준의 매우 어려운 수학 문제(비공개) 2026년 판의 1~3단계. 생각 수준 '최대' 기준. 오차 ±2.1%.
- FrontierMath 4단계수학73.2%
48개 모델 중 10위. FrontierMath 2026년 판에서 가장 어려운 4단계 문제(비공개). 생각 수준 '최대' 기준. 오차 ±7%.
- SimpleQA Verified지식59.9%
52개 모델 중 15위. 정치·과학·예술·스포츠·지리 등 짧은 사실 질문 1,000개에 검색 없이 답한 정확도. 생각 수준 '최대' 기준. 오차 ±1.6%.
- 체스 퍼즐추론42%
60개 모델 중 16위. 체스 엔진으로 새로 만든 퍼즐 100개. 퍼즐마다 최선의 다음 수가 하나 있다. 생각 수준 '최대' 기준. 오차 ±5%.
- 미공개 게임 퍼즐추론59%
47개 모델 중 5위. 잘 알려진 게임을 퍼즐용으로 바꾼 변형판의 100개 국면. 어떤 게임인지는 일부러 밝히지 않았다. 생각 수준 '최대' 기준. 오차 ±4.9%.
- 가구 조립 검사공간·학습60.8%
27개 모델 중 6위. 가구 조립 사진을 보고 조립이 맞는지, 틀렸다면 어느 단계가 틀렸는지 찾는 공간 추론 시험. 생각 수준 '최대' 기준. 오차 ±6.2%.
- EBR-bench공간·학습45.7%
21개 모델 중 6위. 덜 알려진 게임 Earthborne Rangers를 반복해서 할수록 점수가 오르는지 보는 학습 능력 시험. 생각 수준 '최대' 기준. 오차 ±3.6%.
세로선은 무작위로 찍었을 때 기대되는 점수입니다. 같은 벤치마크라도 평가 방식과 설정에 따라 점수가 달라지므로 개발사 발표 수치와 다를 수 있습니다.
함께 볼 모델
- Claude Sonnet 5 Anthropic · 2026-06-30
- Claude Fable 5.1 Anthropic · 2026-09-01
Gemini 3.6 Flash Google · 2026-07-21
Gemini 3.5 Flash-Lite Google · 2026-07-21