Gemini 2.5 Pro (Mar 2025)
Google 모델 · 2025년 3월 25일 공개. 독립 벤치마크 점수, 종합 지수, 사람 투표 순위와 개발사 발표 점수를 그래프로 정리했습니다.
- 개발
- Google DeepMind
- 공개일
- 이용 방식
- API 제공
- 종합 능력 지수(ECI)
- 144.2신뢰구간 141.9~147.0
- Arena 점수(사람 투표)
- 아직 없음
주요 반응
Gemini 2.5 Pro는 공개와 함께 LMArena 1위에 오르고 추론·코딩 성능으로 호평받으며 Google이 다시 선두권에 올랐다는 평가를 받았다. 반면 SWE-Bench에서는 Claude 3.7 Sonnet에 뒤졌고, 모델 카드 없이 출시돼 안전 보고 지연 비판도 받았다.
- 엇갈림Google은 공개와 함께 LMArena 1위와 Humanity's Last Exam 18.8%를 내세웠다. 다만 SWE-Bench Verified 63.8%는 Claude 3.7 Sonnet의 70.3%보다 낮았고, 수치 대부분은 Google 자체 발표였다.[1]
- 호평Simon Willison은 매우 강력한 새 모델이라고 평가했다. 100만 토큰 입력과 6만 4천 토큰 출력을 차별점으로 꼽았고, 노트 기능을 18개 파일에 걸쳐 약 45분 만에 구현하는 등 코딩 결과도 인상적이라고 했다.[2]
- 엇갈림Nathan Lambert는 평가 점수의 도약이 근래 보기 드문 수준이고 Arena에서 40 Elo 이상 앞선다고 봤다. 다만 모든 질문에 무거운 추론을 쓰는 방식이라 응답이 느리고 개성이 밋밋하다는 점은 아쉬움으로 꼽았다.[3]
- 엇갈림개발자 커뮤니티에서는 aider 폴리글롯 73%로 Sonnet 3.7(65%)을 앞섰다는 평과 긴 컨텍스트 호평이 있었다. 반면 요청하지 않은 코드를 건드리고, 기존 코드 수정은 Claude가 낫다는 불만과 빡빡한 요청 제한 지적도 나왔다.[4]
- 비판출시 당시 안전 보고서(모델 카드)가 없어 AI 거버넌스 전문가들이 Google의 자발적 공개 약속에 어긋난다고 비판했다. Google은 보고서가 곧 나온다고 밝혔다.[5]
반응 출처 5개
- Google's Gemini 2.5 Pro Claims AI Benchmark Crown · maginative.com
- Putting Gemini 2.5 Pro through its paces · simonwillison.net
- Gemini 2.5 Pro and Google's second chance with AI · interconnects.ai
- Gemini 2.5 Pro vs. Claude 3.7 Sonnet: Coding Comparison · news.ycombinator.com
- Google's latest AI model is missing a key safety report in apparent violation of promises made to the U.S. government… · fortune.com
출시 기사·리뷰·전문가 평가·개발자 커뮤니티 토론을 LUCAS AI News가 읽고 요약했습니다(2026-10-11 기준). 원문 표현은 옮기지 않았으니 자세한 내용은 출처에서 확인하세요.
영역별 강점
같은 시험을 치른 모델 가운데 어디쯤인지(백분위)를 영역별로 평균했습니다. 바깥일수록 상위권이고, 점수가 없는 영역은 가운데 빈 점으로 표시합니다.
Google 모델 흐름
큰 점이 이 모델입니다. 선은 그때까지의 최고 기록입니다.
독립 벤치마크 점수
- GPQA Diamond과학83.8%
94개 모델 중 41위. 대학원 수준의 생물·물리·화학 객관식 문제 198개. 검색으로 답을 찾기 어렵게 만든 문항이다. 오차 ±2.6%.
- MATH Level 5수학95.6%
45개 모델 중 9위. MATH 데이터셋에서 가장 어려운 단계. AMC 10·12, AIME 같은 경시대회 문제다. 오차 ±0.4%.
- Aider Polyglot코딩72.9%
29개 모델 중 7위. C++·Go·Java·JavaScript·Python·Rust의 어려운 연습 문제 225개를 코드 편집으로 푸는 시험(두 번째 시도까지 통과율). (Aider 측정)
세로선은 무작위로 찍었을 때 기대되는 점수입니다. 같은 벤치마크라도 평가 방식과 설정에 따라 점수가 달라지므로 개발사 발표 수치와 다를 수 있습니다.
함께 볼 모델
Gemini 2.5 Flash (Apr 2025) Google · 2025-04-17
Gemini 2.5 Pro (May 2025) Google · 2025-05-06- Grok 3 xAI · 2025-04-09
- GPT-4.1 nano OpenAI · 2025-04-14