AI의 변화, 근거와 맥락까지.AI NEWS & CONTEXT
AI 모델 · Google

Gemini 2.5 Pro (Mar 2025)

Google 모델 · 2025년 3월 25일 공개. 독립 벤치마크 점수, 종합 지수, 사람 투표 순위와 개발사 발표 점수를 그래프로 정리했습니다.

개발
Google DeepMind
공개일
이용 방식
API 제공
종합 능력 지수(ECI)
144.2신뢰구간 141.9~147.0
Arena 점수(사람 투표)
아직 없음

비슷한 모델과 비교하기사전에서 Gemini 알아보기

주요 반응

Gemini 2.5 Pro는 공개와 함께 LMArena 1위에 오르고 추론·코딩 성능으로 호평받으며 Google이 다시 선두권에 올랐다는 평가를 받았다. 반면 SWE-Bench에서는 Claude 3.7 Sonnet에 뒤졌고, 모델 카드 없이 출시돼 안전 보고 지연 비판도 받았다.

  • 엇갈림Google은 공개와 함께 LMArena 1위와 Humanity's Last Exam 18.8%를 내세웠다. 다만 SWE-Bench Verified 63.8%는 Claude 3.7 Sonnet의 70.3%보다 낮았고, 수치 대부분은 Google 자체 발표였다.[1]
  • 호평Simon Willison은 매우 강력한 새 모델이라고 평가했다. 100만 토큰 입력과 6만 4천 토큰 출력을 차별점으로 꼽았고, 노트 기능을 18개 파일에 걸쳐 약 45분 만에 구현하는 등 코딩 결과도 인상적이라고 했다.[2]
  • 엇갈림Nathan Lambert는 평가 점수의 도약이 근래 보기 드문 수준이고 Arena에서 40 Elo 이상 앞선다고 봤다. 다만 모든 질문에 무거운 추론을 쓰는 방식이라 응답이 느리고 개성이 밋밋하다는 점은 아쉬움으로 꼽았다.[3]
  • 엇갈림개발자 커뮤니티에서는 aider 폴리글롯 73%로 Sonnet 3.7(65%)을 앞섰다는 평과 긴 컨텍스트 호평이 있었다. 반면 요청하지 않은 코드를 건드리고, 기존 코드 수정은 Claude가 낫다는 불만과 빡빡한 요청 제한 지적도 나왔다.[4]
  • 비판출시 당시 안전 보고서(모델 카드)가 없어 AI 거버넌스 전문가들이 Google의 자발적 공개 약속에 어긋난다고 비판했다. Google은 보고서가 곧 나온다고 밝혔다.[5]
반응 출처 5개
  1. Google's Gemini 2.5 Pro Claims AI Benchmark Crown · maginative.com
  2. Putting Gemini 2.5 Pro through its paces · simonwillison.net
  3. Gemini 2.5 Pro and Google's second chance with AI · interconnects.ai
  4. Gemini 2.5 Pro vs. Claude 3.7 Sonnet: Coding Comparison · news.ycombinator.com
  5. Google's latest AI model is missing a key safety report in apparent violation of promises made to the U.S. government… · fortune.com

출시 기사·리뷰·전문가 평가·개발자 커뮤니티 토론을 LUCAS AI News가 읽고 요약했습니다(2026-10-11 기준). 원문 표현은 옮기지 않았으니 자세한 내용은 출처에서 확인하세요.

영역별 강점

과학수학코딩지식추론공간·학습Gemini 2.5 Pro (Mar 2025)Gemini 2.5 Pro (Mar 2025) · 과학: 57백분위Gemini 2.5 Pro (Mar 2025) · 수학: 82백분위Gemini 2.5 Pro (Mar 2025) · 코딩: 79백분위Gemini 2.5 Pro (Mar 2025) · 지식: 점수 없음Gemini 2.5 Pro (Mar 2025) · 추론: 점수 없음Gemini 2.5 Pro (Mar 2025) · 공간·학습: 점수 없음

같은 시험을 치른 모델 가운데 어디쯤인지(백분위)를 영역별로 평균했습니다. 바깥일수록 상위권이고, 점수가 없는 영역은 가운데 빈 점으로 표시합니다.

Google 모델 흐름

큰 점이 이 모델입니다. 선은 그때까지의 최고 기록입니다.

독립 벤치마크 점수

  • GPQA Diamond과학83.8%

    94개 모델 중 41위. 대학원 수준의 생물·물리·화학 객관식 문제 198개. 검색으로 답을 찾기 어렵게 만든 문항이다. 오차 ±2.6%.

  • MATH Level 5수학95.6%

    45개 모델 중 9위. MATH 데이터셋에서 가장 어려운 단계. AMC 10·12, AIME 같은 경시대회 문제다. 오차 ±0.4%.

  • Aider Polyglot코딩72.9%

    29개 모델 중 7위. C++·Go·Java·JavaScript·Python·Rust의 어려운 연습 문제 225개를 코드 편집으로 푸는 시험(두 번째 시도까지 통과율). (Aider 측정)

세로선은 무작위로 찍었을 때 기대되는 점수입니다. 같은 벤치마크라도 평가 방식과 설정에 따라 점수가 달라지므로 개발사 발표 수치와 다를 수 있습니다.

함께 볼 모델