AI의 변화, 근거와 맥락까지.AI NEWS & CONTEXT
AI 모델 · Google

Gemini 1.5 Pro (May 2024)

Google 모델 · 2024년 5월 14일 공개. 독립 벤치마크 점수, 종합 지수, 사람 투표 순위와 개발사 발표 점수를 그래프로 정리했습니다.

개발
Google DeepMind
공개일
이용 방식
API 제공
종합 능력 지수(ECI)
126.9신뢰구간 121.1~129.2
Arena 점수(사람 투표)
1273276위 · 투표 79,138표

비슷한 모델과 비교하기사전에서 Gemini 알아보기

주요 반응

Gemini 1.5 Pro는 2024년 2월 공개 당시 100만 토큰 컨텍스트와 영상 입력으로 큰 주목을 받았고, 5월 업데이트에서 성능 향상과 200만 토큰 대기자 등록이 추가됐다. 다만 초기 접근이 제한적이었고, 독립 연구에서는 긴 문서 이해력이 기대만큼 안정적이지 않다는 결과도 나왔다.

  • 호평2024년 2월 공개 때 기본 컨텍스트는 12만 8천 토큰이었고, 100만 토큰 창은 일부 개발자와 기업에 한정된 비공개 프리뷰였다. 한 IT 필자는 성능 주장이 사실이면 경쟁사에 부담이 될 것이라고 평가했다.[1][2]
  • 엇갈림Simon Willison은 컨텍스트 길이보다 영상 입력이 더 흥미롭다고 평가했고, 짧은 책장 영상에서 많은 책 제목을 읽어낸 데 놀랐다. 다만 갖고 있지 않은 책을 지어내는 환각과 안전 필터 오작동도 확인됐다.[3]
  • 비판10만 줄 코드 분석 시연을 두고 개발자 커뮤니티에서는 앞선 Gemini 시연 논란 때문에 믿기 어렵다는 반응이 나왔다. 독립 검증을 위한 접근 요청이 많았고, 과제가 검색 기반 방식으로도 가능하다는 지적도 있었다.[4]
  • 엇갈림5월 업데이트에서 Google은 번역·코딩·추론 품질 향상과 200만 토큰 창(대기자 신청)을 발표했고, 자체 보고서에서 1.0 Ultra를 텍스트 벤치마크 19개 중 16개에서 앞선다고 밝혔다. 다만 어디까지나 문서상 수치라는 신중론도 있었다.[5][6]
  • 비판동료 심사 전인 한 연구에서는 약 26만 단어 분량의 책에 대한 참·거짓 판별에서 1.5 Pro의 정답률이 46.7%에 그쳤다. 연구진은 긴 입력을 처리하긴 해도 내용을 이해하는 것 같지는 않다고 지적했다.[7]
반응 출처 7개
  1. Google Releases Gemini Pro 1.5 · thurrott.com
  2. Gemini 1.5: Our next-generation model, now available for Private Preview in Google AI Studio · developers.googleblog.com
  3. The killer app of Gemini Pro 1.5 is video · simonwillison.net
  4. Problem solving across 100,633 lines of code – Gemini 1.5 Pro Demo [video] · news.ycombinator.com
  5. Gemini 1.5 Pro updates, 1.5 Flash debut and 2 new Gemma models · blog.google
  6. Gemini 1.5 Pro is now the most capable LLM on the market, according to Google's benchmarks · the-decoder.com
  7. Gemini's data-analyzing abilities aren't as good as Google claims · techcrunch.com

출시 기사·리뷰·전문가 평가·개발자 커뮤니티 토론을 LUCAS AI News가 읽고 요약했습니다(2026-10-11 기준). 원문 표현은 옮기지 않았으니 자세한 내용은 출처에서 확인하세요.

Google 모델 흐름

큰 점이 이 모델입니다. 선은 그때까지의 최고 기록입니다.

독립 벤치마크 점수

  • GPQA Diamond과학45.9%

    94개 모델 중 80위. 대학원 수준의 생물·물리·화학 객관식 문제 198개. 검색으로 답을 찾기 어렵게 만든 문항이다. 오차 ±2.6%.

  • MATH Level 5수학40.8%

    45개 모델 중 35위. MATH 데이터셋에서 가장 어려운 단계. AMC 10·12, AIME 같은 경시대회 문제다. 오차 ±1.1%.

  • 91개 모델 중 74위. OTIS의 경시대회형 수학 문제 45개. MATH Level 5보다 어렵고 FrontierMath보다 쉽다. 오차 ±1.9%.

세로선은 무작위로 찍었을 때 기대되는 점수입니다. 같은 벤치마크라도 평가 방식과 설정에 따라 점수가 달라지므로 개발사 발표 수치와 다를 수 있습니다.

함께 볼 모델