AI의 변화, 근거와 맥락까지.AI NEWS & CONTEXT
AI 모델 · Google

Gemini 3.8 Flash

Google 모델 · 2026년 9월 2일 공개. 독립 벤치마크 점수, 종합 지수, 사람 투표 순위와 개발사 발표 점수를 그래프로 정리했습니다.

개발
Google DeepMind
공개일
이용 방식
API 제공
종합 능력 지수(ECI)
156.7신뢰구간 154.4~160.3
Arena 점수(사람 투표)
14997위 · 투표 31,437표

비슷한 모델과 비교하기사전에서 Gemini 알아보기

주요 반응

Gemini 3.8 Flash는 독립 평가에서 지능 지수가 3.7 Flash보다 3점 오르고 속도와 비용 효율이 높다는 평가를 받았다. 반면 출력이 길어져 작업당 비용이 늘었고, Claude Opus 5 등 상위 모델에는 못 미친다는 지적도 나왔다.

  • 호평Artificial Analysis는 지능 지수를 59점으로 3.7 Flash보다 3점 높게 매겼고, 초당 약 300토큰의 속도와 작업당 $0.58의 비용으로 같은 지능 수준에서 가장 저렴한 모델이라고 평가했다.[1][2]
  • 비판다만 작업당 평균 출력 토큰이 30% 늘어 48k가 되면서 비용이 이전 모델보다 약 40% 올랐다. 또한 현재의 할인 가격은 2027년 1월에 두 배로 오를 예정이다.[1][2]
  • 엇갈림개발자 커뮤니티에서는 속도와 비용이 인상적이라는 평가와 함께 데모 결과물이 평범하다는 반응이 있었다. 백엔드 작업 신뢰성은 Claude Opus와 GPT가 낫고 3.7보다 토큰을 더 쓴다는 지적도 나왔다.[3]
  • 엇갈림한 리뷰는 첫 토큰까지 13.30초가 걸리고 장황해 대화형 용도에는 맞지 않다고 봤다. 장기 에이전트 코딩과 문서 중심 일괄 작업에는 전환을 권했고, 일부는 Google이 고른 벤치마크에서만 Opus 5에 필적한다고 비판했다.[4]
  • 엇갈림지능 지수는 Claude Opus 5(63), Claude Fable 5.1(66) 등 상위 모델에 못 미쳤다. 한 사용자 비교 테스트에서는 비용이 $0.12 대 $1.86으로 Opus 5보다 훨씬 낮았지만 결과물 완성도는 떨어진다는 평이 나왔다.[2][5]
반응 출처 5개
  1. Google has released Gemini 3.8 Flash, its fourth Flash model in under four months · artificialanalysis.ai
  2. With Gemini 3.8 Flash, Google reminds everyone it's still in the race · theregister.com
  3. Gemini 3.8 Flash and 3.8 Flash Cyber · news.ycombinator.com
  4. Gemini 3.8 Flash review: fast, verbose, and not the upgrade the number implies · eesel.ai
  5. Gemini 3.8 Flash Arrives, Promptly Mocked by Rivals · chinaonchina.com

출시 기사·리뷰·전문가 평가·개발자 커뮤니티 토론을 LUCAS AI News가 읽고 요약했습니다(2026-10-11 기준). 원문 표현은 옮기지 않았으니 자세한 내용은 출처에서 확인하세요.

영역별 강점

과학수학코딩지식추론공간·학습Gemini 3.8 FlashGemini 3.8 Flash · 과학: 98백분위Gemini 3.8 Flash · 수학: 63백분위Gemini 3.8 Flash · 코딩: 점수 없음Gemini 3.8 Flash · 지식: 88백분위Gemini 3.8 Flash · 추론: 87백분위Gemini 3.8 Flash · 공간·학습: 27백분위

같은 시험을 치른 모델 가운데 어디쯤인지(백분위)를 영역별로 평균했습니다. 바깥일수록 상위권이고, 점수가 없는 영역은 가운데 빈 점으로 표시합니다.

Google 모델 흐름

큰 점이 이 모델입니다. 선은 그때까지의 최고 기록입니다.

독립 벤치마크 점수

  • GPQA Diamond과학95.4%

    94개 모델 중 3위. 대학원 수준의 생물·물리·화학 객관식 문제 198개. 검색으로 답을 찾기 어렵게 만든 문항이다. 생각 수준 '높음' 기준. 오차 ±1.4%.

  • OTIS 모의 AIME수학98.9%

    91개 모델 중 13위. OTIS의 경시대회형 수학 문제 45개. MATH Level 5보다 어렵고 FrontierMath보다 쉽다. 생각 수준 '높음' 기준. 오차 ±0.9%.

  • 57개 모델 중 22위. 연구 수준의 매우 어려운 수학 문제(비공개) 2026년 판의 1~3단계. 생각 수준 '높음' 기준. 오차 ±2.8%.

  • 48개 모델 중 29위. FrontierMath 2026년 판에서 가장 어려운 4단계 문제(비공개). 생각 수준 '높음' 기준. 오차 ±6.5%.

  • 52개 모델 중 7위. 정치·과학·예술·스포츠·지리 등 짧은 사실 질문 1,000개에 검색 없이 답한 정확도. 생각 수준 '높음' 기준. 오차 ±1.5%.

  • 체스 퍼즐추론61%

    60개 모델 중 4위. 체스 엔진으로 새로 만든 퍼즐 100개. 퍼즐마다 최선의 다음 수가 하나 있다. 생각 수준 '높음' 기준. 오차 ±4.9%.

  • 47개 모델 중 11위. 잘 알려진 게임을 퍼즐용으로 바꾼 변형판의 100개 국면. 어떤 게임인지는 일부러 밝히지 않았다. 생각 수준 '높음' 기준. 오차 ±5%.

  • 가구 조립 검사공간·학습31.7%

    27개 모델 중 20위. 가구 조립 사진을 보고 조립이 맞는지, 틀렸다면 어느 단계가 틀렸는지 찾는 공간 추론 시험. 생각 수준 '높음' 기준. 오차 ±5.9%.

세로선은 무작위로 찍었을 때 기대되는 점수입니다. 같은 벤치마크라도 평가 방식과 설정에 따라 점수가 달라지므로 개발사 발표 수치와 다를 수 있습니다.

개발사 발표 점수

개발사가 공식 페이지나 논문에 직접 밝힌 수치입니다. 평가 조건이 서로 달라 다른 모델과 바로 비교하기는 어렵습니다. 항목마다 원문에서 확인할 수 있습니다.

항목발표 값원문
DeepSWE v1.1 Long-horizon software engineering73.7%deepmind.google
Vals Finance Agent v2 Financial analyst tasks61.4%deepmind.google
Harvey's Legal Agent Benchmark Complex legal workflows10%deepmind.google
Terminal-bench 2.1 Agentic terminal coding89.4%deepmind.google
Terminal-bench 4.0 General agent capabilities19.1%deepmind.google
GDP.PDF Expert PDF document comprehension35%deepmind.google
CharXiv Reasoning Information synthesis from complex charts86.2%deepmind.google
HLE-Verified Multidisciplinary expert reasoning54.9%deepmind.google
OSWorld-2.0 Agentic computer use59%deepmind.google

함께 볼 모델