AI의 변화, 근거와 맥락까지.AI NEWS & CONTEXT
AI 모델 · Google

Gemini 4 Argon

Google 모델 · 2026년 9월 30일 공개. 독립 벤치마크 점수, 종합 지수, 사람 투표 순위와 개발사 발표 점수를 그래프로 정리했습니다.

개발
Google DeepMind
공개일
이용 방식
제한 공개
종합 능력 지수(ECI)
아직 없음
Arena 점수(사람 투표)
15341위 · 투표 4,892표

비슷한 모델과 비교하기사전에서 Gemini 알아보기

주요 반응

Gemini 4 Argon은 Artificial Analysis에서 Google이 지능 면에서 다시 상위 3개 연구소에 들었다는 평가와 낮은 환각률로 주목받았다. 그러나 선별된 사이버 방어 기관에만 먼저 공개돼 독립 검증이 제한적이고, 토큰 사용량과 작업당 비용에 대한 우려가 나왔다.

  • 엇갈림Google은 Argon을 사이버 방어 조직 대상 Fairwind 프로그램에 먼저 공개하고 유료 API·AI Ultra 고객으로 넓힌다고 밝혔다. 개발자 커뮤니티에서는 Google이 복귀했다는 반응과 일반 공개 전이라 판단하기 이르다는 회의가 엇갈렸다.[1][2]
  • 호평Artificial Analysis 지수에서 53점으로 GPT-6 Astra(max)와 같고 GPT-6.1 Sol보다 1점 높았다. AA-Omniscience 환각률은 15%로 지수 45점 이상 모델 중 가장 낮았다.[3]
  • 비판같은 평가에서 작업당 평균 출력이 62k 토큰으로 GPT-6 Astra(27k)의 두 배 이상이라 작업당 비용이 할인가 $1.99, 정상가 $3.98로 커졌다. 정확도도 3.1 Pro Preview보다 5%p 낮은 50%였다.[3]
  • 엇갈림Google 자체 비교표에서 Argon은 19개 항목 중 14개에서 1위 또는 공동 1위였다(DeepSWE v1.1 77.9%). 하지만 일부 터미널·에이전트 벤치마크에서는 뒤졌고, 수치가 모두 자체 측정이라 외부 검증은 아직 어렵다.[4]
반응 출처 4개
  1. Gemini 4 Argon: our next era of frontier intelligence · blog.google
  2. Gemini 4 Argon · news.ycombinator.com
  3. Gemini 4 Argon: Google is back as one of the top three labs in intelligence achieved · artificialanalysis.ai
  4. Gemini 4 Argon: How Does It Do Against GPT-6 Astra and Claude? · hackernoon.com

출시 기사·리뷰·전문가 평가·개발자 커뮤니티 토론을 LUCAS AI News가 읽고 요약했습니다(2026-10-11 기준). 원문 표현은 옮기지 않았으니 자세한 내용은 출처에서 확인하세요.

독립 벤치마크 점수

독립 평가 기관이 아직 이 모델의 점수를 발표하지 않았습니다. 점수가 나오면 반영합니다.

개발사 발표 점수

개발사가 공식 페이지나 논문에 직접 밝힌 수치입니다. 평가 조건이 서로 달라 다른 모델과 바로 비교하기는 어렵습니다. 항목마다 원문에서 확인할 수 있습니다.

항목발표 값원문
Vals Index Knowledge work68.9%deepmind.google
AutomationBench Knowledge work51.3%deepmind.google
Vals Finance Agent v2 Knowledge work65.4%deepmind.google
Harvey's Legal Agent Benchmark Knowledge work19.6%deepmind.google
DeepSWE v1.1 Agentic coding77.9%deepmind.google
FrontierSWE v2 Agentic coding55%deepmind.google
Vibe Code Bench Agentic coding91.9%deepmind.google
Terminal-bench 4.0 Agentic coding57.4%deepmind.google
PostTrainBench ML engineering45.3%deepmind.google
Terminal-Bench Science 0.1 Science and math57.6%deepmind.google
RiemannBench Science and math76%deepmind.google
GraphWalks Long context99.7%deepmind.google
Agent's Last Exam Computer use39.5%deepmind.google
OSWorld-2.0 Computer use69.2%deepmind.google
Chartography Multimodal understanding71.6%deepmind.google
LVBench Multimodal understanding91.7%deepmind.google

함께 볼 모델