AI 모델 · Google
Gemini 4 Argon
Google 모델 · 2026년 9월 30일 공개. 독립 벤치마크 점수, 종합 지수, 사람 투표 순위와 개발사 발표 점수를 그래프로 정리했습니다.
- 개발
- Google DeepMind
- 공개일
- 이용 방식
- 제한 공개
- 종합 능력 지수(ECI)
- 아직 없음
- Arena 점수(사람 투표)
- 15341위 · 투표 4,892표
주요 반응
Gemini 4 Argon은 Artificial Analysis에서 Google이 지능 면에서 다시 상위 3개 연구소에 들었다는 평가와 낮은 환각률로 주목받았다. 그러나 선별된 사이버 방어 기관에만 먼저 공개돼 독립 검증이 제한적이고, 토큰 사용량과 작업당 비용에 대한 우려가 나왔다.
- 엇갈림Google은 Argon을 사이버 방어 조직 대상 Fairwind 프로그램에 먼저 공개하고 유료 API·AI Ultra 고객으로 넓힌다고 밝혔다. 개발자 커뮤니티에서는 Google이 복귀했다는 반응과 일반 공개 전이라 판단하기 이르다는 회의가 엇갈렸다.[1][2]
- 호평Artificial Analysis 지수에서 53점으로 GPT-6 Astra(max)와 같고 GPT-6.1 Sol보다 1점 높았다. AA-Omniscience 환각률은 15%로 지수 45점 이상 모델 중 가장 낮았다.[3]
- 비판같은 평가에서 작업당 평균 출력이 62k 토큰으로 GPT-6 Astra(27k)의 두 배 이상이라 작업당 비용이 할인가 $1.99, 정상가 $3.98로 커졌다. 정확도도 3.1 Pro Preview보다 5%p 낮은 50%였다.[3]
- 엇갈림Google 자체 비교표에서 Argon은 19개 항목 중 14개에서 1위 또는 공동 1위였다(DeepSWE v1.1 77.9%). 하지만 일부 터미널·에이전트 벤치마크에서는 뒤졌고, 수치가 모두 자체 측정이라 외부 검증은 아직 어렵다.[4]
반응 출처 4개
- Gemini 4 Argon: our next era of frontier intelligence · blog.google
- Gemini 4 Argon · news.ycombinator.com
- Gemini 4 Argon: Google is back as one of the top three labs in intelligence achieved · artificialanalysis.ai
- Gemini 4 Argon: How Does It Do Against GPT-6 Astra and Claude? · hackernoon.com
출시 기사·리뷰·전문가 평가·개발자 커뮤니티 토론을 LUCAS AI News가 읽고 요약했습니다(2026-10-11 기준). 원문 표현은 옮기지 않았으니 자세한 내용은 출처에서 확인하세요.
독립 벤치마크 점수
독립 평가 기관이 아직 이 모델의 점수를 발표하지 않았습니다. 점수가 나오면 반영합니다.
개발사 발표 점수
개발사가 공식 페이지나 논문에 직접 밝힌 수치입니다. 평가 조건이 서로 달라 다른 모델과 바로 비교하기는 어렵습니다. 항목마다 원문에서 확인할 수 있습니다.
| 항목 | 발표 값 | 원문 |
|---|---|---|
| Vals Index Knowledge work | 68.9% | deepmind.google |
| AutomationBench Knowledge work | 51.3% | deepmind.google |
| Vals Finance Agent v2 Knowledge work | 65.4% | deepmind.google |
| Harvey's Legal Agent Benchmark Knowledge work | 19.6% | deepmind.google |
| DeepSWE v1.1 Agentic coding | 77.9% | deepmind.google |
| FrontierSWE v2 Agentic coding | 55% | deepmind.google |
| Vibe Code Bench Agentic coding | 91.9% | deepmind.google |
| Terminal-bench 4.0 Agentic coding | 57.4% | deepmind.google |
| PostTrainBench ML engineering | 45.3% | deepmind.google |
| Terminal-Bench Science 0.1 Science and math | 57.6% | deepmind.google |
| RiemannBench Science and math | 76% | deepmind.google |
| GraphWalks Long context | 99.7% | deepmind.google |
| Agent's Last Exam Computer use | 39.5% | deepmind.google |
| OSWorld-2.0 Computer use | 69.2% | deepmind.google |
| Chartography Multimodal understanding | 71.6% | deepmind.google |
| LVBench Multimodal understanding | 91.7% | deepmind.google |
함께 볼 모델
Gemini 3.8 Flash Google · 2026-09-02
Gemini 3.7 Flash Google · 2026-08-13- GPT-6.1 Sol OpenAI · 2026-09-29
- Claude Sonnet 5.5 Anthropic · 2026-09-28