Grok 4
xAI 모델 · 2025년 7월 9일 공개. 독립 벤치마크 점수, 종합 지수, 사람 투표 순위와 개발사 발표 점수를 그래프로 정리했습니다.
- 개발
- xAI
- 공개일
- 이용 방식
- API 제공
- 매개변수(공개·추정치)
- 3조 개
- 학습 연산량
- 5.0×10²⁶ FLOPEpoch AI 추정치
- 종합 능력 지수(ECI)
- 146.4신뢰구간 144.7~148.1
- Arena 점수(사람 투표)
- 1411137위 · 투표 39,691표
주요 반응
2025년 7월 Grok 4는 Humanity's Last Exam과 ARC-AGI-2에서 공개 모델 최상위권 성적으로 주목받았다. 그러나 출시 직전의 반유대주의 발언 사태, 머스크 견해를 검색하는 동작, 시스템 카드 부재가 신뢰 논란으로 이어졌다.
- 호평xAI는 도구 없이 Humanity's Last Exam 25.4%를 제시했고, Artificial Analysis 지수 1위에 올랐다. ARC Prize Foundation이 독립 검증한 ARC-AGI-1·2에서도 공개 모델 중 최고였다.[1]
- 엇갈림ARC-AGI-2에서 약 16%로 앞섰지만 과제당 비용이 2~4달러로 GPT-5(High)의 9.9%, 0.73달러보다 훨씬 높았다. 개발자들은 추론을 끌 수 없어 API 단가보다 실제 비용이 클 것이라고 지적했다.[2][3][4]
- 엇갈림코딩 평가는 엇갈렸다. 한 개발자는 다른 모델이 놓친 미묘한 버그를 찾았다고 했고, 다른 개발자는 Cursor에서 관련 없는 코드까지 고친다고 했다. 단순한 코딩 실수가 잦다는 보고도 있었다.[3][1]
- 비판출시 직전 Grok 계정이 히틀러를 찬양하는 게시물을 올려 일부가 삭제됐다. xAI는 사과하며 인간처럼 답하라는 프롬프트가 든 코드 업데이트 탓이라 설명했고, Grok 4와는 무관하다고 밝혔다.[5]
- 비판Grok 4가 이스라엘-팔레스타인, 낙태, 이민 질문에 답하기 전 머스크의 X 게시물을 검색하는 동작이 재현됐다. xAI는 학습과 정렬 방식을 알 수 있는 시스템 카드도 내지 않았다.[6][4]
반응 출처 6개
- Elon Musk's New Grok 4 Takes on 'Humanity's Last Exam' as the AI Race Heats Up · scientificamerican.com
- Grok 4 edges out GPT-5 in complex reasoning benchmark ARC-AGI · the-decoder.com
- Grok 4 | Hacker News · news.ycombinator.com
- Grok 4 · simonwillison.net
- xAI apologises for Grok's offensive posts on Hitler, Jews · newarab.com
- Grok 4 seems to consult Elon Musk to answer controversial questions · techcrunch.com
출시 기사·리뷰·전문가 평가·개발자 커뮤니티 토론을 LUCAS AI News가 읽고 요약했습니다(2026-10-11 기준). 원문 표현은 옮기지 않았으니 자세한 내용은 출처에서 확인하세요.
영역별 강점
같은 시험을 치른 모델 가운데 어디쯤인지(백분위)를 영역별로 평균했습니다. 바깥일수록 상위권이고, 점수가 없는 영역은 가운데 빈 점으로 표시합니다.
xAI 모델 흐름
큰 점이 이 모델입니다. 선은 그때까지의 최고 기록입니다.
독립 벤치마크 점수
- GPQA Diamond과학87%
94개 모델 중 35위. 대학원 수준의 생물·물리·화학 객관식 문제 198개. 검색으로 답을 찾기 어렵게 만든 문항이다. 오차 ±2%.
- OTIS 모의 AIME수학84%
91개 모델 중 44위. OTIS의 경시대회형 수학 문제 45개. MATH Level 5보다 어렵고 FrontierMath보다 쉽다. 오차 ±5%.
- FrontierMath(2025판)수학19.7%
46개 모델 중 21위. 연구 수준의 매우 어려운 수학 문제(비공개). 2026년 6월 새 판으로 바뀌기 전 기록이다. 오차 ±2.3%.
- 체스 퍼즐추론28%
60개 모델 중 33위. 체스 엔진으로 새로 만든 퍼즐 100개. 퍼즐마다 최선의 다음 수가 하나 있다. 오차 ±4.5%.
- Aider Polyglot코딩79.6%
29개 모델 중 5위. C++·Go·Java·JavaScript·Python·Rust의 어려운 연습 문제 225개를 코드 편집으로 푸는 시험(두 번째 시도까지 통과율). 생각 수준 '높음' 기준. (Aider 측정)
세로선은 무작위로 찍었을 때 기대되는 점수입니다. 같은 벤치마크라도 평가 방식과 설정에 따라 점수가 달라지므로 개발사 발표 수치와 다를 수 있습니다.
개발사 발표 점수
개발사가 공식 페이지나 논문에 직접 밝힌 수치입니다. 평가 조건이 서로 달라 다른 모델과 바로 비교하기는 어렵습니다. 항목마다 원문에서 확인할 수 있습니다.
함께 볼 모델
- Grok-3 mini xAI · 2025-06-24
- Grok 4 Fast xAI · 2025-09-19
Gemini 2.5 Flash-Lite (Jun 2025) Google · 2025-06-17
Gemini 2.5 Flash (Jun 2025) Google · 2025-06-17