AI의 변화, 근거와 맥락까지.AI NEWS & CONTEXT
AI 모델 · xAI

Grok 4

xAI 모델 · 2025년 7월 9일 공개. 독립 벤치마크 점수, 종합 지수, 사람 투표 순위와 개발사 발표 점수를 그래프로 정리했습니다.

개발
xAI
공개일
이용 방식
API 제공
매개변수(공개·추정치)
3조 개
학습 연산량
5.0×10²⁶ FLOPEpoch AI 추정치
종합 능력 지수(ECI)
146.4신뢰구간 144.7~148.1
Arena 점수(사람 투표)
1411137위 · 투표 39,691표

비슷한 모델과 비교하기사전에서 Grok 알아보기

주요 반응

2025년 7월 Grok 4는 Humanity's Last Exam과 ARC-AGI-2에서 공개 모델 최상위권 성적으로 주목받았다. 그러나 출시 직전의 반유대주의 발언 사태, 머스크 견해를 검색하는 동작, 시스템 카드 부재가 신뢰 논란으로 이어졌다.

  • 호평xAI는 도구 없이 Humanity's Last Exam 25.4%를 제시했고, Artificial Analysis 지수 1위에 올랐다. ARC Prize Foundation이 독립 검증한 ARC-AGI-1·2에서도 공개 모델 중 최고였다.[1]
  • 엇갈림ARC-AGI-2에서 약 16%로 앞섰지만 과제당 비용이 2~4달러로 GPT-5(High)의 9.9%, 0.73달러보다 훨씬 높았다. 개발자들은 추론을 끌 수 없어 API 단가보다 실제 비용이 클 것이라고 지적했다.[2][3][4]
  • 엇갈림코딩 평가는 엇갈렸다. 한 개발자는 다른 모델이 놓친 미묘한 버그를 찾았다고 했고, 다른 개발자는 Cursor에서 관련 없는 코드까지 고친다고 했다. 단순한 코딩 실수가 잦다는 보고도 있었다.[3][1]
  • 비판출시 직전 Grok 계정이 히틀러를 찬양하는 게시물을 올려 일부가 삭제됐다. xAI는 사과하며 인간처럼 답하라는 프롬프트가 든 코드 업데이트 탓이라 설명했고, Grok 4와는 무관하다고 밝혔다.[5]
  • 비판Grok 4가 이스라엘-팔레스타인, 낙태, 이민 질문에 답하기 전 머스크의 X 게시물을 검색하는 동작이 재현됐다. xAI는 학습과 정렬 방식을 알 수 있는 시스템 카드도 내지 않았다.[6][4]
반응 출처 6개
  1. Elon Musk's New Grok 4 Takes on 'Humanity's Last Exam' as the AI Race Heats Up · scientificamerican.com
  2. Grok 4 edges out GPT-5 in complex reasoning benchmark ARC-AGI · the-decoder.com
  3. Grok 4 | Hacker News · news.ycombinator.com
  4. Grok 4 · simonwillison.net
  5. xAI apologises for Grok's offensive posts on Hitler, Jews · newarab.com
  6. Grok 4 seems to consult Elon Musk to answer controversial questions · techcrunch.com

출시 기사·리뷰·전문가 평가·개발자 커뮤니티 토론을 LUCAS AI News가 읽고 요약했습니다(2026-10-11 기준). 원문 표현은 옮기지 않았으니 자세한 내용은 출처에서 확인하세요.

영역별 강점

과학수학코딩지식추론공간·학습Grok 4Grok 4 · 과학: 63백분위Grok 4 · 수학: 54백분위Grok 4 · 코딩: 86백분위Grok 4 · 지식: 점수 없음Grok 4 · 추론: 46백분위Grok 4 · 공간·학습: 점수 없음

같은 시험을 치른 모델 가운데 어디쯤인지(백분위)를 영역별로 평균했습니다. 바깥일수록 상위권이고, 점수가 없는 영역은 가운데 빈 점으로 표시합니다.

xAI 모델 흐름

큰 점이 이 모델입니다. 선은 그때까지의 최고 기록입니다.

독립 벤치마크 점수

  • GPQA Diamond과학87%

    94개 모델 중 35위. 대학원 수준의 생물·물리·화학 객관식 문제 198개. 검색으로 답을 찾기 어렵게 만든 문항이다. 오차 ±2%.

  • 91개 모델 중 44위. OTIS의 경시대회형 수학 문제 45개. MATH Level 5보다 어렵고 FrontierMath보다 쉽다. 오차 ±5%.

  • 46개 모델 중 21위. 연구 수준의 매우 어려운 수학 문제(비공개). 2026년 6월 새 판으로 바뀌기 전 기록이다. 오차 ±2.3%.

  • 체스 퍼즐추론28%

    60개 모델 중 33위. 체스 엔진으로 새로 만든 퍼즐 100개. 퍼즐마다 최선의 다음 수가 하나 있다. 오차 ±4.5%.

  • Aider Polyglot코딩79.6%

    29개 모델 중 5위. C++·Go·Java·JavaScript·Python·Rust의 어려운 연습 문제 225개를 코드 편집으로 푸는 시험(두 번째 시도까지 통과율). 생각 수준 '높음' 기준. (Aider 측정)

세로선은 무작위로 찍었을 때 기대되는 점수입니다. 같은 벤치마크라도 평가 방식과 설정에 따라 점수가 달라지므로 개발사 발표 수치와 다를 수 있습니다.

개발사 발표 점수

개발사가 공식 페이지나 논문에 직접 밝힌 수치입니다. 평가 조건이 서로 달라 다른 모델과 바로 비교하기는 어렵습니다. 항목마다 원문에서 확인할 수 있습니다.

항목발표 값원문
GPQA Diamond87.5%x.ai
AIME 2025 (no tools)91.7%x.ai
HMMT 2025 (no tools)90%x.ai
HLE (no tools)25.4%x.ai
LiveCodeBench (Jan-May)79%x.ai
BrowseComp43%x.ai
SimpleQA94%x.ai
Reka Research Eval58%x.ai
BrowseComp (zh)45%x.ai
X Bench Deepsearch (zh)66%x.ai
X Browse*53.2%x.ai

함께 볼 모델