AI의 변화, 근거와 맥락까지.AI NEWS & CONTEXT
AI 모델 · xAI

Grok 3

xAI 모델 · 2025년 4월 9일 공개. 독립 벤치마크 점수, 종합 지수, 사람 투표 순위와 개발사 발표 점수를 그래프로 정리했습니다.

개발
xAI
공개일
이용 방식
API 제공
매개변수(공개·추정치)
3조 개
학습 연산량
3.5×10²⁶ FLOPEpoch AI 추정치
종합 능력 지수(ECI)
138.3신뢰구간 135.3~139.8
Arena 점수(사람 투표)
아직 없음

비슷한 모델과 비교하기사전에서 Grok 알아보기

주요 반응

2025년 2월 출시 직후 Karpathy와 Mollick 등은 최상위권 모델에 근접한다고 평가했고 Chatbot Arena에서도 1위에 올랐다. 반면 xAI의 벤치마크 비교 방식, 시스템 프롬프트 검열 논란, API 컨텍스트 제한 등에는 비판이 이어졌다.

  • 호평Andrej Karpathy는 초기 사용 후 OpenAI 최상위 모델에 근접하다고 평가했고, Ethan Mollick은 프런티어에 오른 좋은 모델이라고 봤다. Chatbot Arena에서는 전 부문 1위였다.[1][2]
  • 비판xAI의 AIME 2025 그래프가 o3-mini-high의 cons@64 점수를 빼고 비교했다는 지적이 나왔다. 1회 시도 기준에서는 두 Grok 3 변형 모두 o3-mini-high에 못 미쳤고, xAI 측은 OpenAI도 비슷하게 했다고 반박했다.[3]
  • 엇갈림개발자 커뮤니티에서는 자신의 데이터베이스 코드 테스트에서 o1·GPT-4o·Claude 3.5보다 낫다며 감탄한 이용자가 있었다. 반면 LMArena 순위가 조작되기 쉽고 스타일 보정 시 순위가 달라진다는 지적도 나왔다.[4]
  • 비판2월 Grok 3의 검색 지시문에 머스크·트럼프가 허위정보를 퍼뜨린다는 출처를 무시하라는 내용이 들어 있던 사실이 알려졌다. xAI는 한 직원이 한 일이라며 변경을 되돌렸다.[5]
  • 비판4월 공개된 API는 입력 100만 토큰당 3달러, 출력 15달러로 Claude 3.7 Sonnet과 같고 Gemini 2.5 Pro보다 비쌌다. 컨텍스트도 131,072토큰으로 xAI가 2월에 내세운 100만 토큰에 못 미쳤다.[6]
반응 출처 6개
  1. Andrej Karpathy's initial impressions of Grok 3 · simonwillison.net
  2. How Grok 3 compares to ChatGPT, DeepSeek and other AI rivals · tech.yahoo.com
  3. Did xAI lie about Grok 3's benchmarks? · techcrunch.com
  4. Grok3 Launch [video] | Hacker News · news.ycombinator.com
  5. xAI alters Grok chatbot to shield Elon Musk from misinformation claims · the-decoder.com
  6. Elon Musk's AI company, xAI, launches an API for Grok 3 · techcrunch.com

출시 기사·리뷰·전문가 평가·개발자 커뮤니티 토론을 LUCAS AI News가 읽고 요약했습니다(2026-10-11 기준). 원문 표현은 옮기지 않았으니 자세한 내용은 출처에서 확인하세요.

영역별 강점

과학수학코딩지식추론공간·학습Grok 3Grok 3 · 과학: 41백분위Grok 3 · 수학: 40백분위Grok 3 · 코딩: 50백분위Grok 3 · 지식: 점수 없음Grok 3 · 추론: 점수 없음Grok 3 · 공간·학습: 점수 없음

같은 시험을 치른 모델 가운데 어디쯤인지(백분위)를 영역별로 평균했습니다. 바깥일수록 상위권이고, 점수가 없는 영역은 가운데 빈 점으로 표시합니다.

xAI 모델 흐름

큰 점이 이 모델입니다. 선은 그때까지의 최고 기록입니다.

독립 벤치마크 점수

  • GPQA Diamond과학75.8%

    94개 모델 중 56위. 대학원 수준의 생물·물리·화학 객관식 문제 198개. 검색으로 답을 찾기 어렵게 만든 문항이다. 오차 ±2.7%.

  • MATH Level 5수학88.8%

    45개 모델 중 15위. MATH 데이터셋에서 가장 어려운 단계. AMC 10·12, AIME 같은 경시대회 문제다. 오차 ±0.9%.

  • OTIS 모의 AIME수학55.6%

    91개 모델 중 62위. OTIS의 경시대회형 수학 문제 45개. MATH Level 5보다 어렵고 FrontierMath보다 쉽다. 오차 ±7.5%.

  • 46개 모델 중 37위. 연구 수준의 매우 어려운 수학 문제(비공개). 2026년 6월 새 판으로 바뀌기 전 기록이다. 오차 ±1.1%.

  • Aider Polyglot코딩53.3%

    29개 모델 중 15위. C++·Go·Java·JavaScript·Python·Rust의 어려운 연습 문제 225개를 코드 편집으로 푸는 시험(두 번째 시도까지 통과율). (Aider 측정)

세로선은 무작위로 찍었을 때 기대되는 점수입니다. 같은 벤치마크라도 평가 방식과 설정에 따라 점수가 달라지므로 개발사 발표 수치와 다를 수 있습니다.

개발사 발표 점수

개발사가 공식 페이지나 논문에 직접 밝힌 수치입니다. 평가 조건이 서로 달라 다른 모델과 바로 비교하기는 어렵습니다. 항목마다 원문에서 확인할 수 있습니다.

항목발표 값원문
AIME’2452.2%x.ai
GPQA75.4%x.ai
LCB57%x.ai
MMLU-pro79.9%x.ai
LOFT (128k)83.3%x.ai
SimpleQA43.6%x.ai
MMMU73.2%x.ai
EgoSchema74.5%x.ai
Reka Research Evalreasoning37%x.ai
BrowseComp (zh)reasoning10.8%x.ai
X Bench Deepsearch (zh)reasoning27%x.ai
X Browse*reasoning20.8%x.ai

함께 볼 모델