AI의 변화, 근거와 맥락까지.AI NEWS & CONTEXT
AI 모델 · xAI

Grok-2 (Dec 2024)

xAI 모델 · 2024년 12월 12일 공개. 독립 벤치마크 점수, 종합 지수, 사람 투표 순위와 개발사 발표 점수를 그래프로 정리했습니다.

개발
xAI
공개일
이용 방식
API 제공
학습 연산량
3.0×10²⁵ FLOPEpoch AI 추정치
종합 능력 지수(ECI)
130.5신뢰구간 125.8~132.2
Arena 점수(사람 투표)
아직 없음

비슷한 모델과 비교하기사전에서 Grok 알아보기

주요 반응

2024년 8월 출시 때는 FLUX.1 기반 이미지 생성이 안전장치가 거의 없다는 논란이 성능 논의를 압도했다. 개발자 커뮤니티는 경쟁력은 인정하면서도 벤치마크 순위와 안전 설정에 의문을 제기했고, 12월 업데이트는 속도 개선과 무료 개방이 부각됐다.

  • 엇갈림xAI는 LMSYS 종합 Elo에서 Claude와 GPT-4를 앞선다고 밝혔다. 다만 자체 표에서 MMLU는 87.5%로 GPT-4o(88.7%)보다, GPQA는 56.0%로 Claude 3.5 Sonnet(59.6%)보다 낮았다.[1]
  • 비판Flux.1 기반 이미지 생성은 출시 몇 시간 만에 실존 정치인과 유명 브랜드를 거의 제한 없이 그려낸다는 비판을 받았고, 딥페이크와 허위정보 우려, 규제 리스크도 함께 거론됐다.[2][3]
  • 엇갈림개발자 커뮤니티에서는 Claude 3.5 Sonnet 다음 수준으로 경쟁력이 있다는 평가가 있었다. 한편 Chatbot Arena 순위가 영어 중심이고 조작되기 쉽다는 의심과 안전 튜닝이 약하다는 지적도 나왔다.[4]
  • 호평2024년 12월 업데이트는 xAI 설명 기준 이전보다 3배 빠르고 정확도와 다국어 능력이 개선됐다. 웹 검색과 인용, 게시물 해설 버튼이 추가됐고 일부 이용자는 이 버튼을 높이 평가했다.[5]
  • 엇갈림무료 개방에는 Grok-2 기준 2시간 10건이라는 사용 제한과 계정 요건이 붙었다. API 가격은 입력 100만 토큰당 2달러, 출력 10달러로 낮아졌다.[6][5]
반응 출처 6개
  1. Grok-2 Beta Release · x.ai
  2. xAI releases Grok-2 with controversial image generation · heise.de
  3. Grok-2 arrives with image generations — is the world ready? · venturebeat.com
  4. Grok-2 Beta Release | Hacker News · news.ycombinator.com
  5. All X (formerly Twitter) users can now use 'Grok-2,' which is three times faster than before, with a 'Grok button' added to the UI and API prices reduced - GIGAZINE · gigazine.net
  6. xAI makes Grok chatbot free for all X users, adds image generation capabilities · ppc.land

출시 기사·리뷰·전문가 평가·개발자 커뮤니티 토론을 LUCAS AI News가 읽고 요약했습니다(2026-10-11 기준). 원문 표현은 옮기지 않았으니 자세한 내용은 출처에서 확인하세요.

독립 벤치마크 점수

  • GPQA Diamond과학53.8%

    94개 모델 중 71위. 대학원 수준의 생물·물리·화학 객관식 문제 198개. 검색으로 답을 찾기 어렵게 만든 문항이다. 오차 ±2.7%.

  • MATH Level 5수학63.5%

    45개 모델 중 25위. MATH 데이터셋에서 가장 어려운 단계. AMC 10·12, AIME 같은 경시대회 문제다. 오차 ±1.3%.

  • OTIS 모의 AIME수학11.5%

    91개 모델 중 71위. OTIS의 경시대회형 수학 문제 45개. MATH Level 5보다 어렵고 FrontierMath보다 쉽다. 오차 ±3.4%.

  • 46개 모델 중 42위. 연구 수준의 매우 어려운 수학 문제(비공개). 2026년 6월 새 판으로 바뀌기 전 기록이다. 오차 ±0.5%.

세로선은 무작위로 찍었을 때 기대되는 점수입니다. 같은 벤치마크라도 평가 방식과 설정에 따라 점수가 달라지므로 개발사 발표 수치와 다를 수 있습니다.

함께 볼 모델