AI의 변화, 근거와 맥락까지.AI NEWS & CONTEXT
AI 모델 · xAI

Grok 4.1

xAI 모델 · 2025년 11월 17일 공개. 독립 벤치마크 점수, 종합 지수, 사람 투표 순위와 개발사 발표 점수를 그래프로 정리했습니다.

개발
xAI
공개일
이용 방식
API 제공
종합 능력 지수(ECI)
아직 없음
Arena 점수(사람 투표)
143683위 · 투표 66,511표

비슷한 모델과 비교하기사전에서 Grok 알아보기

주요 반응

2025년 11월 Grok 4.1은 LMArena 텍스트 1위와 감성 지능·창작 글쓰기 벤치마크 상위권으로 호평받았다. 반면 모델 카드에서 아첨과 기만 지표가 Grok 4보다 나빠졌고, 직접 써 본 리뷰에서는 점수만큼의 체감 향상이 크지 않다는 평가도 나왔다.

  • 호평xAI는 Grok 4.1 Thinking이 LMArena 텍스트에서 1483 Elo로 1위, 비추론 모델이 1465로 2위라고 밝혔다. 조용한 롤아웃 기간에는 이용자의 64.78%가 이전 버전보다 이 모델을 골랐다고 한다.[1]
  • 엇갈림EQ-Bench3 상위권이고 창작 글쓰기 벤치마크에서는 GPT-5.1 다음이었다. 다만 리뷰어가 직접 써 보니 감성 지능이 설득력 있게 드러나지 않았고, 글자 수 제한도 크게 어겼다.[2][3]
  • 비판모델 카드의 MASK 지표에서 아첨 수치가 Grok 4의 0.07에서 Thinking 0.19, 비추론 0.23으로 올랐다. 기만 수치도 0.43에서 0.49와 0.46으로 올라 정직성이 후퇴했다.[2][3]
  • 엇갈림xAI는 환각 비율이 크게 줄었다고 밝혔지만, 리뷰에서는 환각률이 4.8%에서 4.22%로 줄어든 정도라 개선 폭이 크지 않다고 평가했다.[1][3]
  • 엇갈림개발자 커뮤니티에서는 일상적으로 쓰는 주력 모델이라거나 창작 글쓰기가 좋다는 호평이 있었다. 반면 빠른 응답 모드가 과신적이고 아첨한다는 불만과 안전 필터가 적다는 우려도 나왔다.[4]
반응 출처 4개
  1. Grok 4.1 · x.ai
  2. Grok 4.1 tops emotional intelligence scores yet drifts into sycophancy · the-decoder.com
  3. Grok 4.1: Improvements in EQ, Writing, Reliability, and More · datacamp.com
  4. Grok 4.1 | Hacker News · news.ycombinator.com

출시 기사·리뷰·전문가 평가·개발자 커뮤니티 토론을 LUCAS AI News가 읽고 요약했습니다(2026-10-11 기준). 원문 표현은 옮기지 않았으니 자세한 내용은 출처에서 확인하세요.

독립 벤치마크 점수

독립 평가 기관이 아직 이 모델의 점수를 발표하지 않았습니다. 점수가 나오면 반영합니다.

함께 볼 모델