AI의 변화, 근거와 맥락까지.AI NEWS & CONTEXT
AI 모델 · OpenAI

GPT-6 Astra

OpenAI 모델 · 2026년 9월 3일 공개. 독립 벤치마크 점수, 종합 지수, 사람 투표 순위와 개발사 발표 점수를 그래프로 정리했습니다.

개발
OpenAI
공개일
이용 방식
API 제공
학습 연산량
1.0×10²⁷ FLOPEpoch AI 추정치
종합 능력 지수(ECI)
166.4신뢰구간 163.3~171.5
Arena 점수(사람 투표)
144074위 · 투표 10,536표

비슷한 모델과 비교하기사전에서 GPT 알아보기

주요 반응

컴퓨터 사용과 장시간 에이전트 작업에서 인상적인 시연과 호평이 이어졌다. 반면 가격이 2.5배로 뛰었고, 글쓰기·취향이 필요한 작업의 약점과 사이버 보안 위험 등급, AGI 발언 논란이 비판을 받았다.

  • 호평테스터들은 맨해튼을 언리얼 엔진으로 재현하고 브라우저 게임을 하루 만에 만드는 시연을 쏟아냈다. OpenAI는 OSWorld 2.0 72.6%(Sol 65.7%)와 작업 시간 약 40분(Sol 75분)을 제시했다.[1][2]
  • 엇갈림독립 평가의 갱신된 지수에서 Astra(최대 설정)는 Claude Fable 5.1과 공동 1위였다. 다만 초기 집계를 인용한 보도들은 Fable 5.1에 뒤진다고 전해 평가가 엇갈렸다.[3][4][1]
  • 엇갈림가격은 입출력 100만 토큰당 10달러/50달러로 GPT-5.6 Sol의 2.5배다. 최대 노력 설정의 과제당 비용은 Sol보다 약 60% 높았지만, Fable 5.1과 같은 지수 점수를 약 40% 비용으로 냈다.[3]
  • 비판한 평가자의 문체 벤치마크에서 11위로 이전 모델보다 낮았고 전문 업무 지표 GDPval-AA v2도 Sol보다 낮았다. 개발자 커뮤니티에서는 여전히 정밀한 지시가 필요하다는 후기가 나왔다.[1][3][5]
  • 엇갈림OpenAI 최초로 사이버 보안 Critical 등급을 받았고 공개판은 고급 공격 작업을 거부한다. Greg Brockman의 AGI 시대 발언, ARC-AGI-3 점수의 검증 가능성, 감시 체계가 정상 작업을 끊을 수 있다는 점이 논란이 됐다.[6][2]
반응 출처 6개
  1. OpenAI GPT-6 Astra review: shockingly good · decrypt.co
  2. OpenAI launches GPT-6 Astra, Brockman invokes 'AGI era' · aiweekly.co
  3. Benchmarking GPT-6 Astra · artificialanalysis.ai
  4. GPT-6 Astra: independent benchmarks vs launch claims · requesty.ai
  5. GPT-6 Astra | Hacker News · news.ycombinator.com
  6. OpenAI Launches GPT-6 Astra, Its First 'Critical' Cyber Model · rits.shanghai.nyu.edu

출시 기사·리뷰·전문가 평가·개발자 커뮤니티 토론을 LUCAS AI News가 읽고 요약했습니다(2026-10-11 기준). 원문 표현은 옮기지 않았으니 자세한 내용은 출처에서 확인하세요.

영역별 강점

과학수학코딩지식추론공간·학습GPT-6 AstraGPT-6 Astra · 과학: 100백분위GPT-6 Astra · 수학: 99백분위GPT-6 Astra · 코딩: 63백분위GPT-6 Astra · 지식: 100백분위GPT-6 Astra · 추론: 100백분위GPT-6 Astra · 공간·학습: 98백분위

같은 시험을 치른 모델 가운데 어디쯤인지(백분위)를 영역별로 평균했습니다. 바깥일수록 상위권이고, 점수가 없는 영역은 가운데 빈 점으로 표시합니다.

OpenAI 모델 흐름

120140160202420252026종합 지수(ECI)GPT-6.1 Sol · 166.1 · 2026-09-29GPT-6 Sol · 162.7 · 2026-09-22GPT-6 Luna · 156.3 · 2026-09-22GPT-5.6 Sol · 161.7 · 2026-07-09GPT-5.6 Terra · 159.6 · 2026-07-09GPT-5.6 Luna · 156.4 · 2026-07-09GPT-5.5 Instant · 142.5 · 2026-05-05GPT-5.5 · 159.1 · 2026-04-23GPT-5.4 Mini · 148.8 · 2026-03-17GPT-5.4 Nano · 145.8 · 2026-03-17GPT-5.4 · 156.8 · 2026-03-05GPT-5.2 · 153.5 · 2025-12-11GPT-5.1 · 149.6 · 2025-11-13GPT-5 mini · 145.5 · 2025-08-07GPT-5 nano · 139.4 · 2025-08-07gpt-oss-120b · 139.9 · 2025-08-05gpt-oss-20b · 137.8 · 2025-08-05o4-mini · 145.6 · 2025-04-16GPT-4.1 · 136.8 · 2025-04-14GPT-4.1 mini · 135 · 2025-04-14GPT-4.1 nano · 129.6 · 2025-04-14GPT-4.5 · 136.7 · 2025-02-27o3-mini · 140.3 · 2025-01-31GPT-4o (Nov 2024) · 128.8 · 2024-11-20o1-preview · 134.8 · 2024-09-12GPT-4o (Aug 2024) · 128.8 · 2024-08-06GPT-4o mini · 126.6 · 2024-07-18GPT-3.5 Turbo (Jan 2024) · 115.7 · 2024-01-25GPT-3.5 Turbo (Nov 2023) · 118.6 · 2023-11-06GPT-4 (Jun 2023) · 123.1 · 2023-06-13GPT-3.5 Turbo (Jun 2023) · 113.4 · 2023-06-13GPT-6 Astra · 166.5 · 2026-09-03GPT-5.5 Pro · 162.1 · 2026-04-23GPT-5.4 Pro · 158.9 · 2026-03-05GPT-5.3 Codex · 156.8 · 2026-02-05GPT-5.2 Pro · 155.4 · 2025-12-11GPT-5 Pro · 150.3 · 2025-10-07GPT-5 · 150 · 2025-08-07o3-pro · 147.4 · 2025-06-10o3 · 146.9 · 2025-04-16o1 · 141.9 · 2024-12-17o1-mini · 135.8 · 2024-09-12GPT-4o (May 2024) · 129 · 2024-05-13GPT-4 Turbo (Apr 2024) · 127.3 · 2024-04-09GPT-4 Turbo (Nov 2023) · 126.5 · 2024-01-25GPT-4 (Mar 2023) · 125.9 · 2023-03-14GPT-6 Astra
120140160202420252026종합 지수(ECI)GPT-6.1 Sol · 166.1 · 2026-09-29GPT-6 Sol · 162.7 · 2026-09-22GPT-6 Luna · 156.3 · 2026-09-22GPT-5.6 Sol · 161.7 · 2026-07-09GPT-5.6 Terra · 159.6 · 2026-07-09GPT-5.6 Luna · 156.4 · 2026-07-09GPT-5.5 Instant · 142.5 · 2026-05-05GPT-5.5 · 159.1 · 2026-04-23GPT-5.4 Mini · 148.8 · 2026-03-17GPT-5.4 Nano · 145.8 · 2026-03-17GPT-5.4 · 156.8 · 2026-03-05GPT-5.2 · 153.5 · 2025-12-11GPT-5.1 · 149.6 · 2025-11-13GPT-5 mini · 145.5 · 2025-08-07GPT-5 nano · 139.4 · 2025-08-07gpt-oss-120b · 139.9 · 2025-08-05gpt-oss-20b · 137.8 · 2025-08-05o4-mini · 145.6 · 2025-04-16GPT-4.1 · 136.8 · 2025-04-14GPT-4.1 mini · 135 · 2025-04-14GPT-4.1 nano · 129.6 · 2025-04-14GPT-4.5 · 136.7 · 2025-02-27o3-mini · 140.3 · 2025-01-31GPT-4o (Nov 2024) · 128.8 · 2024-11-20o1-preview · 134.8 · 2024-09-12GPT-4o (Aug 2024) · 128.8 · 2024-08-06GPT-4o mini · 126.6 · 2024-07-18GPT-3.5 Turbo (Jan 2024) · 115.7 · 2024-01-25GPT-3.5 Turbo (Nov 2023) · 118.6 · 2023-11-06GPT-4 (Jun 2023) · 123.1 · 2023-06-13GPT-3.5 Turbo (Jun 2023) · 113.4 · 2023-06-13GPT-6 Astra · 166.5 · 2026-09-03GPT-5.5 Pro · 162.1 · 2026-04-23GPT-5.4 Pro · 158.9 · 2026-03-05GPT-5.3 Codex · 156.8 · 2026-02-05GPT-5.2 Pro · 155.4 · 2025-12-11GPT-5 Pro · 150.3 · 2025-10-07GPT-5 · 150 · 2025-08-07o3-pro · 147.4 · 2025-06-10o3 · 146.9 · 2025-04-16o1 · 141.9 · 2024-12-17o1-mini · 135.8 · 2024-09-12GPT-4o (May 2024) · 129 · 2024-05-13GPT-4 Turbo (Apr 2024) · 127.3 · 2024-04-09GPT-4 Turbo (Nov 2023) · 126.5 · 2024-01-25GPT-4 (Mar 2023) · 125.9 · 2023-03-14GPT-6 Astra

큰 점이 이 모델입니다. 선은 그때까지의 최고 기록입니다.

독립 벤치마크 점수

  • GPQA Diamond과학95.8%

    94개 모델 중 1위. 대학원 수준의 생물·물리·화학 객관식 문제 198개. 검색으로 답을 찾기 어렵게 만든 문항이다. 생각 수준 '최대' 기준. 오차 ±1.4%.

  • 91개 모델 중 1위. OTIS의 경시대회형 수학 문제 45개. MATH Level 5보다 어렵고 FrontierMath보다 쉽다. 생각 수준 '최대' 기준.

  • 57개 모델 중 1위. 연구 수준의 매우 어려운 수학 문제(비공개) 2026년 판의 1~3단계. 생각 수준 '최대' 기준. 오차 ±1.4%.

  • 48개 모델 중 2위. FrontierMath 2026년 판에서 가장 어려운 4단계 문제(비공개). 생각 수준 '높음' 기준. 오차 ±2.4%.

  • MirrorCode코딩46.7%

    9개 모델 중 4위. 원본 소스 코드 없이 프로그램 전체를 처음부터 다시 구현하는 장기 코딩 과제. 생각 수준 '높음' 기준. 오차 ±11.9%.

  • 52개 모델 중 1위. 정치·과학·예술·스포츠·지리 등 짧은 사실 질문 1,000개에 검색 없이 답한 정확도. 생각 수준 '최대' 기준. 오차 ±1.4%.

  • 체스 퍼즐추론72%

    60개 모델 중 1위. 체스 엔진으로 새로 만든 퍼즐 100개. 퍼즐마다 최선의 다음 수가 하나 있다. 생각 수준 '최대' 기준. 오차 ±4.5%.

  • 47개 모델 중 1위. 잘 알려진 게임을 퍼즐용으로 바꾼 변형판의 100개 국면. 어떤 게임인지는 일부러 밝히지 않았다. 생각 수준 '최대' 기준. 오차 ±3.7%.

  • 가구 조립 검사공간·학습80%

    27개 모델 중 2위. 가구 조립 사진을 보고 조립이 맞는지, 틀렸다면 어느 단계가 틀렸는지 찾는 공간 추론 시험. 생각 수준 '최대' 기준. 오차 ±4.9%.

  • EBR-bench공간·학습76.2%

    21개 모델 중 1위. 덜 알려진 게임 Earthborne Rangers를 반복해서 할수록 점수가 오르는지 보는 학습 능력 시험. 생각 수준 '최대' 기준. 오차 ±8.4%.

세로선은 무작위로 찍었을 때 기대되는 점수입니다. 같은 벤치마크라도 평가 방식과 설정에 따라 점수가 달라지므로 개발사 발표 수치와 다를 수 있습니다.

함께 볼 모델