AI의 변화, 근거와 맥락까지.AI NEWS & CONTEXT
AI 모델 · OpenAI

o1-preview

OpenAI 모델 · 2024년 9월 12일 공개. 독립 벤치마크 점수, 종합 지수, 사람 투표 순위와 개발사 발표 점수를 그래프로 정리했습니다.

개발
OpenAI
공개일
이용 방식
API 제공
종합 능력 지수(ECI)
134.8신뢰구간 130.8~138.7
Arena 점수(사람 투표)
1353203위 · 투표 31,122표

비슷한 모델과 비교하기사전에서 GPT 알아보기

주요 반응

o1-preview는 수학·코딩·계획 수립처럼 단계적 추론이 필요한 과제에서 한 단계 도약했다는 평가를 받았다. 반면 응답이 느리고 비용이 높으며 추론 과정이 숨겨진다는 불만이 컸고, 글쓰기는 나아지지 않았으며 코딩 벤치마크에서도 Claude 3.5 Sonnet과 접전이었다.

  • 엇갈림이선 몰릭은 o1-preview가 복잡한 계획 수립 과제에서 큰 도약이라고 평했다. 다만 글쓰기는 나아지지 않았고 어려운 십자말풀이에서 지나치게 문자 그대로 해석하며 환각도 보였다고 지적했다.[1]
  • 비판추론 토큰이 API에서 숨겨진 채 출력 토큰으로 과금되는 점에 불만이 컸다. API는 티어5 계정에만 열렸고 시스템 프롬프트·스트리밍·도구 사용이 지원되지 않았으며, 벤치마크 그래프가 소요 시간을 가린다는 회의도 나왔다.[2][3]
  • 엇갈림aider 코드 편집 벤치마크에서 o1-preview는 whole 형식 79.7%로 당시 최고였지만, 실사용에 가까운 diff 형식은 75.2%로 Claude 3.5 Sonnet(77.4%)에 못 미쳤고 비용은 훨씬 컸다.[4]
  • 호평헬스케어 기업 Oscar Health는 보험 청구 산정, 임상 지침 적용 등 추론 위주 업무에서 GPT-4o보다 낫다는 초기 관찰을 공개했다. 다만 소수 사례에 근거한 정성적 관찰이며 지침이 여전히 필요하다고 밝혔다.[5]
  • 엇갈림OpenAI는 시스템 카드에서 o1 계열을 생물 위협 계획 지원과 설득력 항목에서 중간 위험으로 평가했다. 환각은 GPT-4o보다 줄었지만 결과가 확정적이진 않다고 밝혔다.[6]
반응 출처 6개
  1. Something New: On OpenAI's "Strawberry" and Reasoning · oneusefulthing.org
  2. Notes on OpenAI’s new o1 chain-of-thought models · simonwillison.net
  3. Learning to Reason with LLMs · news.ycombinator.com
  4. o1-preview is SOTA on the aider leaderboard · aider.chat
  5. Oscar Health’s early observations on OpenAI o1-preview · hioscar.ai
  6. OpenAI classifies o1 AI models as "medium risk" for persuasion and bioweapons · the-decoder.com

출시 기사·리뷰·전문가 평가·개발자 커뮤니티 토론을 LUCAS AI News가 읽고 요약했습니다(2026-10-11 기준). 원문 표현은 옮기지 않았으니 자세한 내용은 출처에서 확인하세요.

OpenAI 모델 흐름

120140160202420252026종합 지수(ECI)GPT-6.1 Sol · 166.1 · 2026-09-29GPT-6 Sol · 162.7 · 2026-09-22GPT-6 Luna · 156.3 · 2026-09-22GPT-5.6 Sol · 161.7 · 2026-07-09GPT-5.6 Terra · 159.6 · 2026-07-09GPT-5.6 Luna · 156.4 · 2026-07-09GPT-5.5 Instant · 142.5 · 2026-05-05GPT-5.5 · 159.1 · 2026-04-23GPT-5.4 Mini · 148.8 · 2026-03-17GPT-5.4 Nano · 145.8 · 2026-03-17GPT-5.4 · 156.8 · 2026-03-05GPT-5.2 · 153.5 · 2025-12-11GPT-5.1 · 149.6 · 2025-11-13GPT-5 mini · 145.5 · 2025-08-07GPT-5 nano · 139.4 · 2025-08-07gpt-oss-120b · 139.9 · 2025-08-05gpt-oss-20b · 137.8 · 2025-08-05o4-mini · 145.6 · 2025-04-16GPT-4.1 · 136.8 · 2025-04-14GPT-4.1 mini · 135 · 2025-04-14GPT-4.1 nano · 129.6 · 2025-04-14GPT-4.5 · 136.7 · 2025-02-27o3-mini · 140.3 · 2025-01-31GPT-4o (Nov 2024) · 128.8 · 2024-11-20GPT-4o (Aug 2024) · 128.8 · 2024-08-06GPT-4o mini · 126.6 · 2024-07-18GPT-3.5 Turbo (Jan 2024) · 115.7 · 2024-01-25GPT-3.5 Turbo (Nov 2023) · 118.6 · 2023-11-06GPT-4 (Jun 2023) · 123.1 · 2023-06-13GPT-3.5 Turbo (Jun 2023) · 113.4 · 2023-06-13o1-preview · 134.8 · 2024-09-12GPT-6 Astra · 166.5 · 2026-09-03GPT-5.5 Pro · 162.1 · 2026-04-23GPT-5.4 Pro · 158.9 · 2026-03-05GPT-5.3 Codex · 156.8 · 2026-02-05GPT-5.2 Pro · 155.4 · 2025-12-11GPT-5 Pro · 150.3 · 2025-10-07GPT-5 · 150 · 2025-08-07o3-pro · 147.4 · 2025-06-10o3 · 146.9 · 2025-04-16o1 · 141.9 · 2024-12-17o1-mini · 135.8 · 2024-09-12GPT-4o (May 2024) · 129 · 2024-05-13GPT-4 Turbo (Apr 2024) · 127.3 · 2024-04-09GPT-4 Turbo (Nov 2023) · 126.5 · 2024-01-25GPT-4 (Mar 2023) · 125.9 · 2023-03-14o1-preview
120140160202420252026종합 지수(ECI)GPT-6.1 Sol · 166.1 · 2026-09-29GPT-6 Sol · 162.7 · 2026-09-22GPT-6 Luna · 156.3 · 2026-09-22GPT-5.6 Sol · 161.7 · 2026-07-09GPT-5.6 Terra · 159.6 · 2026-07-09GPT-5.6 Luna · 156.4 · 2026-07-09GPT-5.5 Instant · 142.5 · 2026-05-05GPT-5.5 · 159.1 · 2026-04-23GPT-5.4 Mini · 148.8 · 2026-03-17GPT-5.4 Nano · 145.8 · 2026-03-17GPT-5.4 · 156.8 · 2026-03-05GPT-5.2 · 153.5 · 2025-12-11GPT-5.1 · 149.6 · 2025-11-13GPT-5 mini · 145.5 · 2025-08-07GPT-5 nano · 139.4 · 2025-08-07gpt-oss-120b · 139.9 · 2025-08-05gpt-oss-20b · 137.8 · 2025-08-05o4-mini · 145.6 · 2025-04-16GPT-4.1 · 136.8 · 2025-04-14GPT-4.1 mini · 135 · 2025-04-14GPT-4.1 nano · 129.6 · 2025-04-14GPT-4.5 · 136.7 · 2025-02-27o3-mini · 140.3 · 2025-01-31GPT-4o (Nov 2024) · 128.8 · 2024-11-20GPT-4o (Aug 2024) · 128.8 · 2024-08-06GPT-4o mini · 126.6 · 2024-07-18GPT-3.5 Turbo (Jan 2024) · 115.7 · 2024-01-25GPT-3.5 Turbo (Nov 2023) · 118.6 · 2023-11-06GPT-4 (Jun 2023) · 123.1 · 2023-06-13GPT-3.5 Turbo (Jun 2023) · 113.4 · 2023-06-13o1-preview · 134.8 · 2024-09-12GPT-6 Astra · 166.5 · 2026-09-03GPT-5.5 Pro · 162.1 · 2026-04-23GPT-5.4 Pro · 158.9 · 2026-03-05GPT-5.3 Codex · 156.8 · 2026-02-05GPT-5.2 Pro · 155.4 · 2025-12-11GPT-5 Pro · 150.3 · 2025-10-07GPT-5 · 150 · 2025-08-07o3-pro · 147.4 · 2025-06-10o3 · 146.9 · 2025-04-16o1 · 141.9 · 2024-12-17o1-mini · 135.8 · 2024-09-12GPT-4o (May 2024) · 129 · 2024-05-13GPT-4 Turbo (Apr 2024) · 127.3 · 2024-04-09GPT-4 Turbo (Nov 2023) · 126.5 · 2024-01-25GPT-4 (Mar 2023) · 125.9 · 2023-03-14o1-preview

큰 점이 이 모델입니다. 선은 그때까지의 최고 기록입니다.

독립 벤치마크 점수

  • GPQA Diamond과학50.3%

    94개 모델 중 72위. 대학원 수준의 생물·물리·화학 객관식 문제 198개. 검색으로 답을 찾기 어렵게 만든 문항이다. 오차 ±2.8%.

  • MATH Level 5수학81.7%

    45개 모델 중 21위. MATH 데이터셋에서 가장 어려운 단계. AMC 10·12, AIME 같은 경시대회 문제다. 오차 ±1.1%.

  • OTIS 모의 AIME수학31.1%

    91개 모델 중 67위. OTIS의 경시대회형 수학 문제 45개. MATH Level 5보다 어렵고 FrontierMath보다 쉽다. 오차 ±7%.

세로선은 무작위로 찍었을 때 기대되는 점수입니다. 같은 벤치마크라도 평가 방식과 설정에 따라 점수가 달라지므로 개발사 발표 수치와 다를 수 있습니다.

함께 볼 모델