AI 모델 · OpenAI
o1-preview
OpenAI 모델 · 2024년 9월 12일 공개. 독립 벤치마크 점수, 종합 지수, 사람 투표 순위와 개발사 발표 점수를 그래프로 정리했습니다.
- 개발
- OpenAI
- 공개일
- 이용 방식
- API 제공
- 종합 능력 지수(ECI)
- 134.8신뢰구간 130.8~138.7
- Arena 점수(사람 투표)
- 1353203위 · 투표 31,122표
주요 반응
o1-preview는 수학·코딩·계획 수립처럼 단계적 추론이 필요한 과제에서 한 단계 도약했다는 평가를 받았다. 반면 응답이 느리고 비용이 높으며 추론 과정이 숨겨진다는 불만이 컸고, 글쓰기는 나아지지 않았으며 코딩 벤치마크에서도 Claude 3.5 Sonnet과 접전이었다.
- 엇갈림이선 몰릭은 o1-preview가 복잡한 계획 수립 과제에서 큰 도약이라고 평했다. 다만 글쓰기는 나아지지 않았고 어려운 십자말풀이에서 지나치게 문자 그대로 해석하며 환각도 보였다고 지적했다.[1]
- 비판추론 토큰이 API에서 숨겨진 채 출력 토큰으로 과금되는 점에 불만이 컸다. API는 티어5 계정에만 열렸고 시스템 프롬프트·스트리밍·도구 사용이 지원되지 않았으며, 벤치마크 그래프가 소요 시간을 가린다는 회의도 나왔다.[2][3]
- 엇갈림aider 코드 편집 벤치마크에서 o1-preview는 whole 형식 79.7%로 당시 최고였지만, 실사용에 가까운 diff 형식은 75.2%로 Claude 3.5 Sonnet(77.4%)에 못 미쳤고 비용은 훨씬 컸다.[4]
- 호평헬스케어 기업 Oscar Health는 보험 청구 산정, 임상 지침 적용 등 추론 위주 업무에서 GPT-4o보다 낫다는 초기 관찰을 공개했다. 다만 소수 사례에 근거한 정성적 관찰이며 지침이 여전히 필요하다고 밝혔다.[5]
- 엇갈림OpenAI는 시스템 카드에서 o1 계열을 생물 위협 계획 지원과 설득력 항목에서 중간 위험으로 평가했다. 환각은 GPT-4o보다 줄었지만 결과가 확정적이진 않다고 밝혔다.[6]
반응 출처 6개
- Something New: On OpenAI's "Strawberry" and Reasoning · oneusefulthing.org
- Notes on OpenAI’s new o1 chain-of-thought models · simonwillison.net
- Learning to Reason with LLMs · news.ycombinator.com
- o1-preview is SOTA on the aider leaderboard · aider.chat
- Oscar Health’s early observations on OpenAI o1-preview · hioscar.ai
- OpenAI classifies o1 AI models as "medium risk" for persuasion and bioweapons · the-decoder.com
출시 기사·리뷰·전문가 평가·개발자 커뮤니티 토론을 LUCAS AI News가 읽고 요약했습니다(2026-10-11 기준). 원문 표현은 옮기지 않았으니 자세한 내용은 출처에서 확인하세요.
OpenAI 모델 흐름
큰 점이 이 모델입니다. 선은 그때까지의 최고 기록입니다.
독립 벤치마크 점수
- GPQA Diamond과학50.3%
94개 모델 중 72위. 대학원 수준의 생물·물리·화학 객관식 문제 198개. 검색으로 답을 찾기 어렵게 만든 문항이다. 오차 ±2.8%.
- MATH Level 5수학81.7%
45개 모델 중 21위. MATH 데이터셋에서 가장 어려운 단계. AMC 10·12, AIME 같은 경시대회 문제다. 오차 ±1.1%.
- OTIS 모의 AIME수학31.1%
91개 모델 중 67위. OTIS의 경시대회형 수학 문제 45개. MATH Level 5보다 어렵고 FrontierMath보다 쉽다. 오차 ±7%.
세로선은 무작위로 찍었을 때 기대되는 점수입니다. 같은 벤치마크라도 평가 방식과 설정에 따라 점수가 달라지므로 개발사 발표 수치와 다를 수 있습니다.
함께 볼 모델
- o1-mini OpenAI · 2024-09-12
- GPT-4o (Aug 2024) OpenAI · 2024-08-06
Gemini 1.5 Pro (Sept 2024) Google · 2024-09-24
Gemini 1.5 Flash (Sep 2024) Google · 2024-09-24