GPT-4.5
OpenAI 모델 · 2025년 2월 27일 공개. 독립 벤치마크 점수, 종합 지수, 사람 투표 순위와 개발사 발표 점수를 그래프로 정리했습니다.
- 개발
- OpenAI
- 공개일
- 이용 방식
- API 제공
- 학습 연산량
- 3.8×10²⁶ FLOPEpoch AI 추정치
- 종합 능력 지수(ECI)
- 136.7신뢰구간 133.4~138.7
- Arena 점수(사람 투표)
- 1417122위 · 투표 14,547표
주요 반응
GPT-4.5는 글쓰기의 자연스러움과 낮아진 환각률로 일부 호평을 받았다. 그러나 입력 100만 토큰당 75달러라는 가격에 비해 추론·코딩 성능 향상이 뚜렷하지 않아 가성비 비판이 거셌고, 사전학습 확장의 한계를 보여준다는 해석과 함께 API 종료가 발표됐다.
- 비판API 가격이 입력 100만 토큰당 75달러, 출력 150달러로 GPT-4o(2.5·10달러)의 입력 기준 30배였다. 개발자 커뮤니티에서는 터무니없다는 반응이 나왔고, 요약 한 건에 2.11달러가 든 사례도 공유됐다.[1][2]
- 엇갈림안드레이 카파시는 전반적으로 조금씩 좋아졌지만 짚어 말하기 어렵고, 추론 모델이 아니라 수학·코딩은 나아지지 않는다고 평했다. 이선 몰릭은 매우 독특한 모델이며 글은 잘 쓰지만 복잡한 작업에선 의외로 게으르다고 했다.[3]
- 비판게리 마커스는 알맹이가 없는 모델이라며 데이터와 연산을 늘리는 방식이 한계에 부딪혔다고 주장했다. 개발자 커뮤니티에서도 사전학습 확장의 수확 체감을 보여주는 신호로 읽는 의견이 많았다.[4][2]
- 호평OpenAI가 공개한 SimpleQA에서 환각률은 37.1%로 GPT-4o(61.8%)보다 낮았다. Box는 계약서 정보 추출에서 GPT-4o보다 19%p 더 많은 항목을 정확히 뽑았고, 글쓰기와 사용 편의를 높게 보는 사용자도 있었다.[1][3][5]
- 비판코딩 평가에서는 중간 수준이었다. aider 폴리글롯에서 44.9%에 비용 183달러가 들었고, OpenAI는 출시 약 7주 만에 7월 14일자 API 종료를 발표하며 GPT-4.1을 대안으로 권했다.[6][7][5]
반응 출처 7개
- Initial impressions of GPT-4.5 · simonwillison.net
- GPT-4.5 · news.ycombinator.com
- Industry observers say GPT-4.5 is an "odd" model, question its price · venturebeat.com
- Hot take: GPT 4.5 is a nothing burger · garymarcus.substack.com
- GPT-4.5: "Not a frontier model"? · interconnects.ai
- Aider LLM Leaderboards · aider.chat
- OpenAI plans to phase out GPT-4.5, its largest-ever AI model, from its API · techcrunch.com
출시 기사·리뷰·전문가 평가·개발자 커뮤니티 토론을 LUCAS AI News가 읽고 요약했습니다(2026-10-11 기준). 원문 표현은 옮기지 않았으니 자세한 내용은 출처에서 확인하세요.
영역별 강점
같은 시험을 치른 모델 가운데 어디쯤인지(백분위)를 영역별로 평균했습니다. 바깥일수록 상위권이고, 점수가 없는 영역은 가운데 빈 점으로 표시합니다.
OpenAI 모델 흐름
큰 점이 이 모델입니다. 선은 그때까지의 최고 기록입니다.
독립 벤치마크 점수
- GPQA Diamond과학68.7%
94개 모델 중 61위. 대학원 수준의 생물·물리·화학 객관식 문제 198개. 검색으로 답을 찾기 어렵게 만든 문항이다. 오차 ±3.3%.
- MATH Level 5수학78.6%
45개 모델 중 22위. MATH 데이터셋에서 가장 어려운 단계. AMC 10·12, AIME 같은 경시대회 문제다. 오차 ±1.1%.
- OTIS 모의 AIME수학37.8%
91개 모델 중 66위. OTIS의 경시대회형 수학 문제 45개. MATH Level 5보다 어렵고 FrontierMath보다 쉽다. 오차 ±7.3%.
- Aider Polyglot코딩44.9%
29개 모델 중 20위. C++·Go·Java·JavaScript·Python·Rust의 어려운 연습 문제 225개를 코드 편집으로 푸는 시험(두 번째 시도까지 통과율). (Aider 측정)
세로선은 무작위로 찍었을 때 기대되는 점수입니다. 같은 벤치마크라도 평가 방식과 설정에 따라 점수가 달라지므로 개발사 발표 수치와 다를 수 있습니다.
함께 볼 모델
- o3-mini OpenAI · 2025-01-31
- GPT-4.1 OpenAI · 2025-04-14
- Claude 3.7 Sonnet Anthropic · 2025-02-24
Gemini 2.0 Pro Google · 2025-02-05