AI의 변화, 근거와 맥락까지.AI NEWS & CONTEXT
OpenAI모델 발표

GPT‑6.1 Sol, Work와 Codex에 합류…실무 성능 개선에 초점

Plus·Pro 등 유료 사용자의 ChatGPT Work와 Codex에서 제공된다.

이 기사에서 읽을 내용
글자 크기

먼저 읽는 핵심 포인트

  • Plus·Pro 등 유료 사용자의 ChatGPT Work와 Codex에서 제공된다.
  • 일반 Chat 제공과는 구분해야 한다.
  • 벤치마크는 OpenAI의 자체 발표 수치다.
독자 안내 · 개발자 · 일반 사용자

왜 중요한가

편집부 해석: 구독으로 Codex를 쓰는 독자라면 자신의 프로젝트에서 기존 모델과 결과를 비교할 만하다.

편집부 제안 · 변화 확인

평소 쓰는 작업으로 결과를 확인하되, 자체 평가 수치를 모든 사용 환경의 성능으로 일반화하지 마세요.

무슨 일이 있었나

GPT‑6.1 Sol은 코드 작성·수정, 문서 이해, 여러 단계의 업무 수행을 겨냥한 업데이트다. OpenAI는 일부 평가에서 Astra에 근접했다고 설명했다.

출처상 확인
모델

GPT-6.1 Sol

OpenAI · GPT-6.1 Sol

텍스트 작업

비공개 · 라이선스: 미확인

숫자와 함께 읽어야 할 조건

직접 비교 불가 · 참고 수치

사실 오류가 포함된 응답 비율

OpenAI factuality evaluation

이전 오류 신고 대화에서 오류가 하나 이상 포함된 응답 비율.

회사 발표의 참고 수치. 정확한 평가 버전·표본 수·전체 실행 조건 미확인.

표를 좌우로 밀면 평가 주체와 전체 수치를 볼 수 있습니다.

오류 포함 응답 · ↓ 낮을수록 좋은 지표
평가 대상보고 수치평가 주체
GPT-6 SolGPT-6 Sol11.4 %구간 미제공회사 발표 수치OpenAI · 출처상 확인
GPT-6.1 SolGPT-6.1 Sol7.7 %구간 미제공회사 발표 수치OpenAI · 출처상 확인
이 수치로 알 수 없는 것
  • 일반 사용을 대표하지 않는 고난도 프롬프트다.
  • 전체 평가 설정이 확인되지 않아 직접 비교 막대를 표시하지 않는다.
평가 조건과 출처 확인

GPT-6 Sol

기반 모델: 해당 없음 또는 미확인
평가 시각: 미확인

시험 버전
미확인
평가 세트
미확인
평가 코드
미확인
에이전트 구성
미확인
점수 산정
미확인
평가 예산·시간 제한
미확인
사용 도구
미확인
예시 개수
미확인
문제당 시도
미확인
추론 설정
low
샘플링
미확인
시스템 프롬프트
미확인
입력 조건
미확인
평가 표본 수
미확인
하드웨어
미확인
수치 정밀도
미확인
동시 요청 수
미확인
심판 모델
미확인

GPT-6.1 Sol

기반 모델: 해당 없음 또는 미확인
평가 시각: 미확인

시험 버전
미확인
평가 세트
미확인
평가 코드
미확인
에이전트 구성
미확인
점수 산정
미확인
평가 예산·시간 제한
미확인
사용 도구
미확인
예시 개수
미확인
문제당 시도
미확인
추론 설정
low
샘플링
미확인
시스템 프롬프트
미확인
입력 조건
미확인
평가 표본 수
미확인
하드웨어
미확인
수치 정밀도
미확인
동시 요청 수
미확인
심판 모델
미확인

확인된 정보와 남은 질문

출처상 확인된 내용

  • GPT‑6.1 Sol은 코드 작성·수정, 문서 이해, 여러 단계의 업무 수행을 겨냥한 업데이트다. OpenAI는 일부 평가에서 Astra에 근접했다고 설명했다.
  • 영문 발표는 낮은 추론 강도의 사실 오류 포함 응답 비율을 GPT-6 Sol 11.4%, GPT-6.1 Sol 7.7%로 제시했다.

확인이 더 필요한 내용

  • 한국어 실무 성능과 전체 평가 조건을 독립 검증하지 않았다. 공식 발표일의 정확한 시각은 확인하지 못했다.

출처와 확인 범위

  1. OpenAI

RELATED STORYGPT Sol 모델의 변화 ↗

1개의 기록으로 이전 맥락까지 읽기

함께 읽을 기사

독자의 생각

직접 써 본 경험과 다른 관점을 나눠 주세요. 주장에는 근거를, 서로에게는 존중을 부탁드립니다.

독자 의견을 불러오고 있습니다.