| 정의 | 대규모 언어 모델이 개발 환경에서 파일을 고치고 명령을 실행하며 작업을 반복하는 소프트웨어 시스템[1] |
|---|---|
| 핵심 구조 | 실행 결과를 다음 입력으로 받는 반복 고리[1] |
| 이전 세대 도구 | GitHub Copilot(2021년 6월 29일 기술 프리뷰)[2] |
| 대표 벤치마크 | SWE-bench(2023년 10월 공개)[3] |
| 대표 제품 | Claude Code, OpenAI Codex, GitHub Copilot 코딩 에이전트, Jules, Devin[4] [5] [6] [7] [8] |
| 구성 요소 | 파일 도구, 셸 접근, 검증 신호, 지침 파일, 권한 모델[1] |
쉽게 말하면, 코딩 에이전트는 AI가 코드 조각을 글로 제안하는 데서 그치지 않고, 개발 환경에서 파일을 고치고 명령을 실행하고 테스트 결과를 읽어 작업을 반복하는 프로그램이다. 핵심은 모델이 쓴 코드가 실제로 실행되고, 그 반응이 다음 입력이 된다는 점이다.[1]
1. 개요
코딩 에이전트는 대규모 언어 모델(large language model)을 써서, 텍스트를 만들어 사람이 복사하게 하는 데 그치지 않고 개발 환경에 직접 작용해 프로그래밍 작업을 수행하는 소프트웨어 시스템이다. 파일을 읽고 고치며, 셸 명령을 실행하고, 테스트를 돌려 출력을 읽는다. 작업이 끝났다고 판단하거나 예산을 다 쓸 때까지 자기 결과를 고친다. 이 구조의 핵심 특징은 반복 고리다. 모델이 쓴 결과가 실제 환경에서 실행되고, 환경의 반응이 모델의 다음 입력이 된다.[1]
이 반복 고리가 이전 세대의 AI 코드 생성 도구와 코딩 에이전트를 가른다. GitHub는 2021년 6월 29일 GitHub Copilot을 기술 프리뷰로 내놓았다. 편집기 안에서 줄과 함수 전체를 제안하는 AI 페어 프로그래머로 소개된 이 제품은 OpenAI Codex에 기반했고, Codex는 GPT-3의 후속 계열로 자연어와 공개 소스 코드로 학습된 모델이다. OpenAI는 Codex를 2021년 8월 10일 API를 통해 비공개 베타로 공개했다.[2][9] 이 시스템들은 몇 줄 뒤를 예측할 뿐 아무것도 실행하지 않았으므로, 제안이 실제로 작동하는지는 알 수 없었다.
에이전트형 접근은 벤치마크에서 출발했다. 2023년 10월 연구진은 실제 GitHub 이슈와 그것을 해결한 풀 리퀘스트에서 가져온 소프트웨어 공학 문제 2,294개 세트인 SWE-bench를 공개했다. 이 문제들은 12개 Python 저장소에 걸쳐 있다. 시스템은 코드베이스와 이슈 본문을 받아, 실패하던 테스트를 통과시키는 패치를 만들어야 한다. 논문의 최고 결과는 Claude 2의 1.96%였다.[3] 이후 2년 안에 같은 과제를 겨냥한 시스템들이 80%에 가까운 해결률을 보고했고, 코딩 에이전트는 AI 에이전트의 가장 눈에 띄는 상용 응용 중 하나가 되었다.[1]
2. 작업 방식
가장 명확하게 공개된 루프 설명은 Microsoft가 2025년 2월 24일 Visual Studio Code 인사이더 빌드에 공개한 Copilot 에이전트 모드에 관한 것이다. 이 설계에서 모델은 관련 문맥과 파일을 스스로 찾고, 코드 편집과 터미널 명령을 함께 제안하며, 편집의 정확성과 명령의 출력을 살펴 문제를 고칠 때까지 반복한다.[10] OpenAI도 2025년 5월 자사 클라우드 에이전트를 비슷한 방식으로 설명했다. 각 작업은 저장소가 미리 올라간 격리된 샌드박스에서 실행되며, 에이전트는 파일을 읽고 고치고 테스트 하네스, 린터, 타입 검사기를 포함한 명령을 실행해 테스트가 통과할 때까지 반복한다.[5]
제품마다 차이가 있지만 도구 사용의 구성 요소는 구현마다 반복해서 나타난다.[1]
| 구성 요소 | 역할 |
|---|---|
| 파일 도구 | 소스 파일을 읽고 검색하고 편집한다. 보통 파일 전체를 다시 쓰기보다 문자열 치환으로 고친다[1] |
| 셸 접근 | 빌드, 테스트, 린터, 포매터, 패키지 관리자를 실행하고 출력을 읽는다[1] |
| 문맥 수집 | 검색, 저장소 지도, 색인 기반 검색으로 작업과 관련된 코드를 찾는다[1] |
| 검증 신호 | 테스트 결과와 컴파일러·린트 오류가 편집이 작동했는지 알려 준다[1] |
| 지침 파일 | AGENTS.md나 CLAUDE.md처럼 빌드 명령과 관례를 담은 저장소 수준 안내 문서[11] |
| 권한 모델 | 어떤 명령을 자동으로 실행하고 어떤 명령에 사람의 승인이 필요한지 정한 규칙[1] |
| 외부 연결 | 모델 컨텍스트 프로토콜(Model Context Protocol) 서버 등 이슈 추적기, 브라우저, 내부 서비스를 노출하는 인터페이스[1] |
테스트 실행이 이 루프를 쓸모 있게 만든다. 실행 가능한 신호가 없으면 에이전트는 추측하는 것이고, 있으면 자기 실패를 찾아낼 수 있다. Cognition이 Devin을 평가한 결과, 통과한 SWE-bench 실행의 72%가 10분 넘게 걸렸다. 회사는 이를 첫 시도의 정확도보다 반복 작업이 성과를 만들었다는 근거로 해석했다.[12]
지침 파일은 대부분의 스택보다 빠르게 공통 형식으로 수렴했다. AGENTS.md는 에이전트용 README를 내세우며, AGENTS.md 측은 6만 개가 넘는 오픈소스 프로젝트가 사용한다고 밝혔다. 지원 도구에는 Codex, Jules, Aider, Devin, Cursor, Gemini CLI, GitHub Copilot 코딩 에이전트, Windsurf, Zed 등이 있다.[11]
3. 하네스와 스캐폴드
보고된 벤치마크 점수는 모델 단독이 아니라 모델과 그것을 감싼 하네스의 결과다. 2024년 SWE-agent 논문은 이 점을 직접 짚었다. 저자들은 언어 모델 에이전트가 고유한 인터페이스 요구를 가진 새로운 종류의 최종 사용자라고 주장했다. 파일 생성, 저장소 탐색, 프로그램 실행을 위해 설계된 에이전트 전용 컴퓨터 인터페이스는 SWE-bench의 pass@1 비율을 12.5%로 끌어올렸고, 이는 비대화형 모델이 달성한 수준보다 훨씬 높았다.[13]
흐름은 이후 단순함 쪽으로 돌아섰다. 같은 프린스턴·스탠퍼드 연구진이 공개한 mini-SWE-agent는 약 100줄 분량의 Python 에이전트 클래스다. bash 외에 도구가 없고, 도구 호출 API에 의존하지 않으며, 메시지 이력이 완전히 선형이다. 모든 동작이 평범한 하위 프로세스 호출로 실행되므로 어떤 샌드박스에든 넣을 수 있고 어떤 모델과도 작동한다. 이 프로젝트는 SWE-bench Verified에서 74%를 넘는 점수를 보고했다.[14] Anthropic은 앞선 릴리스에서 쓰던 계획 도구를 빼고, 모델에 bash 도구와 문자열 치환 방식 파일 편집기 두 가지만 준 스캐폴드로 자체 SWE-bench 결과를 보고했다.[15]
SWE-bench 사이트도 이 생각을 메인 보드에 도입했다. SWE-bench Verified 탭은 이제 고정 하네스 보기가 기본이다. 사이트는 이를 mini-SWE-agent로 모든 모델을 같은 하네스에서 평가하는 방식이라고 설명한다. 데이터 파일에서는 이 보드를 bash 전용 리더보드라고 부르며, 같은 500개 SWE-bench Verified 인스턴스로 채점한다. 스캐폴드를 고정하면 모델을 감싼 엔지니어링이 아니라 기저 모델 자체를 비교하게 된다.[14][16]
4. 주요 시스템
| 시스템 | 개발 주체 | 첫 공개 | 형태 |
|---|---|---|---|
| SWE-agent | SWE-bench를 만든 프린스턴·스탠퍼드 팀 | 2024년 4월 | 오픈소스 연구용 에이전트(MIT)[1] |
| OpenHands | All Hands AI와 커뮤니티 | 2024년 3월, OpenDevin으로 시작 | 오픈소스 플랫폼[17] |
| Devin | Cognition | 2024년 3월 | 호스팅형 자율 에이전트, 이후 에이전트 중심 IDE 제공[8] [18] |
| Aider | Aider-AI 오픈소스 프로젝트 | 2023년 | 터미널 페어 프로그래머(Apache 2.0)[1] |
| Claude Code | Anthropic | 2025년 2월 | 터미널 에이전트, IDE 확장, SDK, 웹[4] |
| Codex CLI와 Codex 클라우드 | OpenAI | 2025년 4월, 5월 | 로컬 CLI(Apache 2.0)와 클라우드 에이전트[19] |
| Copilot 코딩 에이전트 | GitHub | 2025년 5월 | 이슈에 할당하면 GitHub Actions에서 실행되는 에이전트[6] |
| Jules | Google Labs | 2024년 12월 미리보기 | 비동기 클라우드 에이전트[1] |
| Devstral | Mistral AI, All Hands AI 협업 | 2025년 5월 | 공개 가중치 에이전트형 코딩 모델(Apache 2.0)[20] |
| Cline | Cline | 2024년 7월 | 오픈소스 IDE 확장, CLI, SDK[1] |
| Gemini CLI | 2025년 | 오픈소스 터미널 에이전트(Apache 2.0)[1] |
OpenHands는 2024년 3월 OpenDevin으로 출발했고 이후 이름을 바꿨다.[17] 논문은 개발자가 코드를 쓰고 명령줄을 쓰고 웹을 검색하듯 세계와 상호작용하는 에이전트를 위한 플랫폼이라고 설명하며, 라이선스는 MIT다.[21] Cognition은 2024년 3월 12일 Devin을 최초의 AI 소프트웨어 엔지니어로 발표했다.[8] Devin 2.0은 2025년 4월 3일 나왔으며, 병렬 세션, 대화형 계획, 코드베이스 검색, 저장소 위키 자동 생성 기능을 담았고, 20달러부터 시작하는 요금제로 제공되었다.[18]
Cognition은 2025년 7월 14일 에이전트형 IDE인 Windsurf를 인수하는 계약에 서명했다. 이때 연간 반복 매출 8,200만 달러와 350곳이 넘는 기업 고객을 근거로 제시했다.[22]
Claude Code는 2025년 2월 24일 Claude 3.7 Sonnet과 함께 제한된 리서치 프리뷰로 나왔다. Anthropic은 이를 자사 첫 에이전트형 코딩 도구라고 설명했다. 코드를 검색하고 읽고, 파일을 편집하고, 테스트를 작성해 실행하며, 커밋과 푸시를 하고, 명령줄 도구를 쓸 수 있는 능동적인 협업자라는 것이다.[4] 2025년 5월 22일 Claude 4와 함께 일반 제공되었고, GitHub Actions를 통한 백그라운드 실행, VS Code와 JetBrains 확장, SDK가 추가되었다.[15]
Google은 2025년 5월 20일 Jules를 공개 베타로 내놓았다. Jules는 Google Cloud 가상 머신 안에서 Gemini 2.5 Pro를 바탕으로 돌아갔다. 2025년 8월 6일 베타를 벗어났을 때, 개발자들은 베타 기간 동안 공개 공유된 코드 개선을 14만 건 이상 만들어 낸 뒤였다.[7][23] GitHub의 코딩 에이전트는 2025년 5월 19일 발표되었다. 이슈를 할당하면 GitHub Actions에서 가상 머신을 띄우고, 저장소를 복제하고, GitHub 코드 검색 기반 검색으로 코드베이스를 분석한 뒤, 초안 풀 리퀘스트에 커밋을 푸시한다.[6]
공개 가중치 모델도 같은 영역에 들어왔다. Mistral은 2025년 5월 21일 Apache 2.0 라이선스로 Devstral을 공개했다. All Hands AI와 함께 만든 이 모델은 SWE-bench Verified에서 46.8%를 기록했으며, RTX 4090 한 장이나 메모리 32GB의 Mac에서 돌릴 만큼 가볍다고 밝혔다.[20]
5. 벤치마크
SWE-bench는 여러 데이터셋으로 이루어진 계열로 커졌다. 이 계열 전반에서 채점 기준은 해결된 인스턴스의 비율(%)이다.[16]
5.1. SWE-bench 계열
| 데이터셋 | 인스턴스 수 | 내용 |
|---|---|---|
| SWE-bench(전체 테스트) | 2,294 | 12개 Python 저장소, 2023년 원판[3] |
| SWE-bench Lite | 300 | 비용이 덜 드는 평가를 위해 고른 부분집합[16] |
| SWE-bench Verified | 500 | 2024년 8월 SWE-bench 저자들과 함께 OpenAI가 공개한 사람 검수 부분집합[24] |
| SWE-bench Multimodal | 논문 617개, 리더보드 채점 517개 | 이미지를 포함한 JavaScript 이슈, 17개 라이브러리[25] [16] |
| SWE-bench Multilingual | 300 | 9개 프로그래밍 언어 과제[16] |
| SWE-bench Pro | 1,865 | 장기 호흡의 기업 과제, 41개 저장소, 2025년 9월 공개[26] |
지금은 SWE-bench Verified가 기본 인용 대상이다. OpenAI는 Python에 익숙한 소프트웨어 개발자 93명과 함께 원래 테스트 세트에서 무작위로 뽑은 1,699개 인스턴스를 검수했다. 샘플마다 주석자 세 명이 이슈가 충분히 명시되었는지, 통과하는 테스트가 올바른 해결책을 부당하게 탈락시킬 수 있는지 확인했다. 주석자들은 샘플의 38.3%를 문제 설명이 불충분하다고, 61.1%를 올바른 패치를 부당하게 떨어뜨릴 수 있는 테스트가 있다고 표시했다. 전체적으로 샘플의 68.3%가 걸러져 500개가 남았다. 이 세트에서 GPT-4o는 33.2%를 해결했다.[24]
5.2. 리더보드 기록
이 세트의 성적은 가파르게 올랐다. 2025년 1분기에 기록된 최고 성적은 65.4%에서 멈췄고, 2025년 12월에는 선두가 79.2%에 올랐다.[16] 공개 리더보드의 가장 최근 기록은 2026년 2월 26일자이며, 주요 항목은 다음과 같다.[16]
| 항목 | 보드 | 해결률 | 기록일 |
|---|---|---|---|
| live-SWE-agent + Claude 4.5 Opus medium | Verified | 79.2% | 2025년 12월 15일[16] |
| Sonar Foundation Agent + Claude 4.5 Opus | Verified | 79.2% | 2025년 12월 5일[16] |
| mini-SWE-agent + Claude 4.5 Opus(추론 강도 high) | Verified | 76.8% | 2026년 2월 17일[16] |
| mini-SWE-agent + Claude 4.5 Opus medium | Verified | 74.4% | 2025년 11월 24일[16] |
| GLM-5(추론 강도 high) | Bash only | 72.8% | 2026년 2월 17일[16] |
| Devstral small (2512) | Bash only | 56.4% | 2025년 12월 9일[16] |
| Google Jules + Gemini 2.0 Flash | Verified | 52.2% | 2024년 12월 12일[16] |
리더보드는 SWE-bench 팀이 직접 수행하거나 검증한 기록과 제출자가 스스로 보고한 기록을 구분한다. 위 표에서 SWE-bench 팀 검증 표시가 붙은 것은 74.4% mini-SWE-agent 기록이고, 79.2% 두 항목에는 표시가 없다.[16] 비용도 함께 기록되며 적지 않은 규모다. 76.8% mini-SWE-agent 실행은 인스턴스당 약 0.75달러, 500개 세트 전체로는 약 377달러로 보고되었다.[16]
5.3. 기업 자체 보고
기업들은 자체 스캐폴드로 자체 수치를 발표한다. Anthropic은 Claude 3.7 Sonnet이 자사 인프라와 호환되는 489개 인스턴스 부분집합에서 맞춤형 스캐폴드를 쓸 때 SWE-bench Verified 70.3%, 그 스캐폴드 없이는 63.7%를 기록했다고 밝혔다.[4] 이후 Claude Opus 4는 72.5%, Claude Sonnet 4는 72.7%를 기록했다고 밝혔다.[15] OpenAI는 높은 추론 강도의 GPT-5.1-Codex 73.7%, extra-high 추론 강도의 GPT-5.1-Codex-Max 77.9%를 발표했으며, 함께 Terminal-Bench 2.0 58.1%를 공개했다.[27] Claude Opus 4.6은 2026년 2월 5일 공개되었다. Anthropic은 SWE-bench Verified 결과를 25회 시행해 평균을 냈고, 프롬프트를 수정하면 81.42%가 나온다고 덧붙였다.[28]
5.4. 다른 벤치마크
다른 벤치마크는 SWE-bench가 비워 둔 영역을 채운다. Aider의 다언어 코딩 벤치마크는 C++, Go, Java, JavaScript, Python, Rust에 걸친 Exercism 연습문제 225개를 쓰며, 문제 해결뿐 아니라 모델이 편집을 올바른 형식으로 적용하는지도 잰다. 목록에서 가장 높은 항목은 GPT-5가 높은 추론 강도로 정답률 88.0%를 기록한 것으로, 2025년 8월에 기록되었다.[29] Terminal-Bench는 스탠퍼드 대학과 Laude Institute의 협업으로, 터미널 능력을 직접 시험한다. 1.0 버전은 80개, 2.0 버전은 소프트웨어 공학, 머신러닝, 보안, 데이터 과학에 걸친 89개 과제로 구성된다.[30] 두 벤치마크는 HumanEval 같은 기존 함수 단위 벤치마크가 다루지 않은 영역을 잰다. 기존 벤치마크는 독립된 함수 하나를 쓰게 할 뿐, 기계를 조작하게 하지 않기 때문이다.
6. 한계와 비판
6.1. 벤치마크 타당성
가장 실질적인 비판은 벤치마크 타당성이다. 2024년 10월 발표된 실증 감사는 GPT-4를 쓴 SWE-agent가 해결한 인스턴스를 수작업으로 검토했다. 그 결과 성공한 패치의 32.67%가 이슈 본문이나 댓글에 직접 제시된 해결책을 담고 있었다. 통과한 패치의 31.08%는 테스트가 정확성을 검증하기에 너무 약해 의심스러웠다. 두 범주를 걸러 내자 같은 시스템의 해결률은 12.47%에서 3.97%로 떨어졌다.[31]
감사 저자들은 이슈의 94% 이상이 모델의 지식 차단 시점 이전에 작성되었다고 관찰하고 데이터 오염 우려를 제기했다. 같은 결함이 SWE-bench Lite와 SWE-bench Verified에도 있다고 보고했다.[31]
널리 인용되는 수치는 조건이 빠진 채 전달되기도 한다. Devin의 널리 인용된 13.86%는 테스트 세트의 무작위 25%, 즉 2,294개 중 570개 인스턴스에서 측정되었고, 그중 79개를 해결했다. 실행마다 45분 제한이 있었다. 비교 대상이었던 1.96% 기준선은 모델이 아니라 검색 시스템이 수정할 파일을 고른 다른 설정에서 나온 값이다.[12]
6.2. 실제 생산성
벤치마크 향상이 소프트웨어 개발 속도로 이어지는지는 별개의 질문이다. METR은 2025년 7월 10일 공개한 무작위 대조 실험에서, 자신이 관리하는 실제 저장소의 실제 이슈 246개를 숙련된 오픈소스 개발자 16명에게 맡겼다. AI 도구 사용이 허용된 개발자들은 주로 Cursor Pro에서 Claude 3.5와 3.7 Sonnet을 썼고, 사용하지 않을 때보다 19% 더 오래 걸렸다. 개발자들은 사전에 24% 빨라질 것으로 예상했고, 끝난 뒤에도 20% 빨라졌다고 믿었다.[32]
METR은 이 결과의 신뢰구간을 +2%에서 +39%로 나중에 제시했다.[33] 2026년 2월 후속 조사에서 METR은 실험의 2차 라운드가 파행을 겪었다고 보고했다. AI 없이 일하기 싫다는 이유로 참여를 거부하는 개발자가 늘었고, 설문 참가자의 30~50%가 같은 이유로 과제를 빼 놓았다고 답했다. 원래 연구에 돌아온 개발자 10명에 대해 METR은 -18%의 시간 변화(빨라짐)를 추정했고, 신뢰구간은 -38%에서 +9%였다. 새로 모집한 개발자의 추정치는 -4%였다. METR은 두 결과 모두 매우 약한 근거일 뿐이라고 보고 실험을 다시 설계하고 있다.[33]
6.3. 실무의 한계
일상 사용에서도 반복되는 반론이 있다. 검토 부담은 사라지지 않고 옮겨 갈 뿐이며, 사람이 직접 쓰지 않은 패치를 여전히 읽어야 한다. 에이전트는 근본 결함을 고치지 않고도 테스트를 통과시킬 수 있는데, 이는 보상 해킹의 한 형태다. 긴 세션은 많은 토큰을 소비하며, 리더보드는 위에서 본 인스턴스당 비용처럼 그 청구액을 명시적으로 추적한다.[16]
검토를 덜 하는 방식에는 이미 이름이 붙었다. 안드레이 카파시(Andrej Karpathy)는 2025년 2월, 모델에 프롬프트를 주고 철저한 검토 없이 결과를 받아들이는 방식을 바이브 코딩이라고 명명했다.[34] 콜린스(Collins)는 이 말을 2025년의 올해의 단어로 선정했다.[35]
7. 보안
셸 접근과 저장소 자격 증명을 언어 모델에 주면 자동 완성 도구에는 없던 공격 면이 생긴다. 가장 큰 우려는 프롬프트 인젝션이다. 이슈 본문, 웹 페이지, 의존성 파일, 도구 출력을 읽는 에이전트는 그 내용을 쓴 사람이 건넨 지시를 따를 수 있다.[1]
벤더들은 비슷한 통제 장치로 수렴했다. Claude Code는 읽기 전용을 기본값으로 하는 권한 기반 구조를 문서화했다. 시스템을 바꿀 수 있는 Bash 명령 앞에는 승인 요청이 뜨고, 작업 디렉터리 경계가 있으며, 파일 시스템과 네트워크가 격리된 샌드박스 bash 도구를 쓴다. 웹 가져오기는 격리된 컨텍스트 창에서 처리해 가져온 내용이 지시를 직접 주입하지 못하게 한다. curl과 wget 같은 네트워크 명령은 자동 승인에서 제외된다.[36]
GitHub의 코딩 에이전트는 자신이 만든 브랜치에만 푸시할 수 있고, 인터넷 접근은 사용자가 바꿀 수 있는 허용 목록으로 제한되며, 사람의 승인 없이는 Actions 워크플로를 실행할 수 없다. 풀 리퀘스트를 열어 달라고 요청한 개발자가 그것을 승인하는 사람이 될 수는 없다.[6]
이 위험은 가상이 아니다. 2025년 8월 26일 공격자는 GitHub Actions의 주입 결함을 악용해 Nx 프로젝트의 npm 배포 토큰을 훔쳤고, 약 4시간 동안 악성 패키지 버전을 배포했다. Nx는 2025년 9월 5일 사후 보고서에서, 악성 설치 후 스크립트가 민감한 정보를 수집하고 Claude와 Gemini 같은 로컬 AI 도구를 이용하려 했으며, 결과를 GitHub CLI로 공개 저장소에 올렸다고 적었다.[37]
이미 인증되어 있고 파일 시스템을 읽을 권한까지 갖춘 설치형 코딩 에이전트는, 기기에 접근한 공격자에게 쓸모 있는 도구가 된다.[1]
8. 2025~2026년 동향
8.1. 패키징 변화
세 가지 변화가 두드러진다. 첫째는 패키징이다. 같은 루프가 이제 터미널 프로그램, IDE 확장, 풀 리퀘스트를 여는 클라우드 서비스, 코드 리뷰어로 제공되며, 선두 벤더들은 이것들을 한꺼번에 내놓는다. 2025년 9월까지 OpenAI는 Codex를 터미널, IDE, 웹, GitHub, ChatGPT iOS 앱에 걸친 하나의 제품으로 통합했다. 이와 함께 에이전트형 코딩에 맞춘 GPT-5 버전인 GPT-5-Codex를 출시했다.[19]
GPT-5.2-Codex는 2025년 12월 18일, GPT-5.3-Codex는 2026년 2월 5일 나왔다. 후자는 Terminal-Bench 2.0에서 77.3%, 공개 SWE-bench Pro 세트에서 56.8%를 보고했다.[38][39][1]
8.2. 평가 기준의 이동
프런티어 시스템들이 SWE-bench Verified에서 80%에 가까이 몰리자[16] 관심은 더 어렵고 오염이 적은 세트로 옮겨 갔다. SWE-bench Pro, Terminal-Bench 2.0, 다국어 및 멀티모달 변형이 그 예다. Anthropic은 Claude Opus 4.5가 SWE-bench Multilingual에서 측정한 8개 프로그래밍 언어 중 7개에서 선두였다고 밝혔다.[40] 2025년 4월 공개된 Multi-SWE-bench는 같은 아이디어를 Java, TypeScript, JavaScript, Go, Rust, C, C++로 확장한다.[1]
8.3. 공개 가중치 모델의 격차
셋째로, 공개 가중치 모델도 격차를 일부 좁혔다. 스캐폴드를 고정한 bash 전용 보드에서 리더보드가 공개 가중치 모델로 표시한 최고 항목은 Kimi K2 Thinking의 63.4%다. 그다음은 MiniMax M2 61.0%, DeepSeek V3.2 Reasoner 60.0%, Devstral small 56.4%다. 전체 최고 기록은 76.8%다.[16] Devstral은 Apache 2.0 라이선스이며 단일 소비자용 GPU에 들어갈 만큼 작다.[20] 이는 독점 코드를 호스팅 API로 보낼 수 없는 팀에게 중요하다.
8.4. 미해결 질문
두 가지 질문은 아직 풀리지 않았다. 벤더들은 내부에서 큰 성과를 보고한다. OpenAI는 엔지니어의 95%가 주간 단위로 Codex를 쓰며, 도입 이후 이 엔지니어들이 풀 리퀘스트를 약 70% 더 많이 낸다고 밝혔다.[27] 반면 가장 좋은 독립적 현장 측정도 실제 속도 향상과 도입 자체가 만드는 선택 편향을 깔끔하게 구분하지 못한다.[33]
리뷰 병목도 움직이지 않았다. 에이전트가 풀 리퀘스트를 아무리 많이 열어도, 각각을 병합할 책임을 지겠다는 사람이 여전히 필요하다.[1]
각주·출처 40개
- ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12 ↩13 ↩14 ↩15 ↩16 ↩17 ↩18 ↩19 ↩20 ↩21 ↩22 ↩23 AI Wiki: Coding agent (2026-07-24 수정본) · CC BY 4.0 · 확인 2026-10-11
- ↩1 ↩2 Introducing GitHub Copilot: your AI pair programmer · 확인 2026-10-11
- ↩1 ↩2 ↩3 SWE-bench: Can Language Models Resolve Real-World GitHub Issues? · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 Claude 3.7 Sonnet and Claude Code · 확인 2026-10-11
- ↩1 ↩2 Introducing Codex · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 GitHub Copilot: Meet the new coding agent · 확인 2026-10-11
- ↩1 ↩2 Build with Jules, your asynchronous coding agent · 확인 2026-10-11
- ↩1 ↩2 ↩3 Introducing Devin, the first AI software engineer · 확인 2026-10-11
- ↩1 OpenAI Codex · 확인 2026-10-11
- ↩1 Introducing GitHub Copilot agent mode (preview · 확인 2026-10-11
- ↩1 ↩2 AGENTS.md project site · 확인 2026-10-11
- ↩1 ↩2 SWE-bench technical report · 확인 2026-10-11
- ↩1 SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering · 확인 2026-10-11
- ↩1 ↩2 mini-SWE-agent repository README, SWE-agent organization · 확인 2026-10-11
- ↩1 ↩2 ↩3 Introducing Claude 4 · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12 ↩13 ↩14 ↩15 ↩16 ↩17 ↩18 ↩19 SWE-bench leaderboards, swebench.com; underlying data file data/leaderboards.json in the site repository. and · 확인 2026-10-11
- ↩1 ↩2 OpenHands repository (created March 2024 as OpenDevin · 확인 2026-10-11
- ↩1 ↩2 Devin 2.0 · 확인 2026-10-11
- ↩1 ↩2 Introducing upgrades to Codex · 확인 2026-10-11
- ↩1 ↩2 ↩3 Devstral · 확인 2026-10-11
- ↩1 OpenHands: An Open Platform for AI Software Developers as Generalist Agents · 확인 2026-10-11
- ↩1 Cognition's acquisition of Windsurf · 확인 2026-10-11
- ↩1 Jules, our asynchronous coding agent, is now available for everyone · 확인 2026-10-11
- ↩1 ↩2 Introducing SWE-bench Verified · 확인 2026-10-11
- ↩1 SWE-bench Multimodal: Do AI Systems Generalize to Visual Software Domains? · 확인 2026-10-11
- ↩1 SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks? · 확인 2026-10-11
- ↩1 ↩2 Building more with GPT-5.1-Codex-Max · 확인 2026-10-11
- ↩1 Introducing Claude Opus 4.6 · 확인 2026-10-11
- ↩1 Aider LLM Leaderboards, polyglot coding benchmark · 확인 2026-10-11
- ↩1 Terminal-Bench, Stanford and Laude Institute · 확인 2026-10-11
- ↩1 ↩2 SWE-Bench+: Enhanced Coding Benchmark for LLMs · 확인 2026-10-11
- ↩1 Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity · 확인 2026-10-11
- ↩1 ↩2 ↩3 We are Changing our Developer Productivity Experiment Design · 확인 2026-10-11
- ↩1 Vibe coding · 확인 2026-10-11
- ↩1 The Collins Word of the Year 2025 (AI Wiki 인용) · 확인 2026-10-11
- ↩1 Security · 확인 2026-10-11
- ↩1 S1ngularity: What Happened, How We Responded, What We Learned · 확인 2026-10-11
- ↩1 Introducing GPT-5.2-Codex · 확인 2026-10-11
- ↩1 Introducing GPT-5.3-Codex · 확인 2026-10-11
- ↩1 Introducing Claude Opus 4.5 · 확인 2026-10-11