AI의 변화, 근거와 맥락까지.AI NEWS & CONTEXT
AI 사전 · 에이전트와 개발

코딩 에이전트

코딩 에이전트는 대규모 언어 모델이 개발 환경에서 파일을 읽고 고치며 명령을 실행하고, 그 결과를 보고 작업을 반복하는 소프트웨어 시스템이다. 코드 조각을 텍스트로 제안하는 기존 도구와 달리 실행 결과를 다음 입력으로 받는 반복 고리가 핵심 특징이다. 2021년 GitHub Copilot 이후 여러 상용 제품으로 확산되었고, SWE-bench 같은 벤치마크로 성능을 비교한다.

코딩 에이전트
정의대규모 언어 모델이 개발 환경에서 파일을 고치고 명령을 실행하며 작업을 반복하는 소프트웨어 시스템[1]
핵심 구조실행 결과를 다음 입력으로 받는 반복 고리[1]
이전 세대 도구GitHub Copilot(2021년 6월 29일 기술 프리뷰)[2]
대표 벤치마크SWE-bench(2023년 10월 공개)[3]
대표 제품Claude Code, OpenAI Codex, GitHub Copilot 코딩 에이전트, Jules, Devin[4] [5] [6] [7] [8]
구성 요소파일 도구, 셸 접근, 검증 신호, 지침 파일, 권한 모델[1]

쉽게 말하면, 코딩 에이전트는 AI가 코드 조각을 글로 제안하는 데서 그치지 않고, 개발 환경에서 파일을 고치고 명령을 실행하고 테스트 결과를 읽어 작업을 반복하는 프로그램이다. 핵심은 모델이 쓴 코드가 실제로 실행되고, 그 반응이 다음 입력이 된다는 점이다.[1]

1. 개요

코딩 에이전트는 대규모 언어 모델(large language model)을 써서, 텍스트를 만들어 사람이 복사하게 하는 데 그치지 않고 개발 환경에 직접 작용해 프로그래밍 작업을 수행하는 소프트웨어 시스템이다. 파일을 읽고 고치며, 셸 명령을 실행하고, 테스트를 돌려 출력을 읽는다. 작업이 끝났다고 판단하거나 예산을 다 쓸 때까지 자기 결과를 고친다. 이 구조의 핵심 특징은 반복 고리다. 모델이 쓴 결과가 실제 환경에서 실행되고, 환경의 반응이 모델의 다음 입력이 된다.[1]

이 반복 고리가 이전 세대의 AI 코드 생성 도구와 코딩 에이전트를 가른다. GitHub는 2021년 6월 29일 GitHub Copilot을 기술 프리뷰로 내놓았다. 편집기 안에서 줄과 함수 전체를 제안하는 AI 페어 프로그래머로 소개된 이 제품은 OpenAI Codex에 기반했고, Codex는 GPT-3의 후속 계열로 자연어와 공개 소스 코드로 학습된 모델이다. OpenAI는 Codex를 2021년 8월 10일 API를 통해 비공개 베타로 공개했다.[2][9] 이 시스템들은 몇 줄 뒤를 예측할 뿐 아무것도 실행하지 않았으므로, 제안이 실제로 작동하는지는 알 수 없었다.

에이전트형 접근은 벤치마크에서 출발했다. 2023년 10월 연구진은 실제 GitHub 이슈와 그것을 해결한 풀 리퀘스트에서 가져온 소프트웨어 공학 문제 2,294개 세트인 SWE-bench를 공개했다. 이 문제들은 12개 Python 저장소에 걸쳐 있다. 시스템은 코드베이스와 이슈 본문을 받아, 실패하던 테스트를 통과시키는 패치를 만들어야 한다. 논문의 최고 결과는 Claude 2의 1.96%였다.[3] 이후 2년 안에 같은 과제를 겨냥한 시스템들이 80%에 가까운 해결률을 보고했고, 코딩 에이전트는 AI 에이전트의 가장 눈에 띄는 상용 응용 중 하나가 되었다.[1]

2. 작업 방식

가장 명확하게 공개된 루프 설명은 Microsoft가 2025년 2월 24일 Visual Studio Code 인사이더 빌드에 공개한 Copilot 에이전트 모드에 관한 것이다. 이 설계에서 모델은 관련 문맥과 파일을 스스로 찾고, 코드 편집과 터미널 명령을 함께 제안하며, 편집의 정확성과 명령의 출력을 살펴 문제를 고칠 때까지 반복한다.[10] OpenAI도 2025년 5월 자사 클라우드 에이전트를 비슷한 방식으로 설명했다. 각 작업은 저장소가 미리 올라간 격리된 샌드박스에서 실행되며, 에이전트는 파일을 읽고 고치고 테스트 하네스, 린터, 타입 검사기를 포함한 명령을 실행해 테스트가 통과할 때까지 반복한다.[5]

제품마다 차이가 있지만 도구 사용의 구성 요소는 구현마다 반복해서 나타난다.[1]

코딩 에이전트의 구성 요소
구성 요소역할
파일 도구소스 파일을 읽고 검색하고 편집한다. 보통 파일 전체를 다시 쓰기보다 문자열 치환으로 고친다[1]
셸 접근빌드, 테스트, 린터, 포매터, 패키지 관리자를 실행하고 출력을 읽는다[1]
문맥 수집검색, 저장소 지도, 색인 기반 검색으로 작업과 관련된 코드를 찾는다[1]
검증 신호테스트 결과와 컴파일러·린트 오류가 편집이 작동했는지 알려 준다[1]
지침 파일AGENTS.md나 CLAUDE.md처럼 빌드 명령과 관례를 담은 저장소 수준 안내 문서[11]
권한 모델어떤 명령을 자동으로 실행하고 어떤 명령에 사람의 승인이 필요한지 정한 규칙[1]
외부 연결모델 컨텍스트 프로토콜(Model Context Protocol) 서버 등 이슈 추적기, 브라우저, 내부 서비스를 노출하는 인터페이스[1]

테스트 실행이 이 루프를 쓸모 있게 만든다. 실행 가능한 신호가 없으면 에이전트는 추측하는 것이고, 있으면 자기 실패를 찾아낼 수 있다. Cognition이 Devin을 평가한 결과, 통과한 SWE-bench 실행의 72%가 10분 넘게 걸렸다. 회사는 이를 첫 시도의 정확도보다 반복 작업이 성과를 만들었다는 근거로 해석했다.[12]

지침 파일은 대부분의 스택보다 빠르게 공통 형식으로 수렴했다. AGENTS.md는 에이전트용 README를 내세우며, AGENTS.md 측은 6만 개가 넘는 오픈소스 프로젝트가 사용한다고 밝혔다. 지원 도구에는 Codex, Jules, Aider, Devin, Cursor, Gemini CLI, GitHub Copilot 코딩 에이전트, Windsurf, Zed 등이 있다.[11]

3. 하네스와 스캐폴드

보고된 벤치마크 점수는 모델 단독이 아니라 모델과 그것을 감싼 하네스의 결과다. 2024년 SWE-agent 논문은 이 점을 직접 짚었다. 저자들은 언어 모델 에이전트가 고유한 인터페이스 요구를 가진 새로운 종류의 최종 사용자라고 주장했다. 파일 생성, 저장소 탐색, 프로그램 실행을 위해 설계된 에이전트 전용 컴퓨터 인터페이스는 SWE-bench의 pass@1 비율을 12.5%로 끌어올렸고, 이는 비대화형 모델이 달성한 수준보다 훨씬 높았다.[13]

흐름은 이후 단순함 쪽으로 돌아섰다. 같은 프린스턴·스탠퍼드 연구진이 공개한 mini-SWE-agent는 약 100줄 분량의 Python 에이전트 클래스다. bash 외에 도구가 없고, 도구 호출 API에 의존하지 않으며, 메시지 이력이 완전히 선형이다. 모든 동작이 평범한 하위 프로세스 호출로 실행되므로 어떤 샌드박스에든 넣을 수 있고 어떤 모델과도 작동한다. 이 프로젝트는 SWE-bench Verified에서 74%를 넘는 점수를 보고했다.[14] Anthropic은 앞선 릴리스에서 쓰던 계획 도구를 빼고, 모델에 bash 도구와 문자열 치환 방식 파일 편집기 두 가지만 준 스캐폴드로 자체 SWE-bench 결과를 보고했다.[15]

SWE-bench 사이트도 이 생각을 메인 보드에 도입했다. SWE-bench Verified 탭은 이제 고정 하네스 보기가 기본이다. 사이트는 이를 mini-SWE-agent로 모든 모델을 같은 하네스에서 평가하는 방식이라고 설명한다. 데이터 파일에서는 이 보드를 bash 전용 리더보드라고 부르며, 같은 500개 SWE-bench Verified 인스턴스로 채점한다. 스캐폴드를 고정하면 모델을 감싼 엔지니어링이 아니라 기저 모델 자체를 비교하게 된다.[14][16]

4. 주요 시스템

주요 코딩 에이전트 목록
시스템개발 주체첫 공개형태
SWE-agentSWE-bench를 만든 프린스턴·스탠퍼드 팀2024년 4월오픈소스 연구용 에이전트(MIT)[1]
OpenHandsAll Hands AI와 커뮤니티2024년 3월, OpenDevin으로 시작오픈소스 플랫폼[17]
DevinCognition2024년 3월호스팅형 자율 에이전트, 이후 에이전트 중심 IDE 제공[8] [18]
AiderAider-AI 오픈소스 프로젝트2023년터미널 페어 프로그래머(Apache 2.0)[1]
Claude CodeAnthropic2025년 2월터미널 에이전트, IDE 확장, SDK, 웹[4]
Codex CLI와 Codex 클라우드OpenAI2025년 4월, 5월로컬 CLI(Apache 2.0)와 클라우드 에이전트[19]
Copilot 코딩 에이전트GitHub2025년 5월이슈에 할당하면 GitHub Actions에서 실행되는 에이전트[6]
JulesGoogle Labs2024년 12월 미리보기비동기 클라우드 에이전트[1]
DevstralMistral AI, All Hands AI 협업2025년 5월공개 가중치 에이전트형 코딩 모델(Apache 2.0)[20]
ClineCline2024년 7월오픈소스 IDE 확장, CLI, SDK[1]
Gemini CLIGoogle2025년오픈소스 터미널 에이전트(Apache 2.0)[1]

OpenHands는 2024년 3월 OpenDevin으로 출발했고 이후 이름을 바꿨다.[17] 논문은 개발자가 코드를 쓰고 명령줄을 쓰고 웹을 검색하듯 세계와 상호작용하는 에이전트를 위한 플랫폼이라고 설명하며, 라이선스는 MIT다.[21] Cognition은 2024년 3월 12일 Devin을 최초의 AI 소프트웨어 엔지니어로 발표했다.[8] Devin 2.0은 2025년 4월 3일 나왔으며, 병렬 세션, 대화형 계획, 코드베이스 검색, 저장소 위키 자동 생성 기능을 담았고, 20달러부터 시작하는 요금제로 제공되었다.[18]

Cognition은 2025년 7월 14일 에이전트형 IDE인 Windsurf를 인수하는 계약에 서명했다. 이때 연간 반복 매출 8,200만 달러와 350곳이 넘는 기업 고객을 근거로 제시했다.[22]

Claude Code는 2025년 2월 24일 Claude 3.7 Sonnet과 함께 제한된 리서치 프리뷰로 나왔다. Anthropic은 이를 자사 첫 에이전트형 코딩 도구라고 설명했다. 코드를 검색하고 읽고, 파일을 편집하고, 테스트를 작성해 실행하며, 커밋과 푸시를 하고, 명령줄 도구를 쓸 수 있는 능동적인 협업자라는 것이다.[4] 2025년 5월 22일 Claude 4와 함께 일반 제공되었고, GitHub Actions를 통한 백그라운드 실행, VS Code와 JetBrains 확장, SDK가 추가되었다.[15]

Google은 2025년 5월 20일 Jules를 공개 베타로 내놓았다. Jules는 Google Cloud 가상 머신 안에서 Gemini 2.5 Pro를 바탕으로 돌아갔다. 2025년 8월 6일 베타를 벗어났을 때, 개발자들은 베타 기간 동안 공개 공유된 코드 개선을 14만 건 이상 만들어 낸 뒤였다.[7][23] GitHub의 코딩 에이전트는 2025년 5월 19일 발표되었다. 이슈를 할당하면 GitHub Actions에서 가상 머신을 띄우고, 저장소를 복제하고, GitHub 코드 검색 기반 검색으로 코드베이스를 분석한 뒤, 초안 풀 리퀘스트에 커밋을 푸시한다.[6]

공개 가중치 모델도 같은 영역에 들어왔다. Mistral은 2025년 5월 21일 Apache 2.0 라이선스로 Devstral을 공개했다. All Hands AI와 함께 만든 이 모델은 SWE-bench Verified에서 46.8%를 기록했으며, RTX 4090 한 장이나 메모리 32GB의 Mac에서 돌릴 만큼 가볍다고 밝혔다.[20]

5. 벤치마크

SWE-bench는 여러 데이터셋으로 이루어진 계열로 커졌다. 이 계열 전반에서 채점 기준은 해결된 인스턴스의 비율(%)이다.[16]

5.1. SWE-bench 계열

SWE-bench 계열 데이터셋
데이터셋인스턴스 수내용
SWE-bench(전체 테스트)2,29412개 Python 저장소, 2023년 원판[3]
SWE-bench Lite300비용이 덜 드는 평가를 위해 고른 부분집합[16]
SWE-bench Verified5002024년 8월 SWE-bench 저자들과 함께 OpenAI가 공개한 사람 검수 부분집합[24]
SWE-bench Multimodal논문 617개, 리더보드 채점 517개이미지를 포함한 JavaScript 이슈, 17개 라이브러리[25] [16]
SWE-bench Multilingual3009개 프로그래밍 언어 과제[16]
SWE-bench Pro1,865장기 호흡의 기업 과제, 41개 저장소, 2025년 9월 공개[26]

지금은 SWE-bench Verified가 기본 인용 대상이다. OpenAI는 Python에 익숙한 소프트웨어 개발자 93명과 함께 원래 테스트 세트에서 무작위로 뽑은 1,699개 인스턴스를 검수했다. 샘플마다 주석자 세 명이 이슈가 충분히 명시되었는지, 통과하는 테스트가 올바른 해결책을 부당하게 탈락시킬 수 있는지 확인했다. 주석자들은 샘플의 38.3%를 문제 설명이 불충분하다고, 61.1%를 올바른 패치를 부당하게 떨어뜨릴 수 있는 테스트가 있다고 표시했다. 전체적으로 샘플의 68.3%가 걸러져 500개가 남았다. 이 세트에서 GPT-4o는 33.2%를 해결했다.[24]

5.2. 리더보드 기록

이 세트의 성적은 가파르게 올랐다. 2025년 1분기에 기록된 최고 성적은 65.4%에서 멈췄고, 2025년 12월에는 선두가 79.2%에 올랐다.[16] 공개 리더보드의 가장 최근 기록은 2026년 2월 26일자이며, 주요 항목은 다음과 같다.[16]

SWE-bench 리더보드 주요 기록
항목보드해결률기록일
live-SWE-agent + Claude 4.5 Opus mediumVerified79.2%2025년 12월 15일[16]
Sonar Foundation Agent + Claude 4.5 OpusVerified79.2%2025년 12월 5일[16]
mini-SWE-agent + Claude 4.5 Opus(추론 강도 high)Verified76.8%2026년 2월 17일[16]
mini-SWE-agent + Claude 4.5 Opus mediumVerified74.4%2025년 11월 24일[16]
GLM-5(추론 강도 high)Bash only72.8%2026년 2월 17일[16]
Devstral small (2512)Bash only56.4%2025년 12월 9일[16]
Google Jules + Gemini 2.0 FlashVerified52.2%2024년 12월 12일[16]

리더보드는 SWE-bench 팀이 직접 수행하거나 검증한 기록과 제출자가 스스로 보고한 기록을 구분한다. 위 표에서 SWE-bench 팀 검증 표시가 붙은 것은 74.4% mini-SWE-agent 기록이고, 79.2% 두 항목에는 표시가 없다.[16] 비용도 함께 기록되며 적지 않은 규모다. 76.8% mini-SWE-agent 실행은 인스턴스당 약 0.75달러, 500개 세트 전체로는 약 377달러로 보고되었다.[16]

5.3. 기업 자체 보고

기업들은 자체 스캐폴드로 자체 수치를 발표한다. Anthropic은 Claude 3.7 Sonnet이 자사 인프라와 호환되는 489개 인스턴스 부분집합에서 맞춤형 스캐폴드를 쓸 때 SWE-bench Verified 70.3%, 그 스캐폴드 없이는 63.7%를 기록했다고 밝혔다.[4] 이후 Claude Opus 4는 72.5%, Claude Sonnet 4는 72.7%를 기록했다고 밝혔다.[15] OpenAI는 높은 추론 강도의 GPT-5.1-Codex 73.7%, extra-high 추론 강도의 GPT-5.1-Codex-Max 77.9%를 발표했으며, 함께 Terminal-Bench 2.0 58.1%를 공개했다.[27] Claude Opus 4.6은 2026년 2월 5일 공개되었다. Anthropic은 SWE-bench Verified 결과를 25회 시행해 평균을 냈고, 프롬프트를 수정하면 81.42%가 나온다고 덧붙였다.[28]

5.4. 다른 벤치마크

다른 벤치마크는 SWE-bench가 비워 둔 영역을 채운다. Aider의 다언어 코딩 벤치마크는 C++, Go, Java, JavaScript, Python, Rust에 걸친 Exercism 연습문제 225개를 쓰며, 문제 해결뿐 아니라 모델이 편집을 올바른 형식으로 적용하는지도 잰다. 목록에서 가장 높은 항목은 GPT-5가 높은 추론 강도로 정답률 88.0%를 기록한 것으로, 2025년 8월에 기록되었다.[29] Terminal-Bench는 스탠퍼드 대학과 Laude Institute의 협업으로, 터미널 능력을 직접 시험한다. 1.0 버전은 80개, 2.0 버전은 소프트웨어 공학, 머신러닝, 보안, 데이터 과학에 걸친 89개 과제로 구성된다.[30] 두 벤치마크는 HumanEval 같은 기존 함수 단위 벤치마크가 다루지 않은 영역을 잰다. 기존 벤치마크는 독립된 함수 하나를 쓰게 할 뿐, 기계를 조작하게 하지 않기 때문이다.

6. 한계와 비판

6.1. 벤치마크 타당성

가장 실질적인 비판은 벤치마크 타당성이다. 2024년 10월 발표된 실증 감사는 GPT-4를 쓴 SWE-agent가 해결한 인스턴스를 수작업으로 검토했다. 그 결과 성공한 패치의 32.67%가 이슈 본문이나 댓글에 직접 제시된 해결책을 담고 있었다. 통과한 패치의 31.08%는 테스트가 정확성을 검증하기에 너무 약해 의심스러웠다. 두 범주를 걸러 내자 같은 시스템의 해결률은 12.47%에서 3.97%로 떨어졌다.[31]

감사 저자들은 이슈의 94% 이상이 모델의 지식 차단 시점 이전에 작성되었다고 관찰하고 데이터 오염 우려를 제기했다. 같은 결함이 SWE-bench Lite와 SWE-bench Verified에도 있다고 보고했다.[31]

널리 인용되는 수치는 조건이 빠진 채 전달되기도 한다. Devin의 널리 인용된 13.86%는 테스트 세트의 무작위 25%, 즉 2,294개 중 570개 인스턴스에서 측정되었고, 그중 79개를 해결했다. 실행마다 45분 제한이 있었다. 비교 대상이었던 1.96% 기준선은 모델이 아니라 검색 시스템이 수정할 파일을 고른 다른 설정에서 나온 값이다.[12]

6.2. 실제 생산성

벤치마크 향상이 소프트웨어 개발 속도로 이어지는지는 별개의 질문이다. METR은 2025년 7월 10일 공개한 무작위 대조 실험에서, 자신이 관리하는 실제 저장소의 실제 이슈 246개를 숙련된 오픈소스 개발자 16명에게 맡겼다. AI 도구 사용이 허용된 개발자들은 주로 Cursor Pro에서 Claude 3.5와 3.7 Sonnet을 썼고, 사용하지 않을 때보다 19% 더 오래 걸렸다. 개발자들은 사전에 24% 빨라질 것으로 예상했고, 끝난 뒤에도 20% 빨라졌다고 믿었다.[32]

METR은 이 결과의 신뢰구간을 +2%에서 +39%로 나중에 제시했다.[33] 2026년 2월 후속 조사에서 METR은 실험의 2차 라운드가 파행을 겪었다고 보고했다. AI 없이 일하기 싫다는 이유로 참여를 거부하는 개발자가 늘었고, 설문 참가자의 30~50%가 같은 이유로 과제를 빼 놓았다고 답했다. 원래 연구에 돌아온 개발자 10명에 대해 METR은 -18%의 시간 변화(빨라짐)를 추정했고, 신뢰구간은 -38%에서 +9%였다. 새로 모집한 개발자의 추정치는 -4%였다. METR은 두 결과 모두 매우 약한 근거일 뿐이라고 보고 실험을 다시 설계하고 있다.[33]

6.3. 실무의 한계

일상 사용에서도 반복되는 반론이 있다. 검토 부담은 사라지지 않고 옮겨 갈 뿐이며, 사람이 직접 쓰지 않은 패치를 여전히 읽어야 한다. 에이전트는 근본 결함을 고치지 않고도 테스트를 통과시킬 수 있는데, 이는 보상 해킹의 한 형태다. 긴 세션은 많은 토큰을 소비하며, 리더보드는 위에서 본 인스턴스당 비용처럼 그 청구액을 명시적으로 추적한다.[16]

검토를 덜 하는 방식에는 이미 이름이 붙었다. 안드레이 카파시(Andrej Karpathy)는 2025년 2월, 모델에 프롬프트를 주고 철저한 검토 없이 결과를 받아들이는 방식을 바이브 코딩이라고 명명했다.[34] 콜린스(Collins)는 이 말을 2025년의 올해의 단어로 선정했다.[35]

7. 보안

셸 접근과 저장소 자격 증명을 언어 모델에 주면 자동 완성 도구에는 없던 공격 면이 생긴다. 가장 큰 우려는 프롬프트 인젝션이다. 이슈 본문, 웹 페이지, 의존성 파일, 도구 출력을 읽는 에이전트는 그 내용을 쓴 사람이 건넨 지시를 따를 수 있다.[1]

벤더들은 비슷한 통제 장치로 수렴했다. Claude Code는 읽기 전용을 기본값으로 하는 권한 기반 구조를 문서화했다. 시스템을 바꿀 수 있는 Bash 명령 앞에는 승인 요청이 뜨고, 작업 디렉터리 경계가 있으며, 파일 시스템과 네트워크가 격리된 샌드박스 bash 도구를 쓴다. 웹 가져오기는 격리된 컨텍스트 창에서 처리해 가져온 내용이 지시를 직접 주입하지 못하게 한다. curl과 wget 같은 네트워크 명령은 자동 승인에서 제외된다.[36]

GitHub의 코딩 에이전트는 자신이 만든 브랜치에만 푸시할 수 있고, 인터넷 접근은 사용자가 바꿀 수 있는 허용 목록으로 제한되며, 사람의 승인 없이는 Actions 워크플로를 실행할 수 없다. 풀 리퀘스트를 열어 달라고 요청한 개발자가 그것을 승인하는 사람이 될 수는 없다.[6]

이 위험은 가상이 아니다. 2025년 8월 26일 공격자는 GitHub Actions의 주입 결함을 악용해 Nx 프로젝트의 npm 배포 토큰을 훔쳤고, 약 4시간 동안 악성 패키지 버전을 배포했다. Nx는 2025년 9월 5일 사후 보고서에서, 악성 설치 후 스크립트가 민감한 정보를 수집하고 Claude와 Gemini 같은 로컬 AI 도구를 이용하려 했으며, 결과를 GitHub CLI로 공개 저장소에 올렸다고 적었다.[37]

이미 인증되어 있고 파일 시스템을 읽을 권한까지 갖춘 설치형 코딩 에이전트는, 기기에 접근한 공격자에게 쓸모 있는 도구가 된다.[1]

8. 2025~2026년 동향

8.1. 패키징 변화

세 가지 변화가 두드러진다. 첫째는 패키징이다. 같은 루프가 이제 터미널 프로그램, IDE 확장, 풀 리퀘스트를 여는 클라우드 서비스, 코드 리뷰어로 제공되며, 선두 벤더들은 이것들을 한꺼번에 내놓는다. 2025년 9월까지 OpenAI는 Codex를 터미널, IDE, 웹, GitHub, ChatGPT iOS 앱에 걸친 하나의 제품으로 통합했다. 이와 함께 에이전트형 코딩에 맞춘 GPT-5 버전인 GPT-5-Codex를 출시했다.[19]

GPT-5.2-Codex는 2025년 12월 18일, GPT-5.3-Codex는 2026년 2월 5일 나왔다. 후자는 Terminal-Bench 2.0에서 77.3%, 공개 SWE-bench Pro 세트에서 56.8%를 보고했다.[38][39][1]

8.2. 평가 기준의 이동

프런티어 시스템들이 SWE-bench Verified에서 80%에 가까이 몰리자[16] 관심은 더 어렵고 오염이 적은 세트로 옮겨 갔다. SWE-bench Pro, Terminal-Bench 2.0, 다국어 및 멀티모달 변형이 그 예다. Anthropic은 Claude Opus 4.5가 SWE-bench Multilingual에서 측정한 8개 프로그래밍 언어 중 7개에서 선두였다고 밝혔다.[40] 2025년 4월 공개된 Multi-SWE-bench는 같은 아이디어를 Java, TypeScript, JavaScript, Go, Rust, C, C++로 확장한다.[1]

8.3. 공개 가중치 모델의 격차

셋째로, 공개 가중치 모델도 격차를 일부 좁혔다. 스캐폴드를 고정한 bash 전용 보드에서 리더보드가 공개 가중치 모델로 표시한 최고 항목은 Kimi K2 Thinking의 63.4%다. 그다음은 MiniMax M2 61.0%, DeepSeek V3.2 Reasoner 60.0%, Devstral small 56.4%다. 전체 최고 기록은 76.8%다.[16] Devstral은 Apache 2.0 라이선스이며 단일 소비자용 GPU에 들어갈 만큼 작다.[20] 이는 독점 코드를 호스팅 API로 보낼 수 없는 팀에게 중요하다.

8.4. 미해결 질문

두 가지 질문은 아직 풀리지 않았다. 벤더들은 내부에서 큰 성과를 보고한다. OpenAI는 엔지니어의 95%가 주간 단위로 Codex를 쓰며, 도입 이후 이 엔지니어들이 풀 리퀘스트를 약 70% 더 많이 낸다고 밝혔다.[27] 반면 가장 좋은 독립적 현장 측정도 실제 속도 향상과 도입 자체가 만드는 선택 편향을 깔끔하게 구분하지 못한다.[33]

리뷰 병목도 움직이지 않았다. 에이전트가 풀 리퀘스트를 아무리 많이 열어도, 각각을 병합할 책임을 지겠다는 사람이 여전히 필요하다.[1]

각주·출처 40개
  1. ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12 ↩13 ↩14 ↩15 ↩16 ↩17 ↩18 ↩19 ↩20 ↩21 ↩22 ↩23 AI Wiki: Coding agent (2026-07-24 수정본) · CC BY 4.0 · 확인 2026-10-11
  2. ↩1 ↩2 Introducing GitHub Copilot: your AI pair programmer · 확인 2026-10-11
  3. ↩1 ↩2 ↩3 SWE-bench: Can Language Models Resolve Real-World GitHub Issues? · 확인 2026-10-11
  4. ↩1 ↩2 ↩3 ↩4 Claude 3.7 Sonnet and Claude Code · 확인 2026-10-11
  5. ↩1 ↩2 Introducing Codex · 확인 2026-10-11
  6. ↩1 ↩2 ↩3 ↩4 GitHub Copilot: Meet the new coding agent · 확인 2026-10-11
  7. ↩1 ↩2 Build with Jules, your asynchronous coding agent · 확인 2026-10-11
  8. ↩1 ↩2 ↩3 Introducing Devin, the first AI software engineer · 확인 2026-10-11
  9. ↩1 OpenAI Codex · 확인 2026-10-11
  10. ↩1 Introducing GitHub Copilot agent mode (preview · 확인 2026-10-11
  11. ↩1 ↩2 AGENTS.md project site · 확인 2026-10-11
  12. ↩1 ↩2 SWE-bench technical report · 확인 2026-10-11
  13. ↩1 SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering · 확인 2026-10-11
  14. ↩1 ↩2 mini-SWE-agent repository README, SWE-agent organization · 확인 2026-10-11
  15. ↩1 ↩2 ↩3 Introducing Claude 4 · 확인 2026-10-11
  16. ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12 ↩13 ↩14 ↩15 ↩16 ↩17 ↩18 ↩19 SWE-bench leaderboards, swebench.com; underlying data file data/leaderboards.json in the site repository. and · 확인 2026-10-11
  17. ↩1 ↩2 OpenHands repository (created March 2024 as OpenDevin · 확인 2026-10-11
  18. ↩1 ↩2 Devin 2.0 · 확인 2026-10-11
  19. ↩1 ↩2 Introducing upgrades to Codex · 확인 2026-10-11
  20. ↩1 ↩2 ↩3 Devstral · 확인 2026-10-11
  21. ↩1 OpenHands: An Open Platform for AI Software Developers as Generalist Agents · 확인 2026-10-11
  22. ↩1 Cognition's acquisition of Windsurf · 확인 2026-10-11
  23. ↩1 Jules, our asynchronous coding agent, is now available for everyone · 확인 2026-10-11
  24. ↩1 ↩2 Introducing SWE-bench Verified · 확인 2026-10-11
  25. ↩1 SWE-bench Multimodal: Do AI Systems Generalize to Visual Software Domains? · 확인 2026-10-11
  26. ↩1 SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks? · 확인 2026-10-11
  27. ↩1 ↩2 Building more with GPT-5.1-Codex-Max · 확인 2026-10-11
  28. ↩1 Introducing Claude Opus 4.6 · 확인 2026-10-11
  29. ↩1 Aider LLM Leaderboards, polyglot coding benchmark · 확인 2026-10-11
  30. ↩1 Terminal-Bench, Stanford and Laude Institute · 확인 2026-10-11
  31. ↩1 ↩2 SWE-Bench+: Enhanced Coding Benchmark for LLMs · 확인 2026-10-11
  32. ↩1 Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity · 확인 2026-10-11
  33. ↩1 ↩2 ↩3 We are Changing our Developer Productivity Experiment Design · 확인 2026-10-11
  34. ↩1 Vibe coding · 확인 2026-10-11
  35. ↩1 The Collins Word of the Year 2025 (AI Wiki 인용) · 확인 2026-10-11
  36. ↩1 Security · 확인 2026-10-11
  37. ↩1 S1ngularity: What Happened, How We Responded, What We Learned · 확인 2026-10-11
  38. ↩1 Introducing GPT-5.2-Codex · 확인 2026-10-11
  39. ↩1 Introducing GPT-5.3-Codex · 확인 2026-10-11
  40. ↩1 Introducing Claude Opus 4.5 · 확인 2026-10-11

함께 읽는 용어

GPU정확도벤치마크데이터셋AnthropicMicrosoftAI 에이전트하네스모델 컨텍스트 프로토콜프롬프트도구 사용Google대규모 언어 모델토큰ChatGPTCodexClaude CodeGeminiOpenAI인공지능Claude머신러닝

관련 AI 모델

GPT-3 175B (davinci)Claude 2Claude 3.7 SonnetGemini 2.5 Pro (Mar 2025)GPT-4o (May 2024)Claude Opus 4Claude Sonnet 4Claude Opus 4.6GPT-5GPT-4 (Mar 2023)GPT-5.3 CodexClaude Opus 4.5

이 용어를 다룬 글

인프라와 비용

요청 속도 제한

요청 속도 제한은 AI 서비스가 일정 기간 안에 허용하는 사용량의 상한이다. 구독 요금제에서는 5시간 세션 창과 주간 한도로, API에서는 분당·일당 요청 수와 토큰 수 상한으로 나타난다. 이 문서는 주요 서비스의 한도 구조와 초기화 규칙을 다룬다.

기업과 사람

Microsoft

Microsoft Corporation은 워싱턴주 레드몬드에 본사를 둔 미국 기술 기업으로, 인공지능 연산 자원과 모델, 응용 제품을 공급하는 대표 기업 가운데 하나다. 이 문서는 Microsoft 연구 조직, 자체 MAI 모델, Azure 인프라, Copilot 제품, OpenAI와의 제휴를 중심으로 AI 사업을 정리한다.

에이전트와 개발

AI 에이전트

AI 에이전트는 목표를 향해 환경을 관찰하고 행동을 선택해 실행하는 소프트웨어 시스템이다. 대개 대규모 언어 모델을 핵심으로 삼지만, 관찰·행동 인터페이스, 상태, 제어 로직, 중단 규칙이 함께 있어야 완성된다.

에이전트와 개발

에이전트 워크플로

에이전트 워크플로는 하나 이상의 AI 에이전트가 행동 순서를 스스로 계획하고, 도구를 골라 쓰고, 중간 결과를 평가하며, 목표에 이를 때까지 반복하는 다단계 작업 방식이다. 2024년 앤드루 응이 알리면서 확산되었고, 반성·도구 사용·계획·다중 에이전트 협업이 대표 설계 패턴으로 꼽힌다.

에이전트와 개발

하네스

하네스(Harness)는 대규모 언어 모델 같은 AI 모델을 감싸 단일 프롬프트 응답을 넘어 실제 작업이나 측정에 쓰이게 하는 소프트웨어 틀이다. 모델을 에이전트로 만드는 에이전트 하네스와 벤치마크를 모델에 돌려 점수를 내는 평가 하네스로 나뉜다. 두 용어 모두 전통 소프트웨어 공학의 테스트 하네스에서 이름과 개념을 빌렸다.

프롬프트와 활용

프롬프트

프롬프트는 생성형 AI 모델, 특히 대규모 언어 모델이 원하는 응답을 내도록 주는 입력 전체다. 가장 단순한 경우에는 한 문장이지만, 실제 서비스에서는 지시문, 맥락, 예시, 대화 기록, 도구 설명, 출력 제약을 묶은 구조화된 메시지 목록이다. 모델이 사용자의 의도를 파악하는 거의 유일한 신호라는 점에서 중요하다.

프롬프트와 활용

사고의 연쇄

사고의 연쇄(CoT)는 언어 모델이 최종 답을 내기 전에 중간 추론 단계를 생성하는 방식이다. 주로 풀이 예시나 단계별 추론 지시로 끌어내며, 수학·기호 문제에서 성능을 높일 수 있지만 정답이나 모델 내부 과정을 보장하지는 않는다.

에이전트와 개발

도구 사용

도구 사용은 모델 기반 시스템이 검색, 코드 실행, 데이터베이스 조회, API 호출처럼 모델 바깥의 기능을 요청하고 조율해 쓰는 능력이다. 실제 실행은 개발자 애플리케이션, 제공자 관리 서비스, 또는 다른 실행 환경이 맡고, 결과는 모델이나 주변 애플리케이션으로 돌아간다. 함수 호출은 도구 사용의 한 형태다.

모델과 서비스

ChatGPT

ChatGPT는 OpenAI가 만든 대화형 인공지능 챗봇이다. 2022년 11월 30일 무료 연구 미리보기로 출시되었고, GPT 시리즈 대규모 언어 모델을 바탕으로 질문 답변, 글·코드 작성, 이미지 생성, 웹 검색, 다단계 작업 수행을 지원한다.

모델과 서비스

Claude Code

Claude Code는 Anthropic이 만든 에이전트형 소프트웨어 개발 제품이다. Claude 모델로 프로젝트를 살피고 코드를 고치며 개발 도구를 실행하고, 터미널·편집기·데스크톱·웹·모바일에서 같은 엔진으로 동작한다.

모델과 서비스

Codex

Codex는 OpenAI가 코드 중심 AI 제품 두 세대에 쓴 이름이다. 2021년에는 자연어를 코드로 바꾸는 언어 모델이었고, 2025년에는 코드를 읽고 수정하고 테스트하는 에이전트형 개발 도구(Codex CLI, Codex Cloud)가 되었다.

모델과 서비스

Gemini

Gemini는 Google DeepMind가 개발한 네이티브 멀티모달 대규모 언어 모델 계열로, 텍스트·이미지·오디오·영상·코드를 하나의 모델 안에서 다룬다. 2023년 12월 6일 처음 발표되었고 구글 제품 전반에 쓰인다.

AI 첫걸음

대규모 언어 모델

대규모 언어 모델은 수십억에서 수조 개의 매개변수를 가진 트랜스포머 신경망을 방대한 텍스트로 학습시켜 다음 토큰을 예측하게 만든 인공지능 시스템이다. 번역, 요약, 질의응답, 코드 생성, 대화에 쓰이며 ChatGPT, Claude, Gemini 같은 제품의 바탕이 된다.

기업과 사람

OpenAI

OpenAI는 ChatGPT, GPT 모델 계열, Codex, OpenAI API를 만드는 미국의 인공지능 연구·배포 조직이다. 비영리 OpenAI Foundation이 델라웨어 공익법인 OpenAI Group PBC를 지배하는 구조로 운영된다.

모델과 서비스

Grok

Grok은 xAI가 만든 생성형 AI 챗봇이자 대규모 언어 모델 계열이다. 2023년 11월 4일 처음 출시되었고 X 플랫폼과의 통합으로 실시간 정보에 접근하는 것이 특징이며, 2026년 9월 기준 주력 모델은 Grok 4.7이다.