| 분류 | AI 에이전트 활용 방식[1] |
|---|---|
| 용어 확산 | 2024년 3월 앤드루 응의 강연 이후 널리 쓰이기 시작[1] |
| 대표 설계 패턴 | 반성, 도구 사용, 계획, 다중 에이전트 협업[2] |
| 대표 정리 자료 | 앤트로픽 「Building effective agents」(2024년 12월)[3] |
| 관련 개념 | 도구 사용, ReAct, 멀티 에이전트[1] |
쉽게 말하면, 에이전트 워크플로는 AI가 질문에 한 번 답하고 끝내지 않고, 목표를 여러 단계로 나눠 계획하고 도구를 써 가며 중간 결과를 점검해 고쳐 나가는 작업 방식이다. 같은 일을 여러 번 되풀이하며 결과를 다듬는 것이 핵심이며, 이 방식이 모델 자체의 성능만큼 결과를 좌우할 수 있다는 점이 주목을 받았다.[1]
1. 개요
에이전트 워크플로(agentic workflow)는 하나 이상의 AI 에이전트가 행동 순서를 스스로 계획하고, 도구를 골라 쓰고, 중간 결과를 평가하며, 목표에 이를 때까지 여러 단계를 반복하는 과정이다.[4][5] 기존 대규모 언어 모델 사용법에서는 프롬프트 하나가 응답 하나를 만든다(제로샷 프롬프팅). 에이전트 워크플로는 복잡한 작업을 하위 작업으로 나누고, 자신의 출력을 되돌아본 뒤 여러 차례에 걸쳐 고친다.[4][5] 이를 만드는 데 가장 많이 쓰이는 설계 패턴 네 가지는 2024년 3월 앤드루 응(Andrew Ng)이 정리한 반성, 도구 사용, 계획, 다중 에이전트 협업이다.[2]
이 용어는 2024년 초 널리 쓰이기 시작했다. 구글 브레인의 공동 창립자이자 DeepLearning.AI 설립자인 응은 2024년 3월 Sequoia Capital의 AI Ascent 행사에서 이 개념을 발표했다. 그는 에이전트 워크플로가 올해 AI 발전을 다음 세대 파운데이션 모델보다 어쩌면 더 크게 이끌 것이라고 주장했다.[5][1]
그는 이를 벤치마크 결과로 보였다. OpenAI가 만든 코딩 벤치마크 HumanEval에서 GPT-3.5는 제로샷 방식으로 48.1%, GPT-4는 67.0%를 기록했다. 그러나 GPT-3.5를 에이전트 워크플로로 감싸자 95.1%에 이르러 GPT-4의 제로샷 성능을 크게 앞질렀다.[4] 응은 GPT-3.5에서 GPT-4로의 개선이 반복형 에이전트 워크플로를 넣었을 때의 개선보다 훨씬 작아 보인다고 말했다.[4] 이 결과는 반복적 워크플로 설계가 모델 자체의 능력보다 더 중요할 수 있다는 점을 보여준다.[1]
2024년 12월 앤트로픽(Anthropic)은 「Building effective agents」에서 에이전트 시스템을 두 종류로 나눴다.[3] 하나는 워크플로로, 미리 정해진 코드 경로를 따라 LLM과 도구를 조율한다. 다른 하나는 에이전트로, LLM이 자신의 과정과 도구 사용을 동적으로 정하며 작업 수행 방식을 스스로 통제한다.[3] 현재 '에이전트 워크플로'는 두 방식을 모두 가리키거나, 좁게는 워크플로 쪽만 가리키는 말로 쓰인다.[1]
2. 등장 배경
기존 LLM 응용은 요청과 응답 구조를 따른다. 사용자가 프롬프트를 보내면 모델이 답을 생성하고 상호작용이 끝난다. 번역, 요약, 질의응답처럼 단순한 작업에는 맞지만, 조사, 계획, 여러 단계 추론이 필요한 열린 문제에는 한계가 있다. 사람 전문가도 복잡한 문제를 한 번에 풀지 않는다. 소프트웨어 엔지니어는 코드를 쓰고, 테스트를 돌리고, 오류 메시지를 읽고, 다시 고친다. 에이전트 워크플로는 이 반복 과정을 AI에 적용한 것이다. 에이전트는 상위 목표를 받아 단계로 나누고, 각 단계를 실행하며(외부 도구를 자주 호출), 결과를 평가하고, 부족하면 되돌아간다.[1]
단일 턴 응답에서 여러 턴의 자율 실행으로 옮겨 간 이 전환이 에이전트 AI를 이전의 프롬프트 엔지니어링 기법과 구분한다. 프롬프트 엔지니어링이 모델 호출 한 번을 최적화한다면, 에이전트 워크플로는 많은 호출을 하나의 과정으로 엮는다.[1] 개념적 뿌리는 2022년 Yao 등이 제안한 ReAct 프레임워크다. 이 방식은 추론 흔적과 도구 호출 행동을 번갈아 배치한다.[6] 또 Shinn 등의 Reflexion 논문(NeurIPS 2023)은 과제 피드백을 두고 언어로 스스로 성찰하는 에이전트가 몇 차례 반복 만에 HumanEval pass@1을 GPT-4 기준 80%에서 91%로 끌어올릴 수 있음을 보였다.[7]
Toran Bruce Richards가 2023년 3월 30일 공개한 Auto-GPT와 Yohei Nakajima가 2023년 4월 공개한 BabyAGI는 언어 모델이 목표를 완료할 때까지 스스로 반복하게 하는 아이디어를 대중화했다. 두 도구 모두 같은 자리를 맴돌거나 쓸모없는 출력에 토큰을 낭비한다는 비판을 많이 받았다.[8]
3. 앤드루 응의 4가지 설계 패턴
앤드루 응은 2024년 3월 강연과 같은 달 27일 X에 올린 글에서 에이전트 AI의 핵심 설계 패턴 네 가지로 반성, 도구 사용, 계획, 다중 에이전트 협업을 꼽았다.[5][2] 이 패턴들은 서로 배타적이지 않다. 실제 운영 시스템은 둘 이상을 결합하는 경우가 많다.[1]
3.1. 반성과 도구 사용
반성 워크플로에서 모델은 결과물을 만든 뒤 자기 작업을 비판한다. 응이 설명한 흔한 구성은 두 에이전트다. 하나는 고품질 결과물을 만들도록, 다른 하나는 건설적인 비판을 하도록 지시받는다. 두 에이전트의 대화가 반복적 개선으로 이어진다. 예를 들어 코딩 에이전트가 함수를 만들면 검토 에이전트가 예외 상황을 지적하고, 첫 에이전트가 코드를 고친다.[2]
반성은 가장 단순한 에이전트 패턴이며 구현도 가장 쉬운 편이다. 응은 이렇게 단순한데도 몇몇 경우 애플리케이션 결과가 크게 좋아지는 것을 보고 기뻤다고 밝혔다.[2] 이 패턴은 품질을 프로그램으로 평가하기 쉬운 글쓰기, 코드 생성, 데이터 분석에서 특히 잘 맞는다.[1] 2023년 Reflexion 논문은 이 아이디어를 학계에서 정리한 대표적 공식화로, 언어를 통한 자기 성찰을 가중치 업데이트의 대안으로 설명한다.[7]
도구 사용은 에이전트의 능력을 텍스트 생성 너머로 넓힌다. 에이전트는 학습 데이터에만 의존하지 않고, 외부 API를 호출하고 데이터베이스를 조회하며 코드를 실행하고 웹을 검색하거나 파일 시스템과 상호작용할 수 있다. 2022년 Yao 등의 논문으로 ICLR 2023에 발표된 ReAct(추론과 행동) 프레임워크는 추론 흔적과 도구 호출 행동을 번갈아 배치해 이 패턴을 정식화했다. 각 단계에서 에이전트는 추론을 말하고(생각), 행동(예: 검색 API 호출)을 정하며, 결과를 관찰한 뒤 다음 단계를 추론한다.[6]
도구 사용은 언어 모델을 텍스트 생성기에서 실제 기능을 수행하는 에이전트로 바꾼다. 도구가 있으면 최신 정보를 가져오고, 계산하고, 파일을 수정하고, 메시지를 보내고, 소프트웨어 시스템과 상호작용할 수 있다. 현대 시스템의 기술 기반은 구조화된 함수 호출이다. 모델이 호출할 도구와 인자를 지정한 타입 있는 JSON 객체를 내놓는 방식이다.[1]
3.2. 계획과 다중 에이전트 협업
계획은 에이전트가 복잡한 작업을 실행 전에 더 작고 다루기 쉬운 단계들로 나누는 것이다. 에이전트는 문제 전체를 한 번에 풀려 하지 않고 계획을 세운 뒤 한 단계씩 실행하며, 중간 결과가 원래 접근이 통하지 않음을 보이면 계획을 고친다.[2] 정교한 계획 에이전트는 사고의 연쇄 같은 기법으로 접근을 그려 보고, 일부 시스템은 완료 단계와 대기 단계를 추적하는 명시적 계획 데이터 구조를 유지한다. 계획은 작업 사이에 의존 관계가 있거나 한정된 자원을 여러 우선순위에 나눠 써야 할 때 특히 가치가 커진다.[1]
다중 에이전트 협업은 서로 다른 역할이나 전문성을 별도 에이전트에 맡겨 공유 작업을 함께 수행하게 한다. 예를 들어 한 에이전트는 조사자, 다른 에이전트는 작성자, 셋째는 사실 확인자, 넷째는 편집자가 된다. 각 에이전트는 자기 전문에 집중하고 구조화된 메시지를 주고받으며 소통한다.[2] 이 방식은 사람 제품 팀이 디자이너, 엔지니어, 제품 관리자, QA 테스터로 업무를 나누는 방식과 닮았다.[1] Gartner는 2024년 1분기부터 2025년 2분기까지 기업의 다중 에이전트 시스템 문의가 1,445% 늘었다고 보고했으며, 이는 업계의 높은 관심을 보여준다.[9]
4. 앤트로픽의 워크플로 패턴
앤트로픽이 2024년 12월 19일 발표한 에세이 「Building effective agents」는 앤드루 응 이후 에이전트 워크플로를 가장 영향력 있게 정식화한 글이다. 이 글은 다섯 가지 구체적 워크플로 패턴을 나열하고, 이를 열린 방식의 에이전트 패턴과 대비한다.[3] 다섯 가지 워크플로 패턴은 다음과 같다.
- 프롬프트 체이닝: 작업을 순차 단계로 나누고 LLM 호출 사이에 프로그램적 점검 지점을 둔다.[3]
- 라우팅: 입력을 분류해 전문화된 하위 프롬프트나 도구로 보낸다.[3]
- 병렬화: 여러 LLM 호출을 동시에 실행해 작업을 나누거나, 같은 작업에 대해 투표를 받는다.[3]
- 오케스트레이터-워커: 중앙 LLM이 작업을 동적으로 나누고 하위 작업을 워커 LLM에 맡긴 뒤 결과를 종합한다.[3]
- 평가자-최적화: 한 LLM이 후보 응답을 만들고 다른 LLM이 평가하며, 품질 기준을 충족할 때까지 반복한다.[3]
앤트로픽은 이 미리 정해진 패턴들을 에이전트 패턴 자체와 대비한다. 에이전트에서는 LLM이 도구 사용 루프를 돌리며 매 단계 다음 행동을 정하고, 작업이 끝났다고 판단하거나 중지 조건에 닿을 때까지 실행된다.[3] 이 에세이는 가능한 가장 단순한 해법을 찾고 필요할 때만 복잡도를 높이라고 권하며, 많은 운영 사례는 완전한 에이전트보다 워크플로로 충분히 해결된다고 짚는다.[3]
5. 공통 설계 패턴 비교
앤드루 응의 네 가지 큰 범주와 앤트로픽의 다섯 가지 워크플로 패턴 외에도, 실무자들은 운영 환경의 에이전트 시스템에서 반복되는 구체적 패턴을 여럿 찾아냈다. 아래 표는 그중 열 가지를 정리한 것이다.[1]
| 패턴 | 설명 | 전형적 사용 사례 | 복잡도 |
|---|---|---|---|
| ReAct 루프 | 에이전트가 추론(생각)과 행동(도구 호출)을 번갈아 하며 매 단계 결과를 관찰한다 | 검색과 정보 찾기, 데이터 분석, 질의응답 | 낮음[1] |
| 반성·자기 비판 | 에이전트가 결과물을 만들고 비판한 뒤 반복해서 고친다 | 코드 생성, 글쓰기, 디버깅 | 낮음[1] |
| 계획 후 실행 | 에이전트가 명시적인 다단계 계획을 세우고 각 단계를 순서대로 실행한다 | 복잡한 조사, 프로젝트 관리, 여러 파일에 걸친 코드 변경 | 중간[1] |
| 도구 라우팅 | 디스패처 에이전트가 사용자 요청에 따라 어떤 전문 도구나 하위 에이전트를 호출할지 정한다 | 고객 지원 분류, IT 헬프데스크, 함수 호출 | 중간[1] |
| 다중 에이전트 토론 | 여러 에이전트가 서로 다른 입장을 주장하고 합의된 답으로 수렴한다 | 사실 검증, 의사 결정, 위험 평가 | 중간[1] |
| 계층형 위임 | 감독 에이전트가 하위 작업을 워커 에이전트에 맡기고 결과를 취합한다 | 보고서 생성, 데이터 파이프라인, 소프트웨어 공학 | 높음[1] |
| 사람 개입 루프 | 에이전트가 지정된 점검 지점에서 멈추고 진행 전 사람의 승인을 요청한다 | 금융 거래, 의료 권고, 법률 검토 | 중간[1] |
| 맵-리듀스 | 에이전트가 큰 작업을 병렬 하위 작업으로 나눠 동시에 처리하고 결과를 합친다 | 문서 분석, 일괄 처리, 대규모 요약 | 높음[1] |
| 오케스트레이터-워커 | 계획 LLM이 여러 워커 LLM에 하위 작업을 나누고 결과를 종합한다 | 긴 조사 보고서, 복잡한 코드 변경 | 높음[1] |
| 평가자-최적화 | 생성 LLM과 비평 LLM이 품질 기준을 충족할 때까지 반복한다 | 고품질 글쓰기, 구조화된 추출 | 중간[1] |
6. 운영 환경 에이전트의 자율성 수준
운영 환경에서 에이전트에게 얼마나 독립성을 줄지는 핵심 설계 질문 중 하나다. 앤트로픽은 2026년 에이전트 자율성 측정 연구에서 자율성이 모델이나 시스템에 고정된 속성이 아니라 배포 환경에서 나타나는 특성이라고 밝혔다.[10] 자율성의 수준은 크게 세 가지 패턴으로 나뉜다.
휴먼 인 더 루프 패턴에서 에이전트는 행동을 제안하지만 실행 전에 사람의 명시적 승인을 기다린다. 모든 도구 호출, API 요청, 출력이 사람의 검토 단계를 거친다. 가장 안전한 방식이며 의료, 금융, 법률처럼 위험이 큰 분야에서 흔하다. 단점은 속도로, 워크플로는 사람 검토자의 속도만큼만 진행된다.[1]
6.1. 감독형 자율성
감독형 자율성(휴먼 온 더 루프)에서 에이전트는 일상적이고 위험이 낮으며 되돌릴 수 있는 행동은 자율적으로 처리한다. 위험이 높거나 되돌릴 수 없거나 모호한 결정은 사람에게 넘긴다. 이 '조정된 자율성' 접근은 안전과 효율의 균형을 맞추려 한다. 예를 들어 고객 지원 에이전트는 표준 환불은 스스로 처리하고, 사기 가능성이 있는 불만은 사람 관리자에게 넘길 수 있다.[1]
앤트로픽의 자율성 연구는 배포 환경에서 나온 거의 100만 건의 도구 호출과 수십만 건의 실시간 코딩 세션을 바탕으로 했다. 그 결과 실제 도구 호출의 약 73%가 사람 개입 루프 아래에서 이뤄졌고, 되돌릴 수 없는 호출은 약 0.8%에 그쳤다. 신규 사용자의 자동 승인 비율은 약 20%였고, 숙련 사용자는 50%를 넘었지만 에이전트를 중단시키는 빈도도 약 두 배 많았다.[10] 2025년 10월부터 2026년 1월 사이 Claude Code 세션 길이의 99.9백분위수는 25분 미만에서 45분 이상으로 거의 두 배가 되었다. 사용자가 더 긴 작업을 에이전트에 맡기기 시작했음을 보여준다.[10]
6.2. 완전 자율
완전 자율 에이전트는 사람의 개입 없이 워크플로 전체를 실행한다. 가드레일과 안전 점검은 사람의 검토에 기대지 않고 프로그램에 내장된다. 데이터 입력, 콘텐츠 태깅, 로그 분석처럼 위험이 낮고 양이 많은 작업에 쓰인다. 완전 자율 에이전트는 실패가 사후에 드러나므로 견고한 모니터링과 관측 인프라가 필수다.[1]
2025년과 2026년 운영 환경 배포 대부분은 감독형 자율성 영역에 있다.[1] 딜로이트의 에이전트 AI 전략 보고서는 조직이 단일 단계 자동화에서 전체 워크플로를 관리하는 시스템으로 옮겨 가고 있지만, 결정 지점에는 사람의 감독이 남아 있다고 설명했다.[11]
7. 주요 프레임워크
에이전트 워크플로 구축을 쉽게 하려고 여러 오픈소스와 상용 프레임워크가 등장했다. 이들은 상태 관리, 도구 등록, 에이전트 간 통신, 오류 처리, 관측 가능성 같은 공통 문제를 처리한다.[1]
7.1. LangGraph와 CrewAI
LangGraph는 LangChain이 개발했으며 그래프 기반 워크플로 설계를 쓴다. 에이전트의 상호작용은 방향 그래프의 노드로 모델링되고, 간선은 단계 사이의 전이를 나타낸다. 이 구조는 조건 분기, 반복 개선을 위한 순환, 병렬 실행 경로를 지원한다. 그래프를 따라 흐르는 지속 상태 객체로 에이전트 상태를 세밀하게 제어하며, Python과 TypeScript로 작성되고 LangChain 생태계와 긴밀히 통합된다.[12]
LangGraph는 앤트로픽의 다섯 가지 워크플로 패턴(프롬프트 체이닝, 라우팅, 병렬화, 오케스트레이터-워커, 평가자-최적화)을 참고 구현으로 제공한다.[12] 오케스트레이터에서 워커 노드를 동적으로 보내는 Send API는 임의 개수의 병렬 하위 작업에 대해 팬아웃과 팬인 패턴을 지원한다.[12]
CrewAI는 사람 팀 구조에서 영감을 받은 역할 기반 방식을 쓴다. 개발자는 각각 고유한 역할, 배경 설명, 능력 집합을 가진 에이전트로 '크루'를 정의한다. 작업은 역할에 따라 배정되며, 에이전트끼리 소통하고 하위 작업을 위임할 수 있다. 단순성과 빠른 프로토타이핑에 초점을 맞추며, 콘텐츠 생성 파이프라인, 경쟁사 분석, 고객 지원 워크플로에 많이 쓰인다.[1]
7.2. AutoGen과 Semantic Kernel
AutoGen은 원래 Microsoft Research가 개발했으며, 구조화된 대화로 다중 에이전트 오케스트레이션을 구현한다. 에이전트는 그룹 채팅 형식으로 메시지를 주고받고, 플래너, 연구자, 코더, 실행자 같은 역할을 맡는다. 완전 자율 대화와, 사람 참여자가 대화에 끼어들 수 있는 사람 개입 구성을 모두 지원한다.[1]
2025년 10월 Microsoft는 AutoGen을 Semantic Kernel과 합쳐 통합 Microsoft Agent Framework로 만들었다. 이 플랫폼은 AutoGen의 유연한 다중 에이전트 오케스트레이션과, Semantic Kernel의 세션 기반 상태 관리, 미들웨어, 텔레메트리 같은 기업용 기능을 함께 제공한다. 1.0 정식 출시는 2026년 1분기를 목표로 하고 있다.[13]
Semantic Kernel은 AI 에이전트와 다중 에이전트 시스템을 만들기 위한 Microsoft의 모델 중립 SDK다. Python, C#, Java로 제공되며, 이미 Microsoft 생태계에서 일하는 기업 개발자를 겨냥한다. 순차, 동시, 그룹 채팅, 핸드오프, 마그네틱(magnetic) 오케스트레이션 패턴을 지원한다. AutoGen과 합쳐진 뒤에는 Semantic Kernel이 상태 관리, 타입 안정성, 텔레메트리 같은 운영 기반을 맡고, AutoGen이 에이전트 추상화와 대화 패턴을 제공한다.[13]
7.3. Claude Agent SDK와 기타 프레임워크
앤트로픽이 2025년 공개한 Claude Agent SDK는 Claude Code가 쓰는 것과 같은 기본 요소를 제공한다. 도구 사용 루프, 하위 에이전트 생성, Claude Skills, 모델 컨텍스트 프로토콜 서버 연동이 여기에 포함된다. 앤트로픽은 Agent SDK, Claude Code 하위 에이전트, Skills(2025년 10월), Agent Teams(2026년 초)를 약 1년 사이에 차례로 공개했다.[14][15]
그 밖의 주요 프레임워크로는 LlamaIndex Workflows(검색 증강 생성 에이전트 중심), DSPy(선언형 에이전트 프로그램을 최적화된 프롬프트로 컴파일), deepset의 Haystack(NLP 파이프라인 오케스트레이션), AWS의 관리형 서비스 Amazon Bedrock Agents, OpenAI Agents SDK가 있다. 프레임워크 지형은 빠르게 변하며 새 진입자가 계속 나타난다.[1]
| 프레임워크 | 개발사 | 구조 방식 | 주요 언어 | 출시 연도 | 적합한 용도 |
|---|---|---|---|---|---|
| LangGraph | LangChain | 그래프 기반 워크플로 | Python, TypeScript | 2024 | 복잡한 조건 분기 워크플로[12] |
| CrewAI | CrewAI Inc. | 역할 기반 크루 | Python | 2023 | 팀 구조의 콘텐츠·조사 워크플로[1] |
| AutoGen / Microsoft Agent Framework | Microsoft | 대화 기반 | Python, .NET | 2023(AutoGen), 2025(통합) | 조사, 협업형 문제 해결[13] |
| Semantic Kernel | Microsoft | 플러그인 기반, 다중 패턴 | Python, C#, Java | 2023 | 기업용 .NET·Java 애플리케이션[13] |
| LlamaIndex Workflows | LlamaIndex | 이벤트 기반 | Python, TypeScript | 2024 | RAG 중심 에이전트 애플리케이션[1] |
| DSPy | Stanford NLP | 선언형 컴파일 | Python | 2023 | 최적화된 프롬프트 파이프라인[1] |
| Amazon Bedrock Agents | AWS | 관리형 서비스 | Python(SDK) | 2023 | AWS의 서버리스 운영 에이전트[1] |
| Claude Agent SDK | Anthropic | 도구 루프 + 하위 에이전트 + MCP | Python, TypeScript | 2025 | 장시간 코딩·조사 에이전트[14] |
| OpenAI Agents SDK | OpenAI | 핸드오프 기반, 함수 도구 | Python, TypeScript | 2025 | OpenAI 중심 다중 에이전트 앱[1] |
8. 모델 컨텍스트 프로토콜(MCP)
모델 컨텍스트 프로토콜(MCP)은 AI 에이전트가 외부 도구, 데이터 소스, 시스템에 연결하는 방식을 표준화하려고 2024년 11월 25일 앤트로픽이 내놓은 개방형 표준이다.[16] MCP 이전에는 에이전트와 외부 서비스를 잇는 연동마다 맞춤 코드가 필요했다. MCP는 이렇게 흩어진 방식을 하나의 보편 프로토콜로 바꾼다.[16]
MCP는 클라이언트-서버 구조를 쓴다. MCP 클라이언트(AI 에이전트나 애플리케이션)는 하나 이상의 MCP 서버에 연결되고, 각 서버는 특정 시스템의 도구와 데이터를 노출한다. 예를 들어 GitHub용 MCP 서버는 풀 리퀘스트 생성, 이슈 읽기, 저장소 검색 도구를 노출할 수 있다. 에이전트는 서버에 한 번 연결한 뒤 표준화된 인터페이스로 그 도구들을 호출한다.[1]
출시 시점에 앤트로픽은 Google Drive, Slack, GitHub, Git, Postgres, Puppeteer용 미리 만든 MCP 서버를 공개했다. 초기 도입 기업으로는 Block, Apollo, Zed, Replit, Codeium, Sourcegraph가 있었다.[16] 2025년 3월 OpenAI는 ChatGPT 데스크톱 앱을 포함한 자사 제품 전반에 MCP를 채택했다. 2025년 말까지 활성 MCP 서버는 1만 개를 넘었고, Python과 TypeScript를 합친 월간 SDK 다운로드는 9,700만 회에 이르렀다.[1]
2025년 12월 9일 앤트로픽은 MCP를 리눅스 재단(Linux Foundation) 산하의 목적형 기금으로 새로 설립된 Agentic AI Foundation(AAIF)에 기증했다. 이 재단은 앤트로픽, Block, OpenAI가 공동 창립했으며, 앤트로픽의 MCP, Block의 goose, OpenAI의 AGENTS.md 세 프로젝트를 초기 기여로 받았다. 플래티넘 회원에는 Amazon Web Services, 앤트로픽, Block, Bloomberg, Cloudflare, Google, Microsoft, OpenAI가 포함되었다.[17] 이 움직임은 에이전트와 도구 연동의 공동 표준에 업계 전체가 힘을 싣고 있음을 보여준다.[17]
MCP는 에이전트를 도구에 연결하는 사실상의 표준이 되었다. 경쟁 AI 기업들과 수많은 제3자 개발자가 빠르게 채택하면서, 도구 연동의 파편화 문제는 프로토콜 수준에서 대체로 풀린 것으로 보인다.[1]
9. Agent2Agent 프로토콜(A2A)
MCP가 에이전트를 도구에 연결하는 방식을 표준화한다면, Agent2Agent 프로토콜(A2A)은 에이전트끼리 소통하는 방식을 표준화한다. Google은 2025년 4월 9일 A2A를 발표했으며, Atlassian, Salesforce, SAP, ServiceNow, PayPal, LangChain, MongoDB 등 50곳 이상의 기술 파트너가 지원에 나섰다.[18]
A2A는 MCP와 다른 문제를 푼다. 다중 에이전트 시스템에서는 서로 다른 공급사나 다른 프레임워크로 만든 에이전트들이 서로의 능력을 찾고, 작업을 위임하고, 결과를 주고받고, 사용자에게 결과를 어떻게 보일지 협상할 공통 언어가 필요하다. A2A가 이 공통 언어를 제공한다.[1]
- 능력 탐색: 에이전트는 JSON 형식의 'Agent Card'를 게시해 자신이 할 수 있는 일을 알린다. 클라이언트 에이전트는 이 카드를 읽고 주어진 작업에 맞는 에이전트를 찾는다.
- 작업 관리: 통신은 정해진 생명주기를 가진 작업 객체를 중심으로 이뤄진다. 작업은 즉시 끝나기도 하고, 지속적인 상태 갱신과 함께 비동기로 실행되기도 한다.
- 협업: 에이전트는 맥락, 지시, 부분 결과를 타입이 있는 파트(텍스트, 이미지, 양식, 기타 미디어)를 담은 구조화 메시지로 주고받는다.
- 사용자 경험 협상: 에이전트는 사용자 인터페이스의 능력(일반 텍스트, iframe, 웹 양식, 동영상)에 맞춰 결과를 어떻게 표시할지 협상한다.[1]
A2A는 HTTP, Server-Sent Events, JSON-RPC 같은 기존 웹 표준 위에 만들어졌고, 기업급 인증과 권한 부여를 지원한다. 2025년 6월 Google은 A2A를 리눅스 재단에 기증했다. 2025년 7월에 공개된 0.3 버전은 운영 환경 사용을 위해 더 안정적인 API 표면을 제공했다.[19]
A2A와 MCP는 상호 보완적이다. MCP는 에이전트와 도구 사이의 통신(수직 통합)을, A2A는 에이전트와 에이전트 사이의 통신(수평 통합)을 맡는다. 두 프로토콜이 함께 다중 에이전트 시스템의 새로운 프로토콜 스택을 이룬다.[1]
10. 2025~2026년의 발전
2024년 말부터 2026년 중반까지 18개월 동안 에이전트 워크플로는 연구 아이디어에서 대중 시장의 제품 범주로 바뀌었다. 특히 자세히 기록할 만한 흐름은 다음과 같다.[1]
10.1. 컴퓨터 사용 에이전트
2024년 10월 22일 앤트로픽은 업그레이드된 Claude 3.5 Sonnet의 공개 베타 기능으로 컴퓨터 사용(computer use)을 선보였다. 이로써 Claude는 API 도구를 통해 자율적으로 데스크톱을 제어하는 최초의 프런티어 시스템 중 하나가 되었다.[20] 앤트로픽은 작업마다 전용 도구를 만드는 대신, 화면 보기, 커서 이동, 버튼 클릭, 텍스트 입력 같은 일반 컴퓨터 기술을 Claude에 가르쳤다. 이 기능은 실험적으로 공개되었으며, 앤트로픽은 이것이 "at times cumbersome and error-prone"이라고, 곧 때로 번거롭고 오류가 잦다고 인정했다.[20]
OpenAI는 2025년 1월 23일 Computer-Using Agent(CUA) 모델로 구동되는 브라우저 기반 에이전트 Operator를 내놓았다. GPT-4o의 비전 능력과 스크린샷에 대한 강화학습 기반 추론을 결합했다. Operator는 미국의 ChatGPT Pro 구독자에게 월 200달러에 제공되었다. CUA는 전체 컴퓨터 사용 과제인 OSWorld에서 38.1%, WebArena에서 58.1%, WebVoyager에서 87%를 기록했다.[21] 2025년 7월 17일 OpenAI는 Operator의 브라우저, 딥 리서치의 웹 종합 기능, ChatGPT의 대화 인터페이스를 묶은 통합 시스템 ChatGPT Agent를 출시했다. Pro, Plus, Team 구독자에게 제공되었고, 기반 모델은 Humanity's Last Exam에서 pass@1 41.6%를 기록해 o3와 o4-mini 기준선의 약 두 배였다.[22] 독립형 Operator 사이트(operator.chatgpt.com)는 2025년 8월 31일 지원이 중단되어 종료되었다.[22]
Google의 Project Mariner는 2024년 12월 Gemini 2.0 기반 연구 프로토타입으로 같은 영역에 들어왔다. 페이지 텍스트, 이미지, 양식, 코드를 함께 추론해 브라우저를 조작하는 실험적 Chrome 확장 프로그램이었다. 2025년 5월 20일 Google I/O에서 Project Mariner는 클라우드 기반 실행, 최대 10개 작업의 동시 처리, 'Teach & Repeat' 기능을 얻었고, WebVoyager 벤치마크에서 83.5%를 기록했다.[23] 2025년 12월 Google은 Project Mariner의 기능을 Gemini 앱 안의 Gemini Agent에 통합했다. 독립형 Mariner 소개 페이지는 종료일을 2026년 5월 4일로 밝혔다.[24]
10.2. 에이전트형 코딩 도구
에이전트형 코딩은 이 기술에서 상업적으로 가장 성공한 응용이 되었다. 앤트로픽은 2025년 2월 에이전트형 명령줄 도구 Claude Code를 출시했고, 2025년 5월 Claude 4와 함께 일반 제공을 시작했다. 2025년 9월에는 Claude Code 2.0을 내놓았는데, 분할 패널 보기, 내장 터미널, 병렬 세션, 체크포인트, IDE 확장, 자동화 훅을 갖췄다.[25] Claude Code는 일반 제공 후 약 6개월 만에 연간 환산 매출(run-rate) 약 10억 달러에 도달했다. 앤트로픽의 전체 연간 환산 매출도 2025년 초 약 10억 달러에서 2025년 8월 약 50억 달러로 뛰었다.[26]
Cursor는 2025년 10월 29일 Cursor 2.0을 출시했다. 전용 코딩 모델 Composer와 에이전트 중심 인터페이스를 묶은 버전이다. Composer는 소프트웨어 공학을 위해 강화학습으로 학습된 전문가 혼합(mixture-of-experts) 모델로, 비슷한 지능의 모델보다 약 네 배 빠르며 대부분의 턴을 30초 안에 끝낸다. Cursor 2.0은 단일 프롬프트에 최대 8개의 병렬 에이전트를 지원하고, git 워크트리나 원격 머신을 써서 작업 공간을 서로 격리한다.[27]
Replit Agent는 2024년 9월 출시되었고, 2025년 Replit의 연간 반복 매출(ARR)을 1억 달러로 끌어올리는 데 기여했다. 2025년 9월 10일 공개된 Replit Agent 3는 최대 200분 동안 연속으로 작동하고, 자신의 버그를 반복 루프 안에서 스스로 테스트하며, 'Agents & Automations' 인터페이스로 다른 에이전트와 자동화를 만들 수 있다.[28]
OpenAI는 2025년과 2026년에 걸쳐 에이전트형 Codex 모델을 연달아 내놓았다. 여기에는 GPT-5-Codex(2025년 9월 23일), GPT-5.1-Codex-Max, GPT-5.2-Codex(2025년 12월 18일)가 포함되며, 모두 긴 호흡의 에이전트형 코딩 작업에서 앞선 모델보다 더 유능하다고 소개되었다.[29]
Cognition AI가 2024년 3월 '최초의 AI 소프트웨어 엔지니어'라는 슬로건으로 소개한 자율 소프트웨어 엔지니어 Devin은 엇갈린 평가를 받았다. 2025년 초 Answer.AI의 독립 분석은 20개 과제에서 Devin이 실패 14건, 결론 불명 3건, 성공 3건을 냈다고, 즉 성공률 15%라고 밝혔다. 이 분석은 Devin이 "npm 패키지 의존성 오류에 막혀 환각으로 만든, 점진적으로 도움이 되지 않는 코드 뭉치를 커밋한" 사례도 관찰했다.[30] Cognition은 2025년 4월 Devin 2.0으로 응답했다. 월 20달러로 진입 가격을 낮췄고, 여러 병렬 Devin을 지원하는 클라우드 IDE, 대화형 계획 모드, Devin Search/Wiki 기능을 추가했다. 2025년 7월 14일 Cognition은 AI 코딩 스타트업 Windsurf를 인수했다. 앞서 Google이 24억 달러 규모의 별도 인재·라이선스 거래로 Windsurf 경영진을 영입해 간 뒤였다. 인수에는 Windsurf의 지식재산권, 제품, 팀이 포함되었고, 보도에 따르면 Cognition의 ARR을 두 배 이상 늘렸다. Cognition의 기업가치는 2025년 9월 102억 달러에 이르렀다. Devin 2.2는 2026년 2월 24일 공개되어 데스크톱 앱 테스트를 추가했고, 시작 속도를 세 배 빠르게 했으며, 자동 풀 리퀘스트 리뷰 기능인 Devin Review를 도입했다.[1]
10.3. 하위 에이전트와 다중 에이전트 패턴
2025년 내내 하위 에이전트와 다중 에이전트 패턴으로의 흐름이 빨라졌다. Claude Code에서 Task 도구는 하위 에이전트를 띄우는데, 각 하위 에이전트는 자신의 컨텍스트 창, 시스템 프롬프트, 도구 허용 목록, 권한을 받는다. 상위 에이전트는 하위 에이전트의 최종 출력만 받고 전체 추론 흔적은 받지 않으며, 이로써 오케스트레이터의 컨텍스트를 보존한다.[15] 일반적인 설정에서는 여러 Task 호출이 동시에 실행될 수 있고, 병렬 하위 에이전트는 최대 10개까지 가능하다.[15] 앤트로픽의 'Agent Teams' 기능은 2026년 초 공개되었으며, 상위 수준의 조정 기능, 의존성 추적이 있는 공유 작업 목록, 팀원 간 P2P 메시징, 병합 충돌을 막는 파일 잠금을 추가했다.[14]
오케스트레이터가 큰 작업을 나누고, 병렬 하위 에이전트에 배분하고, 한 세션에서 결과를 병합하는 '분할 후 병합' 패턴은 대규모 코딩 에이전트 활용의 전형적인 방식이 되었다. Cursor 2.0의 병렬 에이전트 8개 기능은 같은 아이디어를 그래픽 UI로 감싼 것이다.[27]
10.4. Manus와 기업용 에이전트 플랫폼
2025년 3월 6일 중국 스타트업 Butterfly Effect는 초대장 방식 베타로 Manus AI를 출시했다. Manus는 자신을 세계 최초의 범용 AI 에이전트라고 소개했다. Claude Sonnet 4.5(및 그 이전 버전인 3.5)와, 알리바바의 오픈소스 Qwen을 미세 조정한 버전 위에 세운 것으로, 여러 전문 하위 에이전트를 조율해 다양한 작업을 자율적으로 수행하는 구조다. 출시 데모는 Manus가 이력서를 선별하고 주식을 분석하는 모습을 보여주었고, 20시간 만에 100만 회가 넘는 조회를 기록했다. 초대 코드는 중고로 수만 위안(renminbi)에 거래되었다. Jack Dorsey부터 Hugging Face의 제품 책임자 Victor Mustar까지 여러 인사가 Manus를 '두 번째 DeepSeek 모먼트'라고 불렀다.[1]
이 과열은 빠른 상업적 성장으로 이어졌다. 2025년 12월 기준 Manus는 수백만 명의 구독자, 1억 달러 이상의 연간 반복 매출(ARR)을 확보했고, 출시 8개월 뒤 연간 매출 런레이트는 1억 2,500만 달러를 넘었다. 2025년 12월 Meta는 Manus를 인수하기로 합의했다고 발표했으며, 보도된 기업가치는 20억~30억 달러였다. 거래는 2025년 12월에 마무리되었고, Meta는 Manus의 운영을 통합했다. 그러나 2026년 4월 27일 중국 국가발전개혁위원회는 기술 유출 우려를 이유로 인수를 차단하고 모든 당사자에게 철회를 명령했다. 다만 Manus 직원들은 이미 Meta에 합류한 상태였고, 초기 투자자들은 수익을 받은 뒤였다.[1]
Salesforce는 2024년 10월 29일 Agentforce를 기업용 AI 에이전트 플랫폼으로 출시했다. 이어 2024년 12월 Agentforce 2.0(2025년 2월 일반 제공), 2025년 6월 Agentforce 3, 2025년 10월 Agentforce 360을 내놓았다. Agentforce 360이 일반 제공될 무렵 Salesforce는 고객이 1만 2천 곳을 넘었다고 밝혔다. 초기 참조 고객인 Reddit은 지원 건의 46%를 사람 상담원에게 넘기지 않고 처리했고, 평균 응답 시간은 8.9분에서 1.4분으로 줄었다.[31] Microsoft도 2025년 내내 Microsoft 365 Copilot에 에이전트 기능을 넣는 병행 전략을 폈고, 2026년 초에는 전문화된 팀원 묶음인 'Copilot Cowork'를 선보였다.[1]
10.5. 딥 리서치와 장기 과제 에이전트
OpenAI의 Deep Research는 2025년 초 발표되었고 2025년 7월 ChatGPT Agent에 통합되었다. '몇 시간 동안 웹을 탐색한 뒤 보고서를 쓴다'는 패턴을 하나의 독자적 범주로 자리 잡게 했다. 구글은 2025년 12월 11일 Gemini 3 Pro 기반으로 재설계한 Deep Research 에이전트를 공개했고, 새 Interactions API로 개발자에게 제공했다. 같은 날 OpenAI는 GPT-5.2를 출시했다.[1]
METR의 시간 지평(time horizon) 방법론은 2025년 3월 발표되었으며, AI 에이전트가 50% 성공률로 자율 완료할 수 있는 과제의 길이를 측정하려 한다. METR의 2026년 업데이트는 50% 시간 지평이 약 7개월의 배가 시간(doubling time)으로 거의 지수적으로 늘고 있음을 보였다. 2020년 초기 GPT-3 에이전트의 9초에서 2026년 초 Claude Opus 4.5급 시스템의 약 14.5시간까지 늘었다. 2026년 개정판에서 METR의 과제 묶음은 170개에서 228개로 늘었다.[32][1]
앤트로픽의 경험적 자율성 연구는 약 100만 건의 도구 호출과 수십만 건의 코딩 세션을 바탕으로, 앤트로픽 API에서 소프트웨어 공학이 도구 호출의 약 50%를 차지했다고 밝혔다. 도구 호출의 약 73%는 여전히 사람이 개입하는 상태로 실행되었고, 되돌릴 수 없다고 판단된 호출은 약 0.8%뿐이었다.[10] 약 750개 세션의 경험을 넘기면 질적 변화가 나타났다. 사용자는 개별 행동을 승인하는 대신 멀리서 지켜보다 필요할 때 개입하는 쪽으로 옮겨 갔다.[10]
10.6. 현장 평가와 Claude Skills
OpenAI가 2025년 4월 10일 공개한 BrowseComp는 브라우징 에이전트를 위한 1,266문항 벤치마크로, 수십에서 수백 개의 웹사이트를 탐색해야 찾을 수 있는 "hard-to-find, entangled information", 곧 찾기 어렵고 얽힌 정보를 요구한다. 출시 시점에 브라우징 기능을 쓴 GPT-4o는 정확도 1.9%에 그쳤고, OpenAI의 Deep Research는 51.5%를 기록했다. 약 27배의 차이는 도구 접근보다 구조적 설계 선택이 제약 요인이었음을 시사했다.[33]
Sierra의 τ-bench는 소매와 항공 분야에서 시뮬레이션된 사용자와 대화하며 도구를 쓰는 고객 서비스 에이전트를 평가한다. 2025년 말 기준 Claude Sonnet 4.5가 항공 분야 분할에서 70.0%로 앞섰다. Sierra는 이후 τ²-bench(2025)와 τ³-bench를 공개했으며, τ³-bench에는 은행 분야와 음성 평가 방식이 추가되었다.[34]
SWE-bench Verified는 실제 GitHub 이슈에서 가져온 사람 검수 500개 과제 부분집합이다. 2025년 초 처음으로 한 시스템이 50%를 넘었고, 2026년 4월에는 상위 4개 시스템이 60%를 넘었으며 선두는 72.0%에 이르렀다. 같은 과제에서 사람 소프트웨어 엔지니어는 합리적인 시간 예산으로 약 90%를 기록하므로, 이 벤치마크는 아직 포화되지 않았다.[35]
일반 AI 어시스턴트를 평가하는 GAIA 벤치마크에서 사람은 92%를 기록한다. 2023년 최초 공개 당시 플러그인을 단 GPT-4는 15%에 그쳤다. H2O.ai의 h2oGPTe Agent는 2025년 75%에 도달해, 처음으로 합격 점수를 받은 시스템이 되었다.[36]
영국 AI 보안 연구소(UK AI Security Institute)와 Meridian Labs는 재현 가능한 LLM·에이전트 평가를 위한 오픈소스 Python 프레임워크 Inspect AI를 만들었다. Inspect는 METR, Apollo Research, 다른 정부 AI 안전 연구소, 주요 안전 연구소들이 채택했다. 내장 에이전트 기능으로는 ReAct, 다중 에이전트 구성, Claude Code·Codex CLI·Gemini CLI 같은 도구를 위한 외부 에이전트 브리지, Docker 기본 내장과 Kubernetes·Proxmox 어댑터를 갖춘 샌드박싱 툴킷이 있다. 프레임워크에는 200개 이상의 사전 제작 평가가 포함된다.[1][37]
2025년 10월 16일 앤트로픽은 skills-2025-10-02 API 베타로 Claude Skills를 출시했다. Skill은 에이전트가 과제에 맞는다고 판단할 때 동적으로 불러오는 지침, 스크립트, 자원을 담은 체계적 폴더다. PowerPoint, Excel, Word, PDF 생성용 사전 제작 Skill이 함께 나왔고, Skill은 Claude.ai, Claude Code, Claude Agent SDK, Claude 개발자 플랫폼 전반에서 작동한다. 개발자는 Skill을 한 번 만들어 어디서나 쓸 수 있다.[1]
11. 기업 활용 현황
2025년과 2026년 사이 에이전트 AI는 여러 산업에서 실험 단계를 벗어나 초기 운영 배포로 옮겨 갔다. Gartner는 2026년 말까지 기업 애플리케이션의 40%가 작업 특화 AI 에이전트를 포함할 것으로 예측했다. 2025년에는 그 비율이 5% 미만이었다.[38] 전 세계 AI 에이전트 시장은 2025년 약 78억 달러로 평가되었고, 2030년에는 526억 달러에 이를 것으로 전망된다(연평균 성장률 46.3%).[1]
2025년 1월 Gartner가 웨비나 참석자 3,412명을 대상으로 실시한 설문에서, 에이전트 AI에 상당한 투자를 했다는 조직은 19%, 보수적으로 투자했다는 조직은 42%였다. 투자를 하지 않았다는 조직은 8%였고, 나머지 31%는 관망하고 있었다.[38]
11.1. 고객 서비스와 소프트웨어 개발
고객 서비스는 에이전트 워크플로를 대규모로 가장 먼저 도입한 영역 중 하나다. 에이전트는 일상적인 문의를 처리하고, 환불을 진행하고, 계정 정보를 갱신하며, 복잡한 사례는 사람 상담원에게 넘긴다. 에이전트 배포의 64%에서 워크플로 자동화가 주된 용도다.[1] Salesforce의 Agentforce 360 참조 고객인 Reddit은 지원 건의 46%를 사람 상담원에게 넘기지 않고 처리했고, 해결 시간을 84% 줄였다.[31]
GitHub Copilot, Cursor, Claude Code, Devin 같은 에이전트형 코딩 도구는 가장 눈에 띄는 에이전트 워크플로 배포 사례다. 이들은 자동 완성을 넘어 여러 파일에 걸친 변경을 계획하고, 테스트를 실행하며, 오류 메시지를 해석해 테스트가 통과할 때까지 반복한다. 앤트로픽의 2026년 「Agentic Coding Trends Report」는 에이전트 AI가 소프트웨어 개발 수명주기를 재구성하고 있다고 밝혔다. 코드 생성 외에도 디버깅, 테스트, 문서화, 코드 리뷰를 코딩 에이전트가 점점 더 맡고 있다는 내용이다. 프로그래머가 아닌 사용자층도 바이브 코딩이라 불리는 방식으로 이 기술을 빠르게 받아들였다.[1]
11.2. 리서치, 금융, 데이터 분석
리서치 에이전트는 웹을 검색하고, 문서를 읽고, 발견 사항을 종합해 구조화된 보고서를 만든다. 경쟁 정보 분석, 시장 조사, 실사(due diligence), 과학 문헌 검토에 쓰인다. 2025년에는 OpenAI Deep Research, Gemini Deep Research, 웹 도구를 쓰는 Claude Code, Manus가 모두 이 시장을 겨냥했다.[1]
은행과 금융기관은 에이전트 워크플로를 고객 확인(KYC), 자금세탁방지(AML) 심사, 사기 탐지, 규제 준수에 쓴다. 맥킨지는 KYC/AML 워크플로에 에이전트 AI를 도입한 은행들이 200%에서 2,000%에 이르는 생산성 향상을 얻었다고 보고했다.[1]
데이터 분석 에이전트는 SQL 쿼리를 작성해 데이터베이스에서 실행하고, 결과를 해석하고, 시각화를 만들고, 서면 요약을 작성할 수 있다. 쿼리가 예상 밖의 결과를 내면 질의를 다시 짜며 답에 이를 때까지 반복한다. SQL 전문성은 없지만 데이터에서 답을 얻어야 하는 비즈니스 분석가에게 특히 가치가 크다.[1]
12. 주요 도전 과제
빠른 도입에도 에이전트 워크플로는 운영 환경에서 여러 과제에 직면한다. Gartner는 2027년까지 에이전트 AI 프로젝트의 40% 이상이 비용 상승, 불분명한 비즈니스 가치, 부적절한 위험 통제 때문에 취소될 것이라고 경고했다.[1]
12.1. 신뢰성, 비용, 지연 시간
데모와 신뢰할 수 있는 운영 시스템 사이의 간극은 크다. 다중 에이전트 구조는 규모가 커질수록 오케스트레이션 복잡성이 누적된다. 특히 오류 전파가 문제다. 체인에서 한 에이전트가 잘못된 출력을 내면 뒤따르는 에이전트는 그 결함을 알아채지 못한 채 위에 쌓는다. 환각된 도구 호출과 조작된 성공 주장은 억제하기 특히 어렵다는 것이 드러났다. 2025년과 2026년 Claude Code 관련 버그 보고에는 연구용 하위 에이전트가 존재하지 않는 파일, 잘못된 가격, 허구의 API 기능 같은 가짜 데이터를 반환한 사례가 기록되었다. 메인 에이전트가 그 결과를 믿고 계획을 세운 사례도 있었다. 일부 워크플로에서는 검증 없이 작업을 완료했다고 보고하는 '거짓 성공' 비율이 29~30%에 가까웠다.[1]
에이전트 워크플로는 단일 턴 상호작용보다 토큰을 훨씬 많이 소비한다. 다섯 번 반복하는 반성 루프는 한 번 생성하는 비용의 약 다섯 배가 든다. 다중 에이전트 시스템은 각 에이전트가 자체 LLM 호출을 하므로 비용이 더 커진다. 에이전트가 재시도나 재귀 호출을 많이 일으키는 예외 상황을 만나면, 토큰 비용, 도구 호출 비용, 연산 비용이 예측하기 어렵게 치솟을 수 있다.[1] 앤트로픽은 2025년 11월 Opus 4.5를 출시하며 이 문제를 겨냥해 가격을 67% 낮췄고, 이전 Opus 모델 대비 작업당 출력 토큰을 평균 76% 줄였다.[39]
다단계 워크플로는 본질적으로 단일 턴 응답보다 느리다. 단계마다 최소 한 번의 LLM 호출(보통 수백 밀리초에서 수 초)이 들고, 도구 호출(데이터베이스 질의, API 요청, 웹 검색)에도 시간이 걸린다. 10단계 워크플로는 30초에서 몇 분이 걸릴 수 있어 백그라운드 작업에는 괜찮지만 대화형 애플리케이션에는 문제가 된다. Cursor의 Composer 모델은 저지연 에이전트 코딩을 위해 명시적으로 학습되었으며, 대부분의 턴을 30초 안에 끝내는 것을 목표로 했다.[27]
12.2. 안전과 관측 가능성
메일 발송, 데이터베이스 수정, 코드 실행, 송금처럼 실제 세계에서 행동할 수 있는 에이전트에는 견고한 안전장치가 필요하다. 과제는 해로운 행동을 막으면서도 자동화의 가치를 없앨 만큼 제한하지 않는 가드레일을 만드는 것이다. 흔한 접근은 다음과 같다.[1]
- 에이전트가 쓸 수 있는 도구와 행동을 허용 목록으로 제한한다.
- 되돌릴 수 없거나 위험이 큰 행동에는 사람의 승인을 요구한다.
- 코드는 격리된 환경(샌드박스)에서 실행한다.
- 이상 탐지로 에이전트의 행동을 모니터링한다.
- 토큰 사용과 API 호출에 예산 한도를 설정한다.[1]
안전 인프라는 아직 성숙 중이다. 대부분의 운영 배포는 단일 안전 장치보다 프로그램적 가드레일과 사람의 감독을 결합해 쓴다.[1] 2025년에 공개된 UK AISI의 Inspect 샌드박싱 툴킷은 안전 커뮤니티의 주목할 만한 기여였다.[37]
에이전트가 무엇을 하고 왜 하는지 이해하기는 기존 애플리케이션 모니터링보다 어렵다. 전통적인 로그는 입력과 출력을 담지만, 에이전트에게 중요한 것인 도구 선택의 근거, 중간 계획, 의사 결정 경로, 각 단계에 영향을 준 맥락은 놓친다. 에이전트 관측을 위한 추적 인프라는 아직 미성숙하며, 계보(lineage) 추적이 제한적이라 사고 대응과 감사가 느려진다.[1]
13. 평가 방법
에이전트 워크플로 평가는 단일 턴 LLM 출력 평가와 다른 접근이 필요하다. 핵심 지표가 응답 품질에서 과제 완료와 과정 효율로 옮겨 간다.[1]
13.1. 핵심 지표
| 지표 | 측정 대상 | 중요한 이유 |
|---|---|---|
| 목표 완료율 | 에이전트가 과제를 처음부터 끝까지 성공적으로 완료한 비율 | 에이전트가 유용한지 가장 직접적으로 보여준다[1] |
| 도구 사용 효율 | 에이전트가 올바른 도구를 고르고 제대로 쓰는지 | 잘못된 도구 선택은 시간과 토큰을 낭비한다[1] |
| 단계 효율 | 최소 필요 단계 대비 실제 수행 단계 수 | 과도한 단계는 계획 부실이나 불필요한 재시도를 뜻한다[1] |
| 오류 회복률 | 사람의 개입 없이 오류에서 회복하는 빈도 | 자율 운영의 가치에 직접 영향을 준다[1] |
| 지연 시간(완료까지 걸리는 시간) | 과제 시작부터 완료까지의 총 실제 시간 | 워크플로가 의도한 용도에 실용적인지 결정한다[1] |
| 과제당 비용 | 과제 완료에 든 토큰과 도구 호출 비용의 총합 | 경제성 판단의 기준이 된다[1] |
| 안전 위반율 | 정의된 가드레일을 위반하는 행동의 빈도 | 배포의 위험 수준을 측정한다[1] |
| pass^k 신뢰도 | k번의 독립 시행에서 에이전트가 올바른 결과를 내는지 | 최선의 경우와 평균 행동 사이의 신뢰성 차이를 포착한다[1] |
13.2. 벤치마크
에이전트 능력을 겨냥한 벤치마크는 여럿 있다.[1]
- SWE-bench: 인기 있는 오픈소스 Python 저장소의 실제 GitHub 이슈로 평가한다. 에이전트는 이슈를 읽고, 코드베이스를 이해하고, 패치를 작성해 저장소의 테스트 모음을 통과해야 한다. SWE-bench Verified는 사람이 검수한 500개 과제 부분집합이며, 2026년 4월 선두 점수는 72.0%였다.[35]
- WebArena와 VisualWebArena: 항공권 예약, 전자상거래 계정 관리, 복잡한 웹사이트 탐색 같은 현실적인 웹 브라우징 과제로 평가한다.
- GAIA 벤치마크: 다단계 추론, 도구 사용, 웹 검색이 필요한 과제로 일반 AI 어시스턴트를 평가한다. H2O.ai의 h2oGPTe Agent는 2025년 75%에 도달했다.[36]
- HumanEval과 MBPP: 코드 생성 벤치마크로, 에이전트 워크플로(반복 생성, 테스트, 디버깅)와 함께 쓸 때 단발성 생성 대비 에이전트 패턴의 개선 효과를 측정한다.
- τ-bench(Sierra): 소매와 항공 분야에서 시뮬레이션 사용자와 함께 도구를 쓰는 고객 서비스 에이전트를 평가하며, pass^k 신뢰도 지표를 쓴다.[34]
- BrowseComp(OpenAI, 2025년 4월): 얽힌 정보 검색이 필요한 1,266개의 어려운 브라우징 문제로 구성된다.[33]
- Humanity's Last Exam: 포화 이전의 마지막 학술 벤치마크로 설계되었다. ChatGPT Agent는 2025년 7월 pass@1 41.6%를 기록했다.[22]
- METR 시간 지평: 에이전트가 50% 성공률을 보이는 최대 과제 길이를 보고하는 메타 평가다.[32]
- Context-Bench(Letta, 2025년 10월): 확장된 다단계 워크플로에서 장기 실행 컨텍스트를 유지하고 추론하는 능력을 평가한다.
- TRAIL(Patronus AI): 복잡한 의존성 사슬이 있는 다중 턴, 도구 사용 과제를 평가한다.[1]
13.3. 배포 후 평가
배포 전 벤치마크는 필요하지만 충분하지 않다. 배포 전 테스트는 실제 사용자 행동, 사용 패턴, 가장자리 사례의 다양성을 완전히 담지 못한다. 흔한 운영 평가 방식은 A/B 테스트(인간 기준선이나 다른 에이전트 구성과 성능 비교), 섀도 모드(에이전트를 사람 작업자와 나란히 돌리되 실제 행동은 하지 않음), 사람 검토 샘플링(정기적으로 무작위 샘플 출력을 사람 검토자가 채점함)이다.[1]
14. 다른 개념과의 관계
에이전트 워크플로는 AI의 여러 관련 영역과 이어져 있다.[1]
- 검색 증강 생성(RAG): RAG는 에이전트가 응답을 생성하기 전에 관련 문서를 검색하는 특정 형태의 도구 사용이다. 많은 에이전트 워크플로가 더 큰 과정의 한 단계로 RAG를 포함한다.
- 함수 호출: LLM이 구조화된 함수 호출을 출력하는 능력은 에이전트 워크플로에서 도구 사용을 가능하게 하는 기술적 기반이다.
- 사고의 연쇄 프롬프팅: 단일 LLM 호출 안의 사고의 연쇄 추론은 여러 호출에 걸쳐 에이전트 워크플로가 수행하는 다단계 계획의 전신이다.
- 강화 학습: 일부 에이전트 시스템은 강화 학습으로 의사 결정 정책을 시간에 따라 최적화하며, 어떤 도구를 언제 쓸지 배운다. Cursor의 Composer가 한 예로, 소프트웨어 공학 환경에서 강화 학습으로 학습되었다.[27]
- 로봇 프로세스 자동화(RPA): RPA는 소프트웨어 인터페이스와의 스크립트화된 상호작용으로 반복 작업을 자동화한다. 에이전트 워크플로는 고정된 스크립트를 따르지 않고 각 단계에서 에이전트가 무엇을 할지 스스로 결정한다는 점이 다르다.
- 바이브 코딩: 에이전트형 코딩 워크플로 위에 얹힌 문화적·제품적 계층이다. 비프로그래머가 자연어로 원하는 것을 설명하면 에이전트가 작동하는 앱을 만든다.[1]
15. 향후 방향
MCP와 A2A를 중심으로 한 프로토콜 수렴은 다중 에이전트 시스템의 연동 부담을 줄이고 있다. 리눅스 재단 산하 Agentic AI Foundation은 이제 앤트로픽을 통한 MCP와 OpenAI의 AGENTS.md를 함께 관리하며, AWS, 앤트로픽, Block, Bloomberg, Cloudflare, Google, Microsoft, OpenAI의 후원을 받는다.[17] 이 프로토콜이 성숙하면 상호 운용 가능한 에이전트 시스템을 만드는 일도 훨씬 쉬워질 것으로 보인다.[1]
조직들은 단일체형 만능 에이전트 대신 전문화된 에이전트 팀을 편성하는 '마이크로서비스' 방식으로 옮겨 가고 있다. Forrester와 Gartner는 모두 2026년을 다중 에이전트 시스템의 돌파의 해로 규정했다.[38] 비용 절감도 활발히 연구되는 분야다. 단순한 질의는 더 작고 저렴한 모델로 보내고 복잡한 추론 단계에만 최첨단 모델을 쓰는 라우팅 기법은, 품질을 해치지 않고 비용을 크게 줄일 수 있다. 앤트로픽은 2025년 11월 Opus 4.5 출시에서 가격을 67% 내리고 동등한 과제의 출력 토큰을 76% 줄였다.[39][1]
개선된 평가 및 관측 도구는 데모 품질과 운영 품질 시스템 사이의 간극을 좁히고 있다. UK AISI의 Inspect 프레임워크, METR의 시간 지평 방법론, 앤트로픽의 경험적 자율성 연구가 초기 사례다. Gartner는 2026년 말까지 기업 애플리케이션의 40%에 내장형 AI 에이전트가 포함될 것이며, 2028년까지 일상 업무 결정의 최소 15%가 에이전트 AI를 통해 자율적으로 이뤄질 것이라고 예측했다. 이는 2024년의 0%에서 늘어나는 수치다.[38] 이 예측이 맞을지는 신뢰성, 비용 관리, 안전, 오케스트레이션 프레임워크의 성숙이 계속 진행되는지에 달려 있다.[1]
각주·출처 39개
- ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12 ↩13 ↩14 ↩15 ↩16 ↩17 ↩18 ↩19 ↩20 ↩21 ↩22 ↩23 ↩24 ↩25 ↩26 ↩27 ↩28 ↩29 ↩30 ↩31 ↩32 ↩33 ↩34 ↩35 ↩36 ↩37 ↩38 ↩39 ↩40 ↩41 ↩42 ↩43 ↩44 ↩45 ↩46 ↩47 ↩48 ↩49 ↩50 ↩51 ↩52 ↩53 ↩54 ↩55 ↩56 ↩57 ↩58 ↩59 ↩60 ↩61 ↩62 ↩63 ↩64 ↩65 ↩66 ↩67 ↩68 ↩69 ↩70 ↩71 ↩72 ↩73 ↩74 ↩75 ↩76 ↩77 ↩78 ↩79 ↩80 ↩81 ↩82 ↩83 AI Wiki: Agentic workflow (2026-10-01 수정본) · CC BY 4.0 · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 Last week, I described four design patterns for AI agentic workflows that I believe will drive significant progress this year: Reflection, Tool use, Planning and Multi-agent collaboration · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 Building effective agents · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 AI Agentic Workflows Could Drive More AI Progress Than Even the Next Generation of Foundation Models · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 I think AI agentic workflows will drive massive AI progress this year · 확인 2026-10-11
- ↩1 ↩2 ReAct: Synergizing Reasoning and Acting in Language Models · 확인 2026-10-11
- ↩1 ↩2 Reflexion: Language Agents with Verbal Reinforcement Learning · 확인 2026-10-11
- ↩1 What are BabyAGI and AutoGPT, the new A.I. tools Silicon Valley is buzzing about? · 확인 2026-10-11
- ↩1 Gartner Predicts 40% of Enterprise Apps Will Feature Task-Specific AI Agents by 2026, Up from Less Than 5% in 2025 (AI Wiki 인용) · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 ↩5 Measuring AI Agent Autonomy · 확인 2026-10-11
- ↩1 Agentic AI Strategy · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 Workflows and agents · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 Semantic Kernel + AutoGen = Open-Source Microsoft Agent Framework · 확인 2026-10-11
- ↩1 ↩2 ↩3 Building agents with the Claude Agent SDK · 확인 2026-10-11
- ↩1 ↩2 ↩3 Create custom subagents · 확인 2026-10-11
- ↩1 ↩2 ↩3 Introducing the Model Context Protocol · 확인 2026-10-11
- ↩1 ↩2 ↩3 Linux Foundation Announces the Formation of the Agentic AI Foundation (AAIF), Anchored by New Project Contributions Including Model Context Protocol (MCP), goose and AGENTS.md · 확인 2026-10-11
- ↩1 Announcing the Agent2Agent Protocol (A2A · 확인 2026-10-11
- ↩1 Linux Foundation Launches the Agent2Agent Protocol Project to Enable Secure, Intelligent Communication Between AI Agents · 확인 2026-10-11
- ↩1 ↩2 Introducing computer use, a new Claude 3.5 Sonnet, and Claude 3.5 Haiku · 확인 2026-10-11
- ↩1 Introducing Operator · 확인 2026-10-11
- ↩1 ↩2 ↩3 Introducing ChatGPT agent: bridging research and action · 확인 2026-10-11
- ↩1 Google rolls out Project Mariner, its web-browsing AI agent · 확인 2026-10-11
- ↩1 Project Mariner · 확인 2026-10-11
- ↩1 Claude Code 2.0 release notes and changelog · 확인 2026-10-11
- ↩1 Anthropic's Claude Code is having its 'ChatGPT' moment · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 Introducing Cursor 2.0 and Composer · 확인 2026-10-11
- ↩1 Introducing Agent 3: Our Most Autonomous Agent Yet · 확인 2026-10-11
- ↩1 Introducing GPT-5.2-Codex · 확인 2026-10-11
- ↩1 The 'First AI Software Engineer' Is Bungling the Vast Majority of Tasks It's Asked to Do · 확인 2026-10-11
- ↩1 ↩2 Welcome to the Agentic Enterprise: With Agentforce 360, Salesforce Elevates Human Potential in the Age of AI · 확인 2026-10-11
- ↩1 ↩2 Measuring AI Ability to Complete Long Tasks · 확인 2026-10-11
- ↩1 ↩2 BrowseComp: A Simple Yet Challenging Benchmark for Browsing Agents · 확인 2026-10-11
- ↩1 ↩2 τ-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains · 확인 2026-10-11
- ↩1 ↩2 SWE-bench: Can Language Models Resolve Real-World GitHub Issues? · 확인 2026-10-11
- ↩1 ↩2 H2O.ai Tops the General AI Assistant (GAIA) Test · 확인 2026-10-11
- ↩1 ↩2 The Inspect Sandboxing Toolkit: Scalable and secure AI agent evaluations · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 Top Strategic Technology Trends for 2025: Agentic AI (AI Wiki 인용) · 확인 2026-10-11
- ↩1 ↩2 Introducing Claude Opus 4.5 · 확인 2026-10-11