AI 에이전트 실행 하네스는 모델이 한 번 응답한 뒤 작업을 끝내지 않고, 도구 결과를 다시 전달하고 다음 단계를 이어 가도록 주변에서 관리하는 소프트웨어를 가리킨다. 이 용어에는 업계의 단일 표준 정의가 정해져 있지 않으므로 여기서는 에이전트 실행을 둘러싼 조정 구조라는 의미로 사용한다. [1] [2] [3]
어디에서 만나나
하네스는 모델 호출, 지시와 기록의 전달, 도구 연결, 응답 및 오류 처리, 반복 종료 조건을 관리할 수 있다. 실행 환경은 파일이나 코드에 접근할 수 있는 범위를 통제하고, 권한 설정은 어떤 작업을 허용할지 정한다. 시스템에 따라 저장 상태, 재시도, 로그, 사용자 확인이 하네스의 일부로 포함될 수 있다. [1] [2] [3]
장시간 작업에서는 한 번의 문맥 범위를 넘어 작업이 이어질 수 있어 진행 상황과 다음 행동을 기록하는 설계가 중요하다. Anthropic의 장시간 에이전트 안내와 Cloudflare의 하네스 설명은 모델 주변의 도구, 상태, 실행 루프가 안정적인 작업에 미치는 역할을 각각 다룬다. 구현 방식은 제품마다 다르다. [2]
작동과 사용 예
예를 들어 Codex가 코드를 수정하는 동안, 주변 실행 환경은 파일 읽기와 쓰기, 명령 실행 가능 범위를 정할 수 있다. 하네스는 명령 결과를 모델에 돌려주고 계속할지 멈출지 처리한다. Claude Code 같은 도구도 유사하게 에이전트 동작을 주변 기능과 결합하지만 세부 구조는 공식 제품 설명을 확인해야 한다.
실행 하네스는 도구 요청이 실패했을 때 재시도할지, 사용자를 부를지, 작업을 종료할지 정하는 데도 쓰일 수 있다. 긴 작업에서는 다음 단계가 무엇인지와 지금까지 확인한 결과를 기록하면 중단 뒤에도 이어 갈 수 있다. 이런 지원은 실행의 일관성을 높이지만, 모델이 만든 판단이나 결과 자체를 검증된 사실로 바꾸지는 않는다. [1] [2] [3]
비슷한 개념과 주의점
‘평가 하네스’라는 말은 테스트 질문과 채점 기준을 사용해 에이전트 성능을 반복 측정하는 별도 용례다. 실행 하네스는 작업을 진행시키고, 평가 하네스는 결과를 비교해 품질을 측정하는 쪽에 초점을 둔다. 에이전트, 도구 사용, 컨텍스트 창이 하네스의 지원을 받을 수 있지만 하네스가 모델의 오류를 없애지는 않는다. [1] [2] [3]
출처와 확인
- Harnesses · 공식 자료 · 확인 2026-10-08
- Effective harnesses for long-running agents · 공식 자료 · 확인 2026-10-08
- Demystifying evals for AI agents · 공식 자료 · 확인 2026-10-08