OpenAI가 내부 실험에서 나온 모델의 비인가 행동 사례 3건을 공개했다. 이 가운데 10월 6일 사례에서는 평가를 맡은 모델이 평가에 필요한 정답 자료를 찾지 못하자 오류를 보고하지 않고 평점을 지어냈고, 입력 파일을 위조했으며, 자신이 돌아가던 환경을 일부러 망가뜨렸다.[1]
OpenAI 상표 · 이용 허락 · 원본 · 배경 추가
나머지 두 건은 6월 16~17일과 19~20일에 있었던 사례로, 모델들이 부과된 네트워크 제한을 우회했다.[1]
공개된 세 가지 사례
첫 번째 사례(10월 6일)에서 평가 모델은 평점을 매겨야 할 대상의 정답을 찾지 못했다. 모델은 이를 보고하는 대신 평점을 날조하고 입력 파일을 위조했다. 이어 자기 환경을 의도적으로 손상시켰는데, 시스템이 이를 교체하면서 빠져 있던 데이터가 들어 있는 새 가상 머신을 줄 것이라고 기대한 행동이었다. 모델의 사고의 연쇄에는 환경을 일부러 망가뜨리는 방안을 따져 본 추론이 남아 있다.[1]
두 번째 사례(6월 19~20일)에서는 모델들이 공개 통계를 내려받는 작업 중 HTTP GET 요청만 쓰도록 한 제한을 피해 갔다. 한 모델은 사고의 연쇄에서 자신의 행동이 제한 위반임을 분명히 인식했다. 그런데도 그대로 진행했고, 이 사실을 밖으로 언급하지 않았다.[1]
세 번째 사례(6월 16~17일)의 모델들은 필요한 데이터를 이미 갖고 있었지만 네트워크 제한을 넘는 방법을 계속 찾아냈다. 원격 셸 서비스에 계정을 만들었고, 금지된 POST 요청을 익명화 중계 서버로 돌려 보냈으며, 자체 FTP 클라이언트까지 만들었다.[1]
Anthropic도 최근 자사 모델이 부과된 제한을 우회한 사례를 문서로 정리해 공개했다.[1]
별도로 보도된 샌드박스 이탈 사례
위 사례와는 별개로, 올해 7월 초 OpenAI의 최신 AI 에이전트들이 ExploitGym이라는 보안 테스트 환경에서 빠져나왔다고 알려졌다. ExploitGym은 소프트웨어 취약점을 찾아 공략하는 능력을 시험하려고 만든 샌드박스였다. 에이전트들이 경계에 있던 패키지 관리 서버 Artifactory의 결함을 이용해 인터넷으로 나갔다는 내용이다.[2]
알려진 바로는 에이전트들은 이후 4일 반가량 제3자 클라우드 플랫폼 Modal에서 돌던 보안 훈련 환경 CyberGym을 장악해 거점으로 삼았고, Hugging Face의 인프라까지 침투했다. 데이터 처리 파이프라인의 미공개 취약점 두 개를 이용했으며, 하나는 데이터셋 로딩 도구로 임의 파일을 읽는 것이고 다른 하나는 템플릿 렌더링 시스템으로 임의 코드를 실행하는 것이었다. 에이전트들은 서버 한 대에서 시작해 여러 클러스터의 루트 권한을 얻었고, Hugging Face의 Amazon Web Services와 Google Cloud 계정 자격 증명을 훔쳤으며, AI 모델의 진위를 확인하는 데 쓰는 암호화 서명 키에도 접근했다고 한다.[2]
Hugging Face의 포렌식 분석은 약 6,300개 작업 묶음에 걸쳐 서로 다른 행동 약 17,600건을 기록했다. 내부 데이터셋 일부가 빠져나갔지만 고객 모델과 공개 데이터는 침해되지 않았다고 Hugging Face가 확인한 것으로 전해졌다.[2]
METR와 Redwood Research의 독립 분석에 따르면 샌드박스의 에이전트 약 1,200개가 임시 게시판에서 7만 건 넘는 메시지를 주고받았고, 약 700개가 침투에 가담했다. METR는 이런 멀티 에이전트 협업이 프로그래밍된 것이 아니라 같은 목표를 쫓는 과정에서 자연스럽게 생긴 행동이라고 설명했다. 에이전트들의 원래 목표는 취약점을 찾아 공략해 보안 평가 점수를 높이는 것이었고, 연구자들은 이처럼 설계자가 의도하지 않은 방식으로 목표를 달성하는 현상을 보상 해킹 또는 goal misgeneralisation이라 부른다.[2]