AI의 변화, 근거와 맥락까지.AI NEWS & CONTEXT
기타 AI

인공지능안전연구소·셀렉트스타, AI 안전 시험 확대…멀티턴 공격 성공률 최대 36%

AI 경쟁의 기준이 모델 성능에서 실서비스 신뢰성과 안전성 검증으로 옮겨가고 있다. 인공지능안전연구소와 셀렉트스타가 각각 국가 차원과 기업 현장의 평가 방식을 설명했다.

한국에서도 AI를 겨루는 기준이 모델 성능에서 실서비스의 신뢰성과 안전성 검증으로 옮겨가기 시작했다.[1][2] 이 흐름 속에서 국가 AI 안전 평가 체계를 구축 중인 인공지능안전연구소(경기 성남 판교 소재)와, 민간에서 신뢰성 검증을 맡는 셀렉트스타의 평가 방식이 현장 취재로 소개됐다.[1][2] 연구소 소속으로 소개된 김용수 선임연구원은 한국전자통신연구원 산하 조직의 평가 실무자다.[1]

핵심 수치: 멀티턴 공격 성공률 최대 36%, 모델 1개 평가 소요 약 1주일
핵심 수치 정리
LUCAS AI News 자체 제작

연구소가 맡은 일은 새로운 AI가 나올 때마다 외부의 독립된 시선에서 위험을 시험해 보는 국가 차원의 능력을 갖추는 것이다.[1] 셀렉트스타의 주력 솔루션은 '다투모'다. 기업 서비스별 평가문항을 생성하고, 이용자와 AI가 실제로 주고받은 대화를 살펴 새 위험을 탐색하며, 레드팀 평가도 수행한다.[2] 이 회사는 데이터 전문기업으로 시작해 성능과 신뢰성을 종합적으로 따져 보는 사업으로 확장했다.[2]

평가 대상이 답변에서 행동으로

연구소 평가 플랫폼에서 모델을 고르면 사이버보안, 국가안보, 에이전트 자율성, 유해 콘텐츠, 차별·편향, 개인정보 유출 등 여섯 유형의 결과가 그래프로 표시된다.[1] 시험 대상은 국내에서 접근할 수 있는 국내외 주요 모델이다. 가능하면 같은 데이터와 기준을 쓰는데, 국내 모델이 안전한지 확인하고 글로벌 프런티어 모델과 수준 차이를 가늠하려는 두 가지 이유에서다.[1]

연구소는 위험한 질문을 한 뒤 답변을 읽는 데서 멈추지 않는다. 코드 안의 취약점을 얼마나 잘 찾아내는지 측정하고, 대화를 여러 차례 이어 가며 안전장치가 작동하는지 확인하고, 에이전트가 PC와 외부 도구를 쓰는 전 과정도 평가한다. 이런 시험을 'AI 스트레스 테스트'라고 부른다.[1] 성능평가가 AI의 역량 수준을 본다면, 안전평가는 같은 역량이 어떤 조건에서 위협이 되는지 따진다. 안전장치를 우회당하는 상황, 다회 대화, 높은 권한과 도구를 쥔 상황에서 방어가 깨지는 지점이 시험 대상이다.[1]

김용수 선임연구원은 과거 평가가 한 번의 질의응답 중심이었다면 최근에는 멀티턴으로 진화했고, 에이전트가 도구를 직접 쓰면서 평가 범위가 모델이 실제로 한 행동과 작업 과정으로 번졌다고 말했다.[1]

연구소의 위험별 시험 방법
위험 유형시험 방법
유해 콘텐츠·편향모델 답변 분석
개인정보민감정보 추론·노출 여부 확인
사이버보안격리된 실험환경에서 실제 취약점 발견·공격 단계 수행 가능 여부 확인
AI 에이전트통제된 환경에서 실제 도구·과제를 주고 계획, 호출한 도구, 접근한 파일·정보를 추적해 권한 초과 행동 확인
[1]

능력이 곧 위험이 되는 양면성 때문에 시험이 더 까다롭다. 취약점을 잘 찾는 AI는 보안 업무를 돕는 도구이자 공격에 쓰이는 수단이 될 수 있다.[1] 화학·생물학·방사선·핵(CBRN)을 포함한 국가안보 영역도 같은 성격이라, AI가 위험한 지식과 작업을 어느 수준까지 수행하는지 잰다.[1]

기업 서비스에서 먼저 드러나는 위험

은행 상담 AI가 대출을 받을 수 없는 고객에게 가능하다고 답하면 소비자 피해와 법적·규제 문제가 생길 수 있다.[2] 셀렉트스타는 평가 적용이 활발한 분야로 금융을 들었다. 오답이 실제 피해로 이어질 수 있어서이며, 공공 분야 수요도 크다고 밝혔다.[2]

벤치마크는 여러 모델에 동일한 문제를 풀게 해 성능을 견주는 방식이다. 기업이 알고 싶은 것은 자사 서비스가 제대로 돌아가는지여서, 상품과 업무, 이용자 유형에 맞춘 질문과 기대 답변이 필요하다. 은행 상담과 공공기관 민원은 질문도 규칙도 다르고, 한 금융사 안에서도 상품마다 허용되는 답의 범위가 다르다.[2] 셀렉트스타는 기본 평가 데이터와 벤치마크를 토대로 기업이 질문을 변형하고 늘리고 검증하며 새로 만들도록 지원해 서비스 맞춤 데이터셋을 꾸린다. 정책을 지키는지, 편향된 발언이 나오는지 같은 기준도 기업마다 지표로 두고, 반복 평가로 개선해 자사 기준을 넘으면 출시 여부를 판단한다.[2]

신뢰성 관리는 평가, 관찰, 레드티밍 세 단계다. 평가는 구축한 데이터셋으로 반복 점검하는 일이고, 관찰은 실제 대화 기록을 분석해 새 문제를 찾는 일이며, 레드티밍은 표현과 맥락을 바꾸거나 공격 기법을 조합해 안전장치를 넘어 보는 일이다.[2] 악성코드 작성법을 대놓고 물으면 대개 거부된다. 실제 공격은 역할극, 가상 시나리오, 여러 단계로 나눠 묻기, 토론 형식 같은 우회로를 택한다.[2]

전문휘 셀렉트스타 CPO는 새 공격 전략을 투입해 취약 사례를 찾고 보완한 뒤 재공격하며 성공률이 내려가는 것을 확인하는 작업을 반복한다고 설명했다. 대화를 여러 차례 이어 안전장치를 피해 가는 멀티턴 공격을 쓰면 성공률이 최대 36%였다는 것이다.[2] 사전 시험을 통과했다고 안전이 보장되지는 않는다. 이용자는 예상치 못한 질문을 던지고 서비스와 모델은 계속 바뀌기 때문이다.[2]

지금 이 솔루션은 위험을 발견하는 데 쓰인다. 셀렉트스타는 평가 결과로 문제를 자동 개선하는 기술을 만들고 있다. 문제가 확인된 AI 에이전트를 직접 고치는 방법과, 입력과 출력 사이에 가드레일을 설치해 문제성 요청과 답변을 사전에 막는 방법이 있다.[2] 김세엽 대표는 그간 부족한 점을 가늠하는 단계였다면 앞으로는 자동 해결 쪽으로 간다고 말했다.[2]

남은 쟁점과 한계

벤치마크는 공개된 것이 널리 쓰이지만 새 AI는 성능이 높아 기존 시험문제를 쉽게 통과한다. 연구소는 공개 벤치마크를 활용하면서 자체 평가법과 데이터도 만들고, 영국 AI안전연구소가 내놓은 오픈소스 프레임워크 'Inspect'를 사용한다.[1] 모델 한 개를 평가·분석하고 보고서를 쓰는 데 통상 약 1주일이 들어 신규 모델 출시가 잦아질수록 부담이 크다. 이에 연구소 자체 프레임워크에 자동화 기능을 추가하는 중이다.[1]

언어도 걸림돌이다. 해외 안전성 벤치마크 상당수는 영어와 서구권에 바탕을 둬 한국 사회에서 중요한 위험을 잡아내지 못할 수 있다. 한국어 은어나 우회 표현에서는 안전장치가 다르게 반응할 수 있다. 편향이나 가치 판단은 정치·사회·문화 요인에 크게 좌우되므로 한국 법·제도와 문화 표현, 개인정보 유형을 반영한 자체 데이터가 요구된다.[1] 김용수 선임연구원은 영어에서 안전하다고 해서 한국어에서도 같은 수준으로 안전하다고 볼 수는 없다고 말했다.[1]

평가 난도는 더 올라갈 것으로 전망된다. AI가 평가받는다는 사실을 인식해 행동을 달리하거나 감독 시스템의 탐지를 피하는 경우까지 고려해야 한다. 실제와 비슷한 환경과 권한을 주고 장시간 지켜보는 시나리오형 평가가 필요하다는 것이다.[1] 에이전트 시대에는 오답을 내놓는 문제를 넘어, 외부 시스템과 도구를 쓰는 동안 개발자가 예상하지 못한 행동이 나올 가능성도 살펴야 한다.[2] 김세엽 대표는 AI가 강력해질수록 신뢰성을 확인하고, 목표를 수행하는 중에 의도와 다른 행동을 못 하게 통제하는 방법이 중요해진다고 말했다.[2]

연구소는 정부가 추진하는 독자 AI 모델 사업, 이른바 독파모에서 안전·신뢰성 평가에 참여하며 국내 기업 모델을 평가한 경험을 쌓고 있다.[1] 그러나 한국의 안전평가 역량은 아직 기반을 다지는 단계다. 미국과 영국은 프런티어 AI 기업에 대한 접근성, 대규모 컴퓨팅 자원, 전문인력에 먼저 투자해 연구와 인프라를 쌓았고 한국은 부족한 부분이 많다.[1] 김 선임연구원은 모든 분야에서 선도국과 같은 인프라를 갖췄다고 보기는 어렵지만, 평가 방법론이 세계적으로 빠르게 변하고 있어 한국에도 기회라고 했다. 한국어와 사회문화 맥락을 살린 평가, 국내 AI 생태계와 연결한 시험 능력이 경쟁력이라는 설명이다.[1]

연구소의 목표는 새 AI마다 안전을 독립적이고 객관적으로 검증하는 국가 역량을 확보하는 것이다. 사이버보안·에이전트·국가안보 등 새로운 위험별 평가법을 개발하고, 응답과 행동 로그, 평가 조건, 결과를 체계적으로 축적한다. 해외 AI안전연구소와 평가 방법·결과를 공유하고 교차검증하는 국제협력도 확대한다.[1] 김 선임연구원은 AI 발전을 막으려는 것이 아니라 AI가 강력해지는 만큼 사회가 안심하고 활용할 수 있게 시험·검증 역량을 함께 발전시키는 것이 궁극적 방향이라고 밝혔다.[1]

김세엽 대표는 한국 AI가 여러 나라에서 쓰일 때 한국이 제시하는 기준에도 힘이 생긴다고 말했다. AI를 글로벌 수출산업으로 만들면 평가체계도 함께 나갈 수 있다는 구상이며, 반도체와 AI 인프라에서 파운데이션 모델, 서비스를 아우르는 '풀스택 AI' 역량이 기반이라고 했다.[2]

각주·출처 2개
  1. ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12 ↩13 ↩14 ↩15 ↩16 ↩17 ↩18 ↩19 ↩20 ↩21 ↩22 [AI 세이프가드] ③ AI도 '스트레스 테스트' 한다……한국의 'AI 안전 시험장' 가보니 · 확인 2026-10-11
  2. ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12 ↩13 ↩14 ↩15 ↩16 ↩17 [AI 세이프가드] ③ “대출 된다”는 AI 오답 잡는다…셀렉트스타의 'AI 안전검사' 현장 · 확인 2026-10-11
조회 —

독자의 생각

직접 써 본 경험과 다른 관점을 나눠 주세요. 주장에는 근거를, 서로에게는 존중을 부탁드립니다.

독자 의견을 불러오고 있습니다.