중국 AI 개발사가 내놓은 모델 중 안전성 평가 결과를 외부에 밝힌 경우는 극소수였다. 현지시간 9일 나온 세미애널리시스의 보고서는 평가 결과가 확인된 모델이 3.6%(31개)이고, 이 가운데 출시 시점 또는 그 이전에 공개된 모델은 1.1%(9개)라고 밝혔다.[1]
RoadMaster19 / Wikimedia Commons · CC BY 4.0 · 원본 · 크기 조정
조사 대상은 2021년부터 2026년 9월 15일까지 나온 모델 857개다. 이 중 모델 이름과 구체적인 검증 결과를 짝지어 확인할 수 있는 모델은 31개(3.6%)였고, 출시 시점 또는 그 이전에 결과가 나온 모델은 9개(1.1%)였다. 나머지 813개(94.9%)는 공개된 평가 결과를 찾지 못했다.[1]
출시 뒤에 결과를 내놓은 사례는 출시일에서 중앙값 42일, 가장 늦은 경우 349일이 지나서였다. 추론 모델은 93%가 공개된 평가 결과를 갖추지 못했다.[1]
기업별 공개 현황
조사 기업은 Alibaba, ByteDance, Tencent, Baidu, DeepSeek에 더해 Moonshot AI, Z.ai(지푸 AI), MiniMax, StepFun 등 모두 9곳이다. 이 가운데 안전성 평가 공개가 일상적 절차로 자리 잡은 기업은 없었다.[1]
| 기업 | 공개 현황 |
|---|---|
| Alibaba | 238개 모델 중 7개 공개 |
| Tencent | 133개 모델 중 1개 공개 |
| Z.ai | 2022년 이후 매년 평가 결과를 낸 유일한 기업 |
| DeepSeek | V3는 출시 시점에 평가 자료 공개, R1과 이후 주요 모델은 같은 수준의 공개 미확인 |
세미애널리시스는 미국 주요 기업이 프론티어 모델 출시 전후에 상세한 시스템 카드와 검증 결과를 선제적으로 공개하는 관행과 대조적이라고 설명했다.[1]
집계 방식과 검증의 공백
조사는 각 회사가 낸 모델 카드, 기술 보고서, 출시 자료를 근거로 했다. 내부에서 시험했어도 결과를 내놓지 않았으면 실적에 넣지 않았고, 안전 훈련을 했다거나 평가를 거쳤다는 식의 두루뭉술한 문구도 인정하지 않았다. 살핀 항목은 유해한 응답, 탈옥 방어, 유해성, 개인정보 보호, unsafe 요청을 거절하는 능력, 위험한 기능을 수행하는 능력이다.[1]
세미애널리시스는 공개율이 낮다고 해서 중국 기업이 테스트를 하지 않았다는 뜻은 아니라고 설명했다. 다만 해킹 공격, 생물 안전 위협, 사람이 AI를 통제하지 못하게 될 가능성까지 아우르는 위험 평가의 결과를 공개한 최첨단 텍스트 모델이 출시되지 않았다고 보고서는 지적했다. 사이버 보안 평가 일부는 실제 공격 역량보다 안전한 코드를 짜는 수준을 재는 데 집중했다.[1]
규제와 정책 기조
중국은 콘텐츠 표시 의무와 윤리 심사, 에이전트 보안 지침 같은 제도를 마련했다. 세미애널리시스는 학습에 투입한 규모나 성능 단계에 맞춰 위험 평가와 공개를 요구하는 틀이 부족하다고 분석했다. 규제의 초점도 모델 자체의 위험보다 서비스가 내보내는 콘텐츠와 이용자에게 돌아가는 파장에 있다는 것이다.[1]
9월 14일 공개된 'AI 안전 거버넌스 프레임워크 3.0'은 AI가 허락 없이 시스템 통제권이나 외부 자원을 손에 넣는 일, 평가자를 기만하며 안전장치를 피해 가는 일을 위험으로 적었다. AI가 사람의 예측과 통제 밖으로 나갈 수 있다는 점에도 주의를 당부했다.[1]
세미애널리시스는 이 문서가 AI 혁신과 발전을 가장 앞선 원칙으로 둔 점을 근거로, 실제 정책 기조가 안전보다 개발 속도 쪽에 기울었다고 봤다. 또 AI 거버넌스가 나아가는 속도는 놀랄 만큼 더디며 개발자의 자율 통제에 기대는 것은 환상이라고 지적하고, 중국이 지금까지 그 길을 택해 왔다고 짚었다.[1]