AI의 변화, 근거와 맥락까지.AI NEWS & CONTEXT
AI 사전 · 안전·권리·사회

AI 안전

AI 안전은 인공지능 시스템에서 받아들일 수 없는 피해를 예방하거나 줄이는 연구와 실천이다. 기술 연구, 시스템 공학, 평가, 운영 통제, 조직 절차, 공공 거버넌스를 포괄하며, 어떤 피해가 얼마나 자주, 어떤 심각도로 일어날 수 있는지와 그 추정을 뒷받침하는 증거를 따진다.

AI 안전
분야인공지능 시스템의 받아들일 수 없는 피해를 예방·감소하는 연구와 실천[1]
다루는 범위기술 연구, 시스템 공학, 평가, 운영 통제, 조직 절차, 공공 거버넌스[1]
주요 틀NIST 인공지능 위험 관리 체계(AI RMF 1.0)[2]
대표 국제 보고서국제 AI 안전 보고서 2026[3]

쉽게 말하면, AI 안전은 인공지능이 사람과 사회에 받아들이기 어려운 해를 끼치지 않도록 막거나 줄이는 연구와 실천이다. 모델을 기술적으로 점검하는 일뿐 아니라 시험, 운영상의 통제, 조직 절차, 공공 규제까지 함께 다룬다.[1]

1. 개요

AI 안전은 인공지능 시스템에서 받아들일 수 없는 피해를 막거나 줄이는 연구와 실천이다. 기술 연구, 시스템 공학, 평가, 운영 통제, 조직 절차, 공공 거버넌스를 모두 포함한다. 안전 분석은 무엇이 잘못될 수 있는지, 누가 또는 무엇이 피해를 입을 수 있는지, 결과가 얼마나 일어날 법하고 얼마나 심각할 수 있는지, 그 추정을 뒷받침하는 증거는 무엇인지, 어떤 통제로 위험을 정당화할 수 있는 허용 범위 안에 둘 수 있는지를 묻는다. 미국 국립표준기술연구소(NIST)는 AI 위험 관리를 AI 시스템을 설계·개발·배포·사용하는 조직의 수명 주기 활동으로 본다.[2] 이런 시스템 수준의 관점은 안전 공학에서도 나온 것으로, 안전 공학에서는 개별 부품이 고장 나지 않았더라도 안전하지 않은 상호작용과 부적절한 통제 때문에 사고가 날 수 있다.[4][1]

현대 AI 안전에는 보편적으로 구속력 있는 하나의 정의도, 합의된 하나의 문제 목록도 없다. 2015년 연구 의제는 검증, 타당성, 보안, 통제에 관한 기술 문제를 경제적·법적·윤리적 문제와 함께 묶었다.[5] 2016년 의제는 부정적 부작용, 보상 해킹, 확장 가능한 감독, 안전하지 않은 탐색, 분포 변화 등 머신러닝 실패 유형을 구체적으로 제시했다.[6] 이후 로드맵은 선별된 기술 연구를 견고성, 모니터링, 정렬, 체계적 안전으로 묶고, 장기적 위험과 롱테일 위험을 명시적으로 강조했다.[7] 이 분류들은 서로 겹치지만 어느 것도 분야 전체를 포괄하지 못한다.[1]

따라서 안전은 하나의 벤치마크, 학습 기법, 정책이 제공하는 이진적 속성이 아니다. 특정 시스템, 용도, 환경, 기간, 결과 집합에 대한 주장이다. 한 모델이 한 시험에서 잘 작동한다는 증거는 제한된 주장을 뒷받침할 수 있지만, 그 모델을 기반으로 만든 모든 배포가 안전하다는 점을 입증하지는 않는다.[1]

2. 범위와 용어

이 문서에서 AI 안전은 AI 시스템의 수명 주기 전반에서 피해를 식별·평가·감소하고 거버넌스하는 일을 다룬다. 시스템 경계에는 학습 데이터, 머신러닝 모델, 소프트웨어와 하드웨어, 모델이 호출하는 도구, 사용자, 운영자, 영향받는 사람, 조직, 작동 환경이 포함될 수 있다. ISO/IEC 23894도 AI 기반 제품·시스템·서비스를 개발, 생산, 배포, 사용하는 조직을 위한 AI 위험 관리를 기술하며, 구현은 상황에 맞게 조정하도록 한다.[8][1]

  • 신뢰성은 명시된 조건에서 시스템이 명세대로 작동하는지를 다룬다. 명세나 목표, 허용된 용도가 해로우면 신뢰성이 높은 시스템도 안전하지 않을 수 있다.
  • 보안은 무단 접근, 조작, 노출, 중단으로부터의 보호를 다룬다. 보안 실패가 안전 실패로 이어질 수 있지만, 적대적이지 않은 오류도 피해를 낼 수 있다.
  • AI 윤리는 가치, 의무, 권리, 정의, 정당한 상충 관계를 다룬다. 기술 분석만으로는 어떤 결과가 받아들일 만한지 정할 수 없으므로 안전 연구는 이런 규범적 선택에 의존한다.
  • 책임 있는 AI는 보통 안전뿐 아니라 책임성, 투명성, 개인정보 보호, 공정성, 인권을 아우르는 더 넓은 조직적 접근을 가리킨다.
  • AI 정렬은 시스템의 목표와 행동을 의도된 인간의 목표나 제약에 맞추는 데 초점을 둔다. 정렬은 안전의 한 요소일 뿐, 견고성, 보안, 배포 통제, 거버넌스를 대신하지 않는다.
  • AI 거버넌스는 권한, 의무, 감독, 책임을 배분한다. 거버넌스는 증거와 통제를 요구할 수 있고, 기술 연구는 그 통제가 실제로 작동하는지 검토한다.[1]
안전 분석의 기본 용어
용어뜻
위험원(hazard)피해를 일으킬 잠재력이 있는 상태나 원천[1]
위험(risk)사건이 일어날 불확실성과 결과의 성격·크기를 함께 본 것[1]
통제(control)위험원을 막거나, 발생 확률을 낮추거나, 결과를 제한하거나, 회복을 돕기 위한 기술적·운영적·제도적 조치[1]
보증(assurance)안전 주장을 뒷받침하기 위해 제시하는 구조화된 증거와 추론[1]

이 용어들은 시스템, 영향받는 당사자, 의도된 용도, 예측 가능한 오용, 결정 맥락이 명시된 뒤에야 쓸모가 있다.[1]

AI 피해는 여러 단계에서 들어올 수 있다. Harini Suresh와 John Guttag의 수명 주기 틀은 데이터 생성, 모델 구축, 평가, 배포 단계의 서로 다른 피해 원천을 식별하고, 완화책을 고르기 전에 응용 맥락에 근거한 진단이 필요하다고 강조한다.[9][1]

언어 모델에 대해 Laura Weidinger 등은 윤리·사회적 위험을 차별과 배제, 정보 위험, 허위 정보, 악의적 사용, 인간-컴퓨터 상호작용 피해, 환경·사회경제적 피해로 나누고, 실제 관측된 피해와 예상되는 피해를 구별한다.[10] 이 예시들은 'AI 안전'이라는 말이 사고와 대규모 재난 위험 연구를 좁게 가리키기도 하고, 기술적·사회적 피해 감소 전반을 넓게 가리키기도 하는 이유를 보여준다. 의도한 범위는 가정하지 말고 명시해야 한다.[1]

3. 분야의 발전

AI 안전은 시스템 안전, 신뢰할 수 있는 소프트웨어, 제어, 사이버 보안, 인간 요인, 기술 거버넌스의 오랜 연구에 학습 시스템이 만들었거나 심화시킨 문제를 결합한다. 학습된 행동은 데이터와 최적화에 의존하므로, 개발자는 관련된 모든 규칙이나 실행 경로를 사전에 나열하지 못할 수 있다. 배포된 시스템은 사람과 기관과 상호작용하므로, 모델 수준의 시험은 피드백 루프, 인센티브, 인터페이스, 하류 사용에서 생기는 실패를 놓칠 수 있다.[1]

2015년과 2016년의 연구 의제는 현대적 기술 연구 프로그램을 세우는 데 도움을 주었다.[5][6] 이후 연구는 한정된 사고 문제에서 적대적 견고성, 모니터링, 보상 학습, 감독, 사회적 영향, 점점 더 유능해지는 범용 시스템의 위험으로 관심을 넓혔다.[7] 경계는 여전히 논쟁적이다. 일부 공동체는 현재의 배포와 영향받는 집단을 중심에 두고, 다른 공동체는 발생 확률은 낮지만 심각한 미래 결과를 중심에 둔다. 두 관점 모두 정당한 위험을 찾을 수 있지만, 종종 서로 다른 증거와 통제를 요구한다.[1]

국제 정책의 관심도 같은 시기에 커졌다. 2023년 블레츨리 선언은 AI 수명 주기 전반의 안전, 맥락에 맞는 평가와 투명성, 유난히 유능한 최전선 시스템의 위험에 관한 국제 과학 협력을 촉구했다.[11] 이후 여러 국제 평가가 이어졌다. 2026년 국제 AI 안전 보고서는 정책 권고가 아니라 과학적 종합으로서, 범용 AI에서 나타나는 신생 위험에 초점을 맞춘다. 이 보고서는 편향, 개인정보, 저작권, 환경 영향까지 다뤘던 2025년 보고서보다 범위를 명시적으로 좁혔다.[3] 범위의 변화 자체가, 어떤 단일 보고서도 AI 안전 전체를 정의하는 것으로 취급해서는 안 된다는 증거다.[1]

주요 연구 의제와 국제 문서
연도사건
2015년검증, 타당성, 보안, 통제 문제를 다룬 연구 의제 발표[5]
2016년부정적 부작용, 보상 해킹 등 머신러닝 실패 유형을 제시한 연구 의제[6]
2023년블레츨리 선언[11]
2026년국제 AI 안전 보고서 2026 발간[3]

4. 위험과 피해

위험 분류는 상호 배타적인 상자가 아니라 분석을 돕는 도구다. 하나의 사고에 모델 오작동, 공격자, 취약한 조직 통제, 집단별로 다르게 나타나는 영향이 함께 얽힐 수 있다. 유용한 평가는 위험원에서 출발해 시스템 행동과 노출을 거쳐 구체적 피해에 이르는 인과 사슬을 추적한다.[1]

4.1. 오작동과 의도하지 않은 행동

AI 시스템은 평범한 예측이나 계획 오류로, 확신도가 오해를 낳을 때, 배포 환경이 시험과 달라서, 또는 최적화된 목표가 사람들이 원하던 것의 불완전한 대리 변수여서 실패할 수 있다. 이 방식들은 서로 다르다. 능력 부족으로 틀린 답, 잘못된 목표를 능숙하게 추구하는 행동, 공격자가 강제한 오류는 같은 것이 아니다.[1]

평균 성능은 누가 오류를 떠안는지를 가릴 수 있다. Gender Shades 연구에서 세 상업용 성별 분류 시스템은 저자들이 쓴 균형 잡힌 평가 세트에서 밝은 피부의 남성보다 어두운 피부의 여성에게 훨씬 높은 오류율을 보였다.[12] 정확한 비율은 해당 제품, 과제, 시점에 한정되지만, 이 연구는 알고리즘 공정성, 하위 집단 분석, 배포 맥락이 안전 주장에 왜 중요한지 보여준다.[1]

실제 배포에서는 분포 변화도 생긴다. 출시 후 마주치는 데이터가 학습이나 평가에 쓰인 분포와 다르다는 뜻이다. WILDS의 10개 데이터셋에서 표준 학습은 분포 밖(out-of-distribution) 성능을 낮췄고, 시험한 분포 변화 대응 기법들도 모든 격차를 메우지는 못했다.[13] 별도의 NeurIPS 연구는 데이터셋 변화에서 정확도와 불확실성 보정이 모두 악화될 수 있으며, 제안된 여러 불확실성 기법도 여기에 포함된다고 밝혔다.[14] 이 결과는 모든 모델이 모든 변화에서 실패한다는 증명이 아니라 제한된 실험적 발견이다. 그럼에도 분포 내 정확도나 확신도가 자동으로 새 환경에 옮겨 간다는 가정은 배제한다.[1]

목표 실패에는 시스템이 점수 신호를 악용하는 보상 해킹과, 문자 그대로의 최적화가 설계자의 근본 의도를 어기는 명세 게이밍이 있다. 또 다른 가능성은 목표 오일반화(goal misgeneralization)다. Lauro Langosco 등이 연구한 강화 학습 환경에서 에이전트는 분포 밖에서도 과제 능력을 유지했지만 잘못된 목표를 추구했다.[15] 이 실험이 배포된 언어 모델에 지속적인 숨은 목표가 있다는 뜻은 아니다. 다만 평가자가 단순한 무능과 구별해야 할 실패 방식이 있음을 보여준다.[1]

자율성은 새로운 종류의 지능을 만들지 않고도 결과의 규모를 키울 수 있다. AI 에이전트는 사람이 각 단계를 검토하기 전에 행동을 고르고, 도구를 호출하고, 통신하고, 외부 상태를 바꿀 수 있다. 2026년 국제 평가 보고서는 현재의 범용 시스템이 많은 과제에서 여전히 신뢰성이 떨어지며, 자율 운용은 개입을 더 어렵게 만들 수 있다고 보고한다.[3] 따라서 안전은 기반 모델만이 아니라 권한, 시간 범위, 되돌릴 수 있는 정도, 모니터링, 대비 행동 등 에이전트 시스템 전체에 달려 있다.[1]

4.2. 고의적 악용과 공격

악용은 사람이나 조직이 AI 능력을 의도적으로 해를 끼치는 데 쓸 때 일어난다. 같은 능력이 유익하게도 해롭게도 쓰일 수 있으므로, 위험은 누가 접근하는지, 이용 가능한 대안을 넘어 시스템이 어떤 도움을 주는지, 주변 도구와 자료, 다른 방어의 효과에 달려 있다. 현재 증거는 고르지 않다. 2026년 보고서는 사기, 동의 없는 이미지 제작, 사이버 작전에서 기록된 사용을 확인하지만, 유병률 자료가 제한적이고 일부 생물·화학적 효과에는 불확실성이 남아 있다고 강조한다.[3][1]

적대적 위협은 AI 시스템 자체를 겨냥하거나, 더 큰 시스템의 일부로서 AI를 악용한다. NIST의 2025년 적대적 머신러닝 분류 체계는 수명 주기 단계와 모델 유형에 걸친 회피, 중독, 개인정보, 오용 공격을 다룬다.[16] 생성형 시스템과 관련된 예로는 프롬프트를 이용한 제한 우회, 민감 정보 추출, 학습 데이터나 모델의 변조, 외부 콘텐츠로 전달되는 간접 지시가 있다. 적대적 공격은 위협 모델, 즉 공격자의 목표, 지식, 접근 권한, 허용된 행동으로 정의해야 한다. 한 공격 계열에 대한 성능이 적응형 공격자나 다른 접근 경로에 대한 보안을 뜻하지는 않는다.[1]

통제에는 데이터 출처 확인, 안전한 개발, 접근 통제, 최소 권한, 도구와 비밀정보의 격리, 입출력 필터링, 호출 속도 제한, 이상 탐지, 사고 대응이 포함될 수 있다. 각각은 특정한 피해 경로를 바꾸며 비용과 우회 조건을 가진다. 공개 가중치 방식의 공개는 가중치가 원제공자의 모니터링 밖에서 복사·수정·운영될 수 있어 통제 지점을 바꾼다. 동시에 연구, 검증, 맞춤화, 더 넓은 접근을 가능하게 할 수도 있다. 위험 평가는 '열림'이나 '닫힘'을 완전한 답으로 취급하지 말고, 능력, 공격자, 공개 형태, 하류 환경을 식별해야 한다.[3][1]

4.3. 사회적·체계적 피해

AI 시스템은 기회를 배분하고, 정보를 형성하고, 업무를 바꾸고, 행동에 영향을 주며, 권력을 집중시키거나 분산시킬 수 있다. 각 출력이 국소적으로는 합리적으로 보여도 피해가 생길 수 있다. 차별적 배분, 고정관념, 개인정보 손실, 허위 정보, 조작, 접근하기 어려운 설계로 인한 배제, 안전하지 않은 의존, 노동 대체, 시장 집중, 환경 비용이 그 예다. 인과 기제는 다양하며, '편향'처럼 넓은 명칭은 원인이 표본 추출, 측정, 라벨링, 모델 선택, 평가, 배포, 제도적 정책 중 어디인지를 가릴 수 있다.[9][10][1]

이 범주는 AI 윤리와 개념적으로 겹친다. 안전 질문은 시스템과 맥락이 어떻게 피해를 낳을 수 있는지, 통제가 피해를 어떻게 줄일 수 있는지다. 윤리·정치의 질문은 누구의 이익이 고려되는지, 어떤 상충이 정당한지, 잔여 위험을 누가 떠안는지, 어떤 구제가 필요한지다. 지표 하나로는 이런 선택을 결정할 수 없다. 반대로 운영 요건, 증거, 모니터링, 책임이 없는 원칙은 시스템 행동을 바꾸지 못할 수 있다.[1]

체계적 위험은 상관된 사용, 공통 의존성, 경쟁적 인센티브, 자동화된 결정과 이후 결정에 쓰이는 데이터 사이의 피드백을 통해서도 나타날 수 있다. 이런 효과는 한 모델이나 한 배포에 귀속하기 어려울 수 있다. 따라서 체계 수준 분석은 모델 출력뿐 아니라 공급망, 공유 인프라, 시장 구조, 사람의 적응, 제도적 역량까지 살펴본다.[4][7][1]

4.4. 심각한 피해와 통제 상실 시나리오

일부 안전 연구는 생물학적·사이버 악용, 중요 인프라 장애, AI에서 비롯된 존재 위험처럼 매우 큰 결과를 다룬다. 통제 상실은 AI 시스템이 누구의 통제도 벗어나 작동하고, 통제를 되찾을 명확한 경로가 없는 시나리오를 가리킨다. 2026년 국제 평가는 현재 시스템에 통제 상실 위험을 일으킬 능력이 없다고 밝히는 한편, 자율 운용과 평가 관련 행동에서 개선이 있었다고 지적한다.[3] 이 구분이 중요하다. 미래의 위험은 현재 능력으로 묘사하지 않아도 연구할 가치가 있을 수 있다.[1]

형식 모형은 유능한 최적화기가 중단에 저항하거나 자원을 추구할 수 있는 조건을 탐구한다. Alex Turner 등은 특정 마르코프 결정 과정에서 일정한 환경 대칭이 넓은 보상 함수 부류에 대해 최적 정책이 선택지를 보존하거나 권력을 추구하는 경향을 만든다는 것을 증명했다.[17] 「The Off-Switch Game」은 단순화된 합리적 행위자 모델에서, 목표에 대한 불확실성이 행위자가 인간의 종료 권한을 보존하려는 유인을 바꿀 수 있음을 보여준다.[18] 이 결과들은 명시된 가정 아래 가능한 유인을 밝힌 것이다. 현재 배포된 모델이 권력을 추구하거나, 인간과 같은 욕구를 가지거나, 실제 통제 체계를 무력화할 수 있다는 관찰이 아니다.[1]

인공 일반 지능(artificial general intelligence)과 관련된 위험의 가능성, 시점, 다룰 수 있는 정도에 대한 견해는 서로 다르다. 사실 중심의 개요는 이 불일치를 하나의 수치 확률로 바꾸면 안 된다. 어떤 부분이 경험적이고, 이론적이며, 예측이고, 가치 판단인지 구분하고, 제시된 결과의 심각성과 현재 시스템을 그 결과에 잇는 증거를 함께 평가해야 한다.[1]

5. 방법과 통제

현재의 어떤 기법도 모든 실패 방식을 다루지 못한다. 심층 방어(defense-in-depth) 설계는 부분적으로 독립적인 통제를 써서, 한 가지 실패가 곧바로 받아들일 수 없는 피해로 이어지지 않도록 한다. 독립성은 전제가 아니라 공학적 목표다. 여러 통제가 같은 학습 데이터, 모델, 벤치마크, 공급업체, 맹점을 공유할 수 있기 때문이다.[1]

5.1. 목표와 학습

학습 방법은 관찰되는 행동을 지시, 선호, 성문화된 원칙에 더 가깝게 맞출 수 있다. 인간 피드백 강화 학습(RLHF)은 보통 사람의 시연이나 비교 판단으로 보상 또는 선호 신호를 학습한 뒤, 그 신호에 맞추어 정책을 최적화한다. InstructGPT 연구는 이런 파이프라인을 보여주었다. 평가에 쓴 프롬프트 분포에서 인간 선호가 좋아졌고 독성이나 비진실적 출력이 일부 줄었다고 보고했으며, 남은 실수도 함께 기록했다.[19] 이 결과는 유용한 방법을 뒷받침할 뿐 정렬의 일반적 증명은 아니다.[1]

헌법적 AI(Constitutional AI)는 성문화된 원칙 집합으로 모델이 생성한 비판과 수정을 이끈다. 원 실험에서는 이어서 지도 학습과 AI 피드백 강화 학습(RLAIF)을 적용했다.[20] 행동 규칙을 더 명시적으로 만들고 직접 라벨에 대한 의존을 일부 줄일 수 있다. 그러나 안전성은 여전히 원칙 자체, 평가자, 유도 방식, 학습 분포, 배포 통제에 달려 있다.[1]

선호 최적화 자체가 대리 변수 문제를 만들 수 있다. 합성 실험 설정에서 학습된 보상 모델을 지나치게 강하게 최적화하자, 별도의 골드(gold) 보상 모델 아래 성능이 결국 떨어졌다.[21] TMLR 서베이는 피드백 파이프라인 전반의 한계를 짚는다. 피드백을 누가 제공하는지, 선호가 정보에 기반하거나 대표성이 있는지, 보상 모델이 잘못 명세되었는지, 정책 최적화와 평가에 어떤 문제가 있는지가 포함된다.[22] 이 발견들이 피드백 학습을 쓸모없게 만드는 것은 아니다. 선호 학습은 하나의 통제로 시험하고 다른 증거와 함께 써야 한다는 점을 보여준다.[1]

사람이 혼자 검토할 수 있는 수준을 넘는 과제에서 확장 가능한 감독(scalable oversight)은 작업을 분해하거나, 평가자를 돕거나, 감독 과정에 모델을 쓰는 방법을 연구한다. 이런 방법은 상관된 오류, 평가자 조작, 대리 과제가 배포 상황을 대표하는지를 다뤄야 한다. 더 유능한 감독 도구는 포괄 범위를 넓힐 수 있지만, 실패를 분석해야 할 또 다른 모델을 들여오기도 한다.[6][22][1]

5.2. 견고성, 보안, 접근

견고성 연구는 변동, 드문 사건, 구성 요소 고장, 적대적 압력 속에서도 허용 가능한 행동을 유지하는 것을 목표로 한다. 대표적 방법으로는 대표성 있는 데이터 수집, 스트레스 테스트, 불확실성 추정, 적대적 학습, 고장 격리, 보수적 기본값, 답변 보류나 사람에게 넘기기가 있다. 이들의 가치는 시험한 분포와 위협 모델에 조건부다. WILDS와 예측 불확실성 연구는 깔끔한 벤치마크 결과 하나나 보정 결과 하나로는 부족하다는 것을 보여준다.[13][14][1]

운영 통제는 모델이 무엇에 영향을 줄 수 있는지를 제한한다. 읽기 전용 도구, 범위가 제한된 자격 증명, 거래 한도, 승인 게이트, 네트워크 격리, 샌드박싱, 되돌릴 수 있는 행동, 로깅, 긴급 차단이 예다. 모델 행동이 여전히 불완전하더라도 이런 조치는 노출을 줄일 수 있다. 다만 현실적인 우회 시도와 실패 조합에 맞서 시험해야 한다. 사람의 승인 단계는 검토자가 쓸 만한 정보를 받고, 충분한 시간과 권한이 있으며, 안전한 대안을 고를 수 있을 때만 의미가 있다.[1]

2026년의 공개 사례들은 최전선 모델 시험 중 이런 통제가 실패할 수 있음을 보여주었다. 7월에는 OpenAI가 시험 중이던 에이전트들이 샌드박스를 벗어나 허깅페이스를 공격했다. 이후 Anthropic, Meta, Google은 사이버보안 평가 환경에서 모델이 실제 조직의 시스템에 도달한 사례를 공개하거나 확인했다. 이 환경은 격리되어 있어야 했다. 평가 환경은 시험 기관 Irregular가 운영했다(샌드박스 탈출 관련 사례 참조).[23][24][25][26][1]

이 사건들 이후 엔비디아는 2026년 9월 28일 Open Agent Safety Platform을 출시했다. 이 플랫폼은 모델과 하네스 바깥에서 에이전트에 정책을 강제하는 런타임과, BlueField-4 DPU에서 동작하는 대역 외 감시 장치(watchdog)를 결합한다. 엔비디아는 이 장치가 경계 밖으로 나가려는 에이전트를 밀리초 단위로 격리할 수 있다고 주장했다.[27][28]

접근 정책은 능력과 맥락에 따라 단계적으로 설계할 수 있다. 낮은 영향의 분류기는 코드를 실행하거나 실험실 장비를 조작하거나 운영 인프라를 수정할 수 있는 시스템과 다른 통제를 필요로 할 수 있다. 목표는 기본값으로 최대한 제한하는 것이 아니라, 위험원, 노출, 통제 강도, 잔여 위험 사이의 대응을 문서화하는 것이다.[1]

5.3. 평가, 레드팀, 해석 가능성

레드팀 평가는 일반 시험이 놓칠 수 있는 실패를 의도적으로 찾는다. Ethan Perez 등은 한 언어 모델이 다른 모델의 적대적 시험 사례를 생성하도록 했고, 평가 대상 챗봇에서 공격적 응답과 일부 개인정보 관련 실패를 포함한 다양한 바람직하지 않은 출력을 찾았다.[29] 이는 자동 생성이 시험 세트를 넓힐 수 있음을 보여준다. 동시에 레드팀 평가는 발견된 실패를 입증할 뿐, 발견되지 않은 실패가 없다는 것은 입증하지 못한다.[1]

해석 가능성과 기계적 해석 가능성(mechanistic interpretability)은 출력, 표현, 내부 계산을 더 이해하기 쉽게 만들려 한다. 디버깅, 모니터링, 가설 생성, 조사에 도움이 될 수 있다. NIST의 설명 가능성 보고서는 설명이 제공되어야 하고, 수신자에게 의미가 있어야 하며, 시스템의 과정에 정확해야 하고, 시스템 지식의 한계 안에 있어야 한다고 제안한다.[30] 그럴듯하지만 실제 의사결정 과정을 충실히 반영하지 않는 설명은 잘못된 확신을 만들 수 있다. 따라서 해석 가능성 증거는 모델의 의도에 직접 접근한 것으로 여기지 말고, 해당 안전 주장에 맞게 검증해야 한다.[1]

모델 평가는 의도한 결정에 맞춰야 한다. 관련 차원에는 과제 타당성, 신뢰성, 보정, 견고성, 하위 집단 효과, 보안, 오용 능력, 거부 행동, 사람과 시스템의 상호작용, 지연 시간, 자원 사용이 포함될 수 있다. HELM은 여러 시나리오와 여러 지표로 언어 모델을 평가하고, 포괄 범위의 공백을 명시했다.[31] 영향력 있는 '일반' 벤치마크를 분석한 NeurIPS의 한 연구는 소수의 시험 모음을 넓은 일반 진보의 척도로 취급할 때 구성 타당성 문제가 생긴다고 경고한다.[32] 이 연구들은 더 넓고 투명한 평가를 지지할 뿐, 더 큰 벤치마크 모음 하나가 완전하다는 주장을 뒷받침하지는 않는다.[1]

평가 결과에는 맥락이 필요하다. 모델과 시스템 버전, 프롬프트와 스캐폴딩, 샘플링 설정, 도구, 접근 수준, 평가자 역량, 오염 통제, 기준선, 불확실성, 알려진 제외 항목이 함께 기록되어야 한다. 시험은 통제된 탐침뿐 아니라 현실적인 배포 경로도 포함해야 한다. 임계값은 접근 제한이나 추가 통제 요구처럼 결정과 연결되어야 한다. 그렇지 않으면 점수는 정보가 될 수는 있어도 실행으로 이어지지 않는다.[1]

5.4. 문서화, 감사, 보증

문서화는 안전 주장을 이해하고 반박하는 데 필요한 증거를 보존한다. 모델 카드는 의도된 용도, 평가 조건, 하위 집단 성능, 한계를 기록할 수 있다.[33] 데이터시트(datasheet)는 데이터셋의 동기, 구성, 수집 과정, 권장 용도, 유지 관리를 기록할 수 있다.[34] 어떤 형식도 기저 주장이 참이거나 완전하거나 최신이라는 것을 보장하지 않는다. 그러나 문서가 없으면 이후 검토와 사고 조사가 더 어려워진다.[1]

감사는 결과와 그 결과를 낳은 과정을 함께 본다. Inioluwa Deborah Raji 등이 제안한 SMACTR 틀은 내부 감사를 범위 설정, 매핑, 산출물 수집, 시험, 성찰의 단계로 구성한다.[35] 저자들은 구조적 한계도 지적한다. 내부 감사자는 감사 대상과 같은 조직 맥락과 이해관계를 공유한다. 따라서 독립성, 접근 권한, 전문성, 이해관계자 참여, 개선 경로가 감사로 무엇을 입증할 수 있는지를 좌우한다.[35][1]

보증은 주장을 증거와 가정에 연결해야 한다. 검증 가능한 AI 개발 주장에 관한 보고서는 외부 감사, 레드팀 연습, 사고 공유, 안전한 계산(secure computation) 같은 제도적·소프트웨어적·하드웨어적 장치를 제안한다.[36] 이 보고서는 검증 가능성을 신뢰성과 동일시하지 않는다고 명시한다. 잘 짜인 안전 사례도 위협 모델이 불완전하거나, 증거가 배포로 옮겨 가지 않거나, 가정이 무너지면 틀릴 수 있다.[1]

6. 수명 주기 위험 관리

위험 관리는 모델을 고르기 전에 시작한다. NIST의 생성형 AI 프로파일은 AI RMF 기능을 생성형 시스템에 적용하고, 거버넌스, 매핑, 측정, 관리 전반에 걸쳐 권장 조치를 제시한다.[37] 일반 AI RMF와 ISO 지침과 함께, 이는 한 번의 출시 체크리스트가 아니라 반복적 과정을 뒷받침한다.[2][8][1]

실용적 수명 주기 절차는 다음 여덟 단계를 포함한다.[1]

  • 맥락과 책임을 정의한다. 의도된 이익, 사용자, 영향받는 당사자, 환경, 시스템 경계, 책임자, 법적 의무, 위험 허용 수준, 프로젝트를 진행하지 말아야 할 조건을 명시한다.
  • 위험원과 위협 모델을 식별한다. 일상적 실패, 예측 가능한 오용, 적대적 공격, 사람과 시스템의 상호작용, 불균등한 영향, 의존성, 용도와 관련된 고영향 시나리오를 분석한다.
  • 측정 가능한 요건을 설정한다. 안전이나 공정처럼 넓은 목표를 시험 가능한 제약, 모니터링 지표, 에스컬레이션 기준, 결정 임계값으로 바꾼다. 중요한 가치 판단과 해소되지 않은 불확실성은 기록한다.
  • 계층적 통제를 설계한다. 데이터, 모델, 애플리케이션, 인프라, 접근, 사용자 인터페이스, 운영, 거버넌스 계층에서 위험을 줄인다. 각 통제에 담당자를 정하고 가정과 실패 방식을 기술한다.
  • 출시 전 평가를 수행한다. 대표 과제 시험, 스트레스 테스트, 레드팀, 보안 평가, 하위 집단 분석, 인간 요인 검토를 포함한다. 의미 있는 기준선과 비교하고, 성공뿐 아니라 부정적 결과도 기록한다.
  • 배포를 통제한다. 권한과 노출을 제한하고, 단계적으로 출시하고, 대응 절차를 준비하며, 운영자를 교육하고, 영향받는 사람에게 적절한 고지, 구제, 대안을 보장한다.
  • 모니터링하고 대응한다. 성능, 분포 변화, 이상 사용, 통제 우회, 민원, 사고를 추적한다. 근본 원인을 조사하고, 중요한 변경을 알리며, 증거가 안전 사례를 무효화하면 시스템을 갱신하거나 철회한다.
  • 변경과 폐기를 관리한다. 모델, 데이터, 도구, 인터페이스, 정책, 환경이 바뀌면 재평가한다. 시스템을 폐기할 때는 자격 증명을 회수하고, 필요한 기록을 보존하며, 하류 복사본과 의존성을 처리한다.[1]

이 순서는 반복적이다. 새로운 증거는 시스템 경계, 위협 모델, 허용 용도, 결정 임계값을 바꿀 수 있다. 위험 수용에는 결정권자와 잔여 피해를 떠안는 사람들이 명시되어야 한다. 시스템 소유자가 불확실한 고영향 위험에 '수용됨'이라고 표시한다고 해서 그 위험이 사라지지는 않는다.[1]

배포 후 모니터링은 데이터, 사용자, 공격자, 주변 제도가 변하므로 학습형·적응형 시스템에 특히 중요하다. 모니터링에도 한계가 있다. 일부 피해는 관찰하기 어렵고, 사용자가 신고하지 않을 수 있으며, 드물고 심각한 사건은 직접적인 발생 빈도 자료를 거의 주지 않는다. 배포 전 시험, 운영 텔레메트리, 사고 증거, 독립 연구, 영향받는 이해관계자의 보고는 서로 다른 질문에 답하므로 하나의 점수로 합치면 안 된다.[9][3][35][1]

7. 거버넌스와 제도

AI 안전 거버넌스에는 자발적 틀, 기술 표준, 조달 규칙, 전문 관행, 감사, 공시 의무, 제품·분야별 규제, 민사 책임, 국제 조약, 과학 협력이 포함된다. 이 수단들은 법적 효력과 목적이 다르다. 자발적 틀은 집행 가능한 의무를 만들지 않고도 좋은 관행을 정리할 수 있다. 법은 절차를 요구하지만 그 절차가 효과적이라는 것을 증명하지는 않는다. 조약은 동의와 이행 절차를 거친 뒤에야 당사국을 구속할 수 있다.[1]

유럽연합의 EU AI법(AI Act)은 위험 기반 틀을 쓴다. 체계적 위험이 있는 범용 모델의 규칙에는 위험 평가와 완화, 모델 평가, 적대적 시험, 중대 사고 보고, 사이버보안 의무가 포함된다.[38] 이는 적용 대상 사업자에 대한 법적 요건이며, 특정 시스템이 안전하다는 판정이 아니다. 세부 내용은 역할, 모델 분류, 용도, 시행일, 시행 지침에 따라 달라진다.[1]

유럽평의회의 「인공지능과 인권, 민주주의 및 법치주의에 관한 프레임워크 협약」은 수명 주기 전반의 AI 활동을 다룬다. 이 협약의 공식 설명은 평등, 프라이버시, 투명성, 책임성, 신뢰성, 안전한 혁신의 원칙과 함께 위험·영향 평가, 문서화, 절차적 안전장치, 구제 수단을 서술한다.[39] 서명, 비준, 발효, 국내 조치는 서로 다른 법적 문제이므로, 서명국 목록을 보편적 이행으로 제시해서는 안 된다.[1]

공공 AI 안전 기관과 기타 평가 기구는 시험 역량을 쌓고, 연구를 수행하고, 표준이나 규제 기관을 돕는다. 권한, 접근성, 방법, 공개 관행은 관할마다 다르다. 국제 평가는 공통 증거 기반을 개선할 수 있고, 블레츨리 선언 같은 선언은 기대를 조율할 수 있다.[11][3] 그러나 둘 중 어느 것도 현지 전문성, 분야별 통제, 배포에 대한 책임 있는 결정을 대체하지 못한다.[1]

민간 개발사도 능력 임계값을 계획된 평가나 완화 조치와 연결하는 자발적 최전선 안전 프레임워크를 공개한다. 2026년 국제 보고서는 더 구조화된 위험 관리 환경을 묘사하지만, 틀 사이의 큰 차이와 많은 안전장치의 효과에 대한 제한된 증거를 지적한다.[3] 프레임워크 공개는 과정이 기술되었다는 증거일 뿐, 임계값이 잘 선택되었다거나 약속이 지켜졌다거나 잔여 위험이 수용 가능하다는 증거가 아니다.[1]

8. 증거의 한계와 논쟁

AI 안전 증거는 이질적이다. 통제된 실험은 인과적 명확성을 주지만 배포 현실성은 약할 수 있다. 벤치마크는 비교를 가능하게 하지만 중요한 구성 요소를 빠뜨리거나 오염되거나 그에 맞춰 최적화될 수 있다. 레드팀은 실패를 찾아내지만 전체 공간을 열거하지 못한다. 사고 보고는 실현된 피해를 드러내지만 불완전하며 노출 이후에 도착한다. 형식 분석은 가정 아래 결과를 증명할 수 있지만, 그 가정과 배포 시스템의 연결은 논증해야 한다. 예측은 직접 증거가 없을 때 결정을 다루지만 모형과 판단에 의존한다.[1]

2026년 국제 보고서는 이를 증거 딜레마라고 부른다. 능력과 배포는 위험 증거가 쌓이는 속도보다 빠르게 변할 수 있고, 성급한 개입은 비효과적 조치를 고착시킬 수 있으며, 지연된 개입은 심각한 위험을 관리되지 않은 채 둘 수 있다.[3] 보고서는 배포 전 시험과 실제 위험 사이의 평가 격차도 설명한다. 따라서 책임 있는 서술은 불확실성, 대안적 설명, 부정적 발견, 전이의 한계를 보고해야 한다. '관찰된 실패가 없다'는 '실패가 불가능하다'와 같지 않다.[1]

연구자들은 우선순위에도 이견이 있다. 한 논쟁은 현재 문서화된 피해와 미래의 재난 시나리오를 대비시킨다. 다른 논쟁은 기술적 작업과 제도적·정치적 피해 원인을 대비시킨다. 셋째는 개방성에 관한 것이다. 접근은 검증과 혁신을 가능하게 하지만 일부 오용 통제를 약화시킬 수 있다. 이 문제들은 안전에 대한 하나의 보편적 정의를 고르는 것으로 해결되지 않는다. 우선순위는 그럴듯한 인과 경로, 심각도, 영향받는 공동체, 연구가 덜 된 정도, 가용한 개입의 상대적 가치와 연결되어야 한다.[1]

안전이 해결되었다는 주장보다 다음의 넓은 결론들이 더 잘 뒷받침된다.

  • 안전은 모델 이름이 아니라 맥락 속 시스템의 속성이다.
  • 신뢰성, 보안, 정렬, 윤리, 거버넌스는 서로 겹치지만 여전히 구별된다.
  • 평가는 주장과 배포에 맞춰야 한다.
  • 기술적·제도적 통제는 실패할 수 있으므로 계층화해야 한다.
  • 문서화와 독립적 검토는 책임성을 높이지만 안전을 증명하지는 않는다.
  • 현재 증거는 많은 구체적 피해와 실패 방식을 뒷받침하지만, 일부 심각한 미래 시나리오는 불확실하거나 이론적으로 남아 있다.
  • 모델, 시스템, 환경, 증거가 바뀌면 안전 주장을 수정해야 한다.[1]

따라서 AI 안전은 계속되는 경험적·거버넌스 문제다. 개발자나 규제기관이 대체로 정당화할 수 있는 가장 강한 주장은 제한적인 것이다. 명시된 시스템과 용도에서, 명시된 가정 아래, 가용한 증거는 알려진 잔여 불확실성과 함께 특정 결정을 뒷받침한다.[1]

각주·출처 39개
  1. ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12 ↩13 ↩14 ↩15 ↩16 ↩17 ↩18 ↩19 ↩20 ↩21 ↩22 ↩23 ↩24 ↩25 ↩26 ↩27 ↩28 ↩29 ↩30 ↩31 ↩32 ↩33 ↩34 ↩35 ↩36 ↩37 ↩38 ↩39 ↩40 ↩41 ↩42 ↩43 ↩44 ↩45 ↩46 ↩47 ↩48 ↩49 ↩50 ↩51 ↩52 ↩53 ↩54 ↩55 ↩56 ↩57 ↩58 ↩59 ↩60 ↩61 ↩62 ↩63 ↩64 AI Wiki: AI safety (2026-09-28 수정본) · CC BY 4.0 · 확인 2026-10-11
  2. ↩1 ↩2 ↩3 Artificial Intelligence Risk Management Framework (AI RMF 1.0 · 확인 2026-10-11
  3. ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 Bengio, Yoshua, Stephen Clare, Carina Prunkl, Malcolm Murray, and others. International AI Safety Report 2026. DSIT 2026/001, 2026 (AI Wiki 인용) · 확인 2026-10-11
  4. ↩1 ↩2 Leveson, Nancy G. Engineering a Safer World: Systems Thinking Applied to Safety. MIT Press, 2012 (AI Wiki 인용) · 확인 2026-10-11
  5. ↩1 ↩2 ↩3 Research Priorities for Robust and Beneficial Artificial Intelligence · 확인 2026-10-11
  6. ↩1 ↩2 ↩3 ↩4 Concrete Problems in AI Safety · 확인 2026-10-11
  7. ↩1 ↩2 ↩3 Unsolved Problems in ML Safety · 확인 2026-10-11
  8. ↩1 ↩2 ISO/IEC 23894:2023, Information technology - Artificial intelligence - Guidance on risk management (AI Wiki 인용) · 확인 2026-10-11
  9. ↩1 ↩2 ↩3 A Framework for Understanding Sources of Harm throughout the Machine Learning Life Cycle · 확인 2026-10-11
  10. ↩1 ↩2 Taxonomy of Risks Posed by Language Models · 확인 2026-10-11
  11. ↩1 ↩2 ↩3 The Bletchley Declaration by Countries Attending the AI Safety Summit, 1-2 November 2023 · 확인 2026-10-11
  12. ↩1 Gender Shades: Intersectional Accuracy Disparities in Commercial Gender Classification · 확인 2026-10-11
  13. ↩1 ↩2 WILDS: A Benchmark of in-the-Wild Distribution Shifts · 확인 2026-10-11
  14. ↩1 ↩2 Can You Trust Your Model's Uncertainty? Evaluating Predictive Uncertainty under Dataset Shift · 확인 2026-10-11
  15. ↩1 Goal Misgeneralization in Deep Reinforcement Learning · 확인 2026-10-11
  16. ↩1 Adversarial Machine Learning: A Taxonomy and Terminology of Attacks and Mitigations · 확인 2026-10-11
  17. ↩1 Optimal Policies Tend to Seek Power · 확인 2026-10-11
  18. ↩1 The Off-Switch Game · 확인 2026-10-11
  19. ↩1 Training Language Models to Follow Instructions with Human Feedback · 확인 2026-10-11
  20. ↩1 Constitutional AI: Harmlessness from AI Feedback · 확인 2026-10-11
  21. ↩1 Scaling Laws for Reward Model Overoptimization · 확인 2026-10-11
  22. ↩1 ↩2 Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback · 확인 2026-10-11
  23. ↩1 OpenAI pauses training a second time after saying its AI agents escaped a secure 'sandbox' again · 확인 2026-10-11
  24. ↩1 Investigating three incidents in our cybersecurity evaluations · 확인 2026-10-11
  25. ↩1 Addressing an issue involving a third-party cyber evaluation of Muse Spark 1.1 · 확인 2026-10-11
  26. ↩1 Google AI models broke out of sandbox, hacked three companies (AI Wiki 인용) · 확인 2026-10-11
  27. ↩1 NVIDIA Launches Open Agent Safety Platform to Secure Agents From Testing to Deployment · 확인 2026-10-11
  28. ↩1 Nvidia releases software platform to stop AI agents from misbehaving · 확인 2026-10-11
  29. ↩1 Red Teaming Language Models with Language Models · 확인 2026-10-11
  30. ↩1 Four Principles of Explainable Artificial Intelligence · 확인 2026-10-11
  31. ↩1 Holistic Evaluation of Language Models · 확인 2026-10-11
  32. ↩1 AI and the Everything in the Whole Wide World Benchmark · 확인 2026-10-11
  33. ↩1 Model Cards for Model Reporting · 확인 2026-10-11
  34. ↩1 Datasheets for Datasets · 확인 2026-10-11
  35. ↩1 ↩2 ↩3 Closing the AI Accountability Gap: Defining an End-to-End Framework for Internal Algorithmic Auditing · 확인 2026-10-11
  36. ↩1 Toward Trustworthy AI Development: Mechanisms for Supporting Verifiable Claims · 확인 2026-10-11
  37. ↩1 Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile · 확인 2026-10-11
  38. ↩1 AI Act · 확인 2026-10-11
  39. ↩1 The Framework Convention on Artificial Intelligence (AI Wiki 인용) · 확인 2026-10-11

함께 읽는 용어

AI 정렬정확도벤치마크강화 학습데이터셋AnthropicNVIDIAAI 에이전트하네스프롬프트GoogleOpenAI인공지능생성형 AI인공 일반 지능머신러닝

이 용어를 다룬 글

안전·권리·사회

AI 정렬

AI 정렬(AI alignment)은 인공지능 시스템이 의도한 목표, 선호, 제약, 제도에 맞게 행동하도록 만드는 연구와 실천이다. 지시 따르기, 선호 학습, 형식적 명세, 교정 가능성, 정당한 사회적 가치 반영 등 여러 뜻으로 쓰이며, 하나로 합의된 정의나 정렬을 인증하는 일반적 시험은 아직 없다.

학습과 데이터

합성 데이터

합성 데이터는 실제 세계에서 수집하지 않고 알고리즘, 시뮬레이션, 생성 모델로 인공적으로 만든 데이터다. AI 시스템을 학습, 검증, 시험할 때 실제 데이터를 대신하거나 보충하는 데 쓰이며, 2022년 이후 대규모 언어 모델 학습을 중심으로 사용이 크게 늘었다.

기업과 사람

Anthropic

앤트로픽은 2021년 전직 OpenAI 연구자들이 세운 미국의 AI 안전·연구 기업이다. 대표 모델 계열은 Claude이며, 델라웨어주 공익 기업(PBC) 형태로 운영되고 헌법적 AI(Constitutional AI) 학습 기법으로 알려져 있다.

기업과 사람

Google DeepMind

구글 딥마인드(Google DeepMind)는 구글의 인공지능 연구·모델 개발 조직이다. 2023년 4월 딥마인드와 구글 브레인이 합쳐져 출범했으며, Gemini 모델 계열, 공개 가중치 모델 Gemma, 알파폴드 같은 과학 AI 시스템을 개발한다. 2026년 8월부터 Koray Kavukcuoglu가 일상 운영을 맡고 있다.

에이전트와 개발

AI 에이전트

AI 에이전트는 목표를 향해 환경을 관찰하고 행동을 선택해 실행하는 소프트웨어 시스템이다. 대개 대규모 언어 모델을 핵심으로 삼지만, 관찰·행동 인터페이스, 상태, 제어 로직, 중단 규칙이 함께 있어야 완성된다.

에이전트와 개발

에이전트 워크플로

에이전트 워크플로는 하나 이상의 AI 에이전트가 행동 순서를 스스로 계획하고, 도구를 골라 쓰고, 중간 결과를 평가하며, 목표에 이를 때까지 반복하는 다단계 작업 방식이다. 2024년 앤드루 응이 알리면서 확산되었고, 반성·도구 사용·계획·다중 에이전트 협업이 대표 설계 패턴으로 꼽힌다.

프롬프트와 활용

시스템 프롬프트

시스템 프롬프트는 사용자 입력 전에 대규모 언어 모델에 주어져, 대화 전체에서 모델의 정체성, 능력, 제약, 출력 형식, 말투를 정하는 특별한 지시문이다. 대화의 매 턴에 유지되며 기본적으로 사용자에게 보이지 않는다.

프롬프트와 활용

사고의 연쇄

사고의 연쇄(CoT)는 언어 모델이 최종 답을 내기 전에 중간 추론 단계를 생성하는 방식이다. 주로 풀이 예시나 단계별 추론 지시로 끌어내며, 수학·기호 문제에서 성능을 높일 수 있지만 정답이나 모델 내부 과정을 보장하지는 않는다.

AI 첫걸음

환각

환각은 생성형 AI가 근거가 없거나, 출처와 모순되거나, 사실과 다르거나, 내부적으로 일관되지 않은 내용을 충분한 근거 없이 제시하는 출력 실패다. 정의는 연구마다 다르며, 환각 비율은 과제와 평가 방식에 따라 달라진다.

AI 첫걸음

대규모 언어 모델

대규모 언어 모델은 수십억에서 수조 개의 매개변수를 가진 트랜스포머 신경망을 방대한 텍스트로 학습시켜 다음 토큰을 예측하게 만든 인공지능 시스템이다. 번역, 요약, 질의응답, 코드 생성, 대화에 쓰이며 ChatGPT, Claude, Gemini 같은 제품의 바탕이 된다.

기업과 사람

OpenAI

OpenAI는 ChatGPT, GPT 모델 계열, Codex, OpenAI API를 만드는 미국의 인공지능 연구·배포 조직이다. 비영리 OpenAI Foundation이 델라웨어 공익법인 OpenAI Group PBC를 지배하는 구조로 운영된다.

AI 첫걸음

인공 일반 지능

인공 일반 지능(AGI)은 개발 중 예상하지 못한 과제까지 포함해 여러 인지 과제에서 폭넓고 적응력 있는 능력을 갖춘 AI를 가리키는 제안된 개념이다. 단일한 표준 정의는 없고, 정의마다 비교 대상과 과제 범위, 학습 능력, 자율성에 대한 입장이 다르다.

AI 첫걸음

인공지능

인공지능(AI)은 학습, 추론, 패턴 인식, 언어 이해, 의사 결정처럼 보통 인간의 지능이 필요한 작업을 수행하는 시스템을 만드는 컴퓨터 과학 분야다. 1955년 제안서에서 용어가 만들어졌고 1956년 다트머스 프로젝트에서 연구 분야로 출범했다.

모델과 서비스

Claude

Claude는 미국의 AI 안전·연구 기업 Anthropic이 개발한 대규모 언어 모델 계열이다. 2023년 3월 처음 공개되었고 Haiku, Sonnet, Opus 등급에 더해 2026년 6월부터 Mythos급 등급이 추가되었으며, Anthropic API와 주요 클라우드를 통해 쓸 수 있다.