| 분류 | 인공지능의 연구 목표이자 논쟁적 범주[1] |
|---|---|
| 정의 | 개발 중 예상하지 못한 과제까지 포함해 여러 인지 과제에서 폭넓고 적응력 있는 능력[1] |
| 표준 정의 | 없음(과학·법·산업 전반에 통용되는 단일 정의가 없다)[1] |
| 용어의 첫 등장 | 1997년 Mark Gubrud의 논문[2] |
| 첫 AGI 학회 | 2008년 3월 1~3일, 미국 테네시주 멤피스[3] |
| 현황 | 2026년 9월 3일 기준, 기존 시스템이 널리 공유된 AGI 기준선을 충족했다고 확립한 공인 기관이나 측정 틀은 없음[1] |
쉽게 말하면, 인공 일반 지능(AGI)은 한 가지 일에 국한되지 않고 여러 생각하는 일을 폭넓게, 처음 보는 일에도 맞춰 가며 해내는 AI를 가리키는 말이다. 이름 붙은 표준 시험이나 공인된 기준이 있는 것은 아니며, 무엇을 AGI로 볼지는 연구자마다 의견이 갈린다.[1]
1. 개요
인공 일반 지능(Artificial General Intelligence, AGI)은 개발 중에 예상하지 못한 과제까지 포함해 여러 인지 과제에서 폭넓고 적응력 있는 능력을 갖춘 인공지능을 가리키는, 제안된 개념이다. 과학, 법, 산업 전체에 통용되는 단일 정의는 없다.[1]
대부분의 정의는 두 가지를 결합한다. 여러 분야에 걸친 폭, 그리고 그 분야 안에서의 충분히 높은 수행 수준이다. 정의마다 다른 것은 비교 대상인 사람 집단, 인정하는 과제, 새 과제의 학습이 필수인지, 신체 행동이나 자율성이 필요한지다.[2]
따라서 AGI는 표준화된 시험이나 공식 인증을 받은 시스템 등급의 이름이 아니라 연구 목표이자 논쟁적인 범주다. 2026년 9월 3일 기준으로, 기존 시스템이 널리 공유된 AGI 기준선을 충족했다고 확립한 공인 기관이나 측정 틀은 없었다.[1]
같은 날 OpenAI 사장 그레그 브록먼(Greg Brockman)은 GPT-6 Astra 출시 자리에서 기자들에게 "우리가 지금 AGI 시대에 있다고 느끼는 것은 무리한 일이 아니라고 생각한다"고 말했다. 이는 회사의 공식 판정이 아니라 본인의 판단으로 제시한 발언이었다.[4]
오늘날의 범용 AI 시스템은 범위가 분명한 여러 과제를 높은 수준으로 해내지만, 과제와 상황에 따라 성능이 고르지 않다. 기본적인 실수를 하고, 거짓 진술을 만들고, 긴 프로젝트에 어려움을 겪으며, 통제된 평가 밖에서는 덜 안정적이다.[5]
불확실성은 일부는 개념에서, 일부는 경험적 증거에서 나온다. 연구자들은 무엇을 일반 지능으로 칠지, 암기나 벤치마크 전용 학습에 보상을 주지 않고 어떻게 측정할지, 열린 세계에서 안정적으로 작동하려면 어떤 능력이 충분한지를 두고 의견이 갈린다. 따라서 어떤 시스템이 "AGI"라는 주장은 정의, 측정 절차, 시험한 시스템 조건, 근거를 밝힐 때만 의미가 있다.[1]
2. 정의와 용어
정의는 다양하지만, AGI를 서로 무관한 과제별 기술의 모음과 구별하는 데 도움이 되는 요소 네 가지가 반복해서 나타난다.[1]
- 폭: 좁게 정해진 한 과제의 탁월함이 아니라, 넓은 범위의 과제나 환경에서의 능력.
- 깊이: 제시된 기준에 이르는 수행 수준. 흔히 관련 기술을 가진 사람과 비교해 정한다.
- 적응: 학습 때 개별적으로 나타나지 않은 과제에서도 배우고, 지식을 전이하고, 능력을 얻는 힘.
- 신뢰성: 표현, 맥락, 데이터 분포, 과제 길이가 바뀌어도 쓸모 있게 유지되는 성능.[1]
모든 정의가 네 요소를 다 담는 것은 아니다. 예를 들어 OpenAI 헌장은 AGI를 "경제적으로 가치 있는 대부분의 일에서 인간을 능가하는 고도로 자율적인 시스템"으로 정의한다.[6] 이는 일과 자율성에 묶인 조직 차원의 정의이지 분야 전체의 표준이 아니다. Google DeepMind의 연구 틀은 이와 달리 성능 및 일반성을 자율성과 분리해, 시스템의 능력 수준을 배포 때 주어지는 자유도와 별개로 논의할 수 있게 한다.[2][1]
"일반"이라는 말에도 단서가 필요하다. 유한한 시스템은 논리적으로 가능한 모든 과제를 해낼 수 없고, 인간 지능도 감각 기관, 문화, 교육, 시간, 신체적 제약의 영향을 받는다. 그래서 실제 정의는 숙련된 성인이 하는 인지 과제, 경제적으로 가치 있는 일, 특정 환경 분포 전반의 수행처럼 범위를 고른다.[7][8]
AGI는 다음 용어들과 관련되지만 서로 바꿔 쓸 수 없다.[1]
- 좁은 AI(narrow AI): 제한된 과제나 분야에 맞춰 설계·최적화된 시스템. 일반적이지 않아도 그 과제에서는 어떤 사람보다 훨씬 뛰어날 수 있다.
- 범용 AI(general-purpose AI): 여러 용도로 쓸 수 있는 모델. 더 넓은 제품·정책 범주이며, 그것만으로 인간 수준의 적응력이나 신뢰성이 성립하지는 않는다. 대규모 언어 모델은 범용이면서도 능력이 매우 고르지 않을 수 있다.
- 인공 초지능(artificial superintelligence): 보통 선택한 인간 기준에 맞먹는 수준을 넘어 인간 성능을 능가하는 폭넓은 지능을 뜻한다. 일부 수준 체계는 이를 AGI 위에 둔다.[2]
- 강한 AI(strong AI): 올바르게 프로그래밍된 컴퓨터가 문자 그대로 마음이나 이해를 가진다는 주장과 흔히 연결되는 철학 용어. 존 설(John Searle)이 1980년에 다룬 강한 AI와 중국어 방 논의는 이해와 정신성에 관한 것이었지, 폭넓은 과제 수행에 대한 현대 공학적 기준이 아니었다.[9]
- 자율성: 시스템이 얼마나 독립적으로 행동을 고르고 수행하는가. 폭넓게 유능한 모델도 낮은 자율성으로 배포될 수 있고, 훨씬 좁은 AI 에이전트에 상당한 운영 자유가 주어질 수도 있다.
- 변혁적 AI(transformative AI): 역사적 대변혁에 견줄 규모의 변화 같은 결과를 가리킨다. 특정 AGI 정의를 충족하지 않는 시스템에서도 그런 결과가 나올 수 있다.[1]
AGI는 논리적으로 의식, 감각 능력, 감정, 인간과 닮은 내부 과정, 인간형 신체를 요구하지 않는다. 일부 제안된 정의와 연구 프로그램은 이 가운데 하나 이상을 포함하지만, 능력 기반 정의는 대체로 포함하지 않는다.[2] 기계가 의식을 가질 수 있는지는 별개의 철학적·과학적 질문이다.[1]
3. 역사
AGI라는 야망은 이 용어보다 앞선다. 1955년 다트머스 여름 연구 프로젝트 제안서에서 존 매카시(John McCarthy), 마빈 민스키(Marvin Minsky), 나다니엘 로체스터(Nathaniel Rochester), 클로드 섀넌(Claude Shannon)은 학습과 지능의 여러 측면을 기계가 흉내 낼 수 있을 만큼 정밀하게 기술할 수 있다는 추측에 바탕을 둔 1956년 연구를 제안했다. 제안서는 언어 사용, 추상화, 문제 해결, 자기 개선을 주제로 꼽았다.[10]
1950년 앨런 튜링(Alan Turing)은 기계가 생각할 수 있느냐는 질문을 관찰 가능한 모방 게임으로 바꿔 놓았다. 이후 "튜링 테스트"라는 이름은 그 제안에서 나온 대화형 행동 시험을 가리킨다.[11] 이 시험은 역사적으로 영향력이 컸지만, 대화를 모방한다고 해서 AGI와 연결되는 모든 능력이 측정되는 것은 아니다. 견고한 계획 능력이나 신체 능력 없이도 대화에서 사람을 흉내 낼 수 있고, 대화형이 아닌 시스템이 중요한 형태의 지능을 가질 수도 있다.[1]
2024년 「Levels of AGI」 논문의 역사 검토에 따르면 "인공 일반 지능"이라는 표현은 1997년 Mark Gubrud의 논문에 나타났다. 이 용어는 이후 10년 동안 연구 분야의 명칭으로 더 체계를 갖췄다.[2] Ben Goertzel과 Cassio Pennachin이 엮은 2007년 책 「Artificial General Intelligence」는 폭넓은 기계 지능을 명시적으로 내세운 연구를 모았다.[12] 첫 AGI 학회는 2008년 3월 1~3일 미국 테네시주 멤피스에서 AAAI(Association for the Advancement of Artificial Intelligence)와 협력해 열렸다.[3]
머신러닝 시스템이 특정 과제에서 크게 성공하면서 이 이름표가 더 널리 쓰였다. 고정된 분야 안에서 평가되는 시스템과, 폭넓고 적응력 있는 지능이라는 오래된 야망을 구별하는 방법이 되었기 때문이다. 시스템이 폭넓은 인터페이스에 좁거나 취약한 기반 능력을 결합할 수 있어서 그 경계는 계속 논쟁거리다.[1]
4. 운영 정의 틀
정의와 무관한 AGI 점수는 없다. 제안된 모든 측정에는 과제, 사전 지식, 경험, 비교할 사람 집단, 허용 오차에 관한 선택이 들어 있다. 영향력 있는 네 가지 접근이 그 선택의 폭을 보여 준다.[1]
| 접근 | 핵심 아이디어 | 기여 | 주요 한계 |
|---|---|---|---|
| 성능과 일반성 수준 | 능력의 폭과 깊이를 함께 보아 시스템을 분류한다 | 이분법 대신 단계적 진행을 쓰고 능력과 자율성을 분리한다 | 아직 없는, 폭넓고 생태학적으로 타당한 벤치마크가 필요하다[1] |
| 보편 지능 | 계산 가능한 환경들의 가중 분포 전반에서 기대 보상을 측정한다 | 수학적으로 명시적이고 행위자 중심인 정의를 제공한다 | 이상적 측정은 계산할 수 없어 완전한 실용 시험으로 구현할 수 없다[1] |
| 기술 습득 효율 | 시스템이 사전 지식과 경험을 새 과제의 기술로 바꾸는 효율을 측정한다 | 지능과, 많은 데이터나 과제별 학습으로 사들인 기술을 구별한다 | 결과가 범위, 사전 지식, 경험, 과제 난이도를 어떻게 정하느냐에 달려 있다[1] |
| 성인의 인지 다재다능성과 숙련도 | 시스템을 교육 수준이 높은 성인과 심리측정학에 바탕을 둔 인지 영역별로 비교한다 | 사람 비교 대상과 시험 영역을 명시한다 | 합의된 표준이 아니라 제안된 틀이며, 결과가 선택한 시험과 채점 규칙에 달려 있다[1] |
4.1. 성능·일반성 수준 체계
Morris와 동료 연구진은 한 축은 성능, 다른 축은 일반성인 행렬을 제안했다. 성능 수준은 AI 없음, 초기(emerging), 유능(competent), 전문가(expert), 탁월(exceptional), 초인(superhuman) 순이다. "유능"은 숙련된 성인의 50백분위 이상을 뜻하고, "전문가"와 "탁월"은 각각 90백분위와 99백분위를 쓴다. 일반 시스템은 새 기술 학습 같은 메타인지 과제를 포함해 폭넓은 비물리적 과제에서 수행해야 한다.[2]
저자들은 2023년 9월 평가에서 최첨단 언어 모델을 "초기 AGI(Emerging AGI)"의 예로 보았다. 숙련되지 않은 사람과 비슷하거나 다소 나은, 폭은 넓지만 고르지 않은 성능을 뜻한다. 당시 공개된 시스템 가운데 "유능한 AGI(Competent AGI)" 칸에 이른 것은 없다고 저자들은 썼다. 이 명칭은 그 틀 안의 속성이지 분야가 받아들인 선언이 아니다. 논문은 자율성도 능력 점수의 일부가 아니라 배포 차원으로 다룬다.[2]
4.2. 보편 지능
셰인 레그(Shane Legg)와 마커스 허터(Marcus Hutter)는 지능을 환경 전반에서 행위자가 보이는 기대 성능으로 형식화했고, 더 단순한 계산 가능 환경에 더 큰 가중치를 준다. 이 제안은 적응과 목표 달성을 수학적으로 일반적인 방식으로 담는다.[7] 이는 정의와 시험의 차이도 드러낸다. 이상적 양은 계산할 수 없는 콜모고로프 복잡도에 의존하므로, 실용적 평가는 유한한 환경 집합으로 근사할 수밖에 없다.[1]
이 접근은 AGI에 대한 유일하게 옳은 인간 기준선을 정하지 않고, 기계 지능의 일반 이론을 제공한다. 이 이론을 실제 AGI 판정으로 옮기려면 여전히 환경, 보상, 자원, 비교 집단에 대한 선택이 필요하다.[1]
4.3. 기술 습득 효율
프랑수아 숄레(François Chollet)는 익숙한 과제에서의 성능은 지능이 아니라 기술의 척도일 수 있다고 주장했다. 시스템은 방대한 사전 지식, 큰 학습 데이터, 과제별 공학으로 높은 성능을 얻을 수 있다. 그가 제안한 측정은 학습 시스템이 사전 지식과 경험을 이전에 알지 못한 과제의 기술로 바꾸는 효율로 지능을 정의한다.[8]
이런 관점은 시험 전에 수험자가 아는 것과 받는 경험의 양을 통제하는 평가로 이어진다. 비교도 조건부가 되어, 두 시스템은 같은 범위에서 사전 지식과 경험이 충분히 비슷할 때만 의미 있게 비교할 수 있다. ARC-AGI 벤치마크 시리즈는 이 지능관에서 나왔다.[1]
4.4. 인지 영역 틀
Dan Hendrycks와 공저자들의 2025년 프리프린트는 AGI를 교육 수준이 높은 성인의 인지적 다재다능함과 숙련도에 맞먹는 것으로 정의하자고 제안했다. 이 틀은 Cattell-Horn-Carroll 심리측정학의 아이디어를 가져와 열 개 영역을 나누며, 여기에는 지식, 읽기와 쓰기, 수학, 추론, 작업 기억, 장기 기억, 시각 처리, 청각 처리, 처리 속도가 들어 있다.[13]
이 논문의 가치는 방법론에 있다. 기준이 되는 사람 집단을 밝히고, 하나로 뭉뚱그린 이름표를 점검 가능한 구성 요소로 나눈다. 논문이 보고한 모델 점수를 공식 AGI 백분율로 다뤄서는 안 된다. 시험, 가중치, 모집단 기준선, 모델 접근 조건, 해석은 여전히 논란의 여지가 있고, 2026년 7월까지 이 논문이 보편적 표준을 확립하지는 못했다.[1]
5. 진척 측정
5.1. 신뢰할 만한 평가의 조건
유용한 AGI 평가에는 문제 모음에서의 최고 정확도 이상을 보여 주는 근거가 필요하다. 최소한 다음을 다뤄야 한다.[1]
- 과제 범위: 시험이 편리한 학술 벤치마크 묶음이 아니라, 방어할 수 있는 범위의 인지 활동을 표본으로 삼는가.
- 새로움: 과제가 시스템에 정말 새로운가, 아니면 해답이나 비슷한 변형, 채점 패턴이 학습에 나타났을 수 있는가.
- 적응: 제한된 경험에서 새 규칙을 배우고 배운 것을 전이할 수 있는가.
- 견고성: 다르게 바꿔 말하기, 바뀐 인터페이스, 낯선 맥락, 적대적이거나 우연한 교란에도 성능이 유지되는가.
- 보정과 신뢰성: 불확실성을 인식하고, 자신 있는 거짓 생성을 피하고, 오류에서 회복하는가.
- 자원 계산: 데이터, 연산, 사람이 만든 보조 구조, 도구 접근, 시간, 반복 샘플링을 얼마나 썼는가.
- 사람 비교: 기준이 되는 사람은 누구이고, 어떤 도움을 받으며, 속도·비용·배경의 차이는 어떻게 처리하는가.
- 외적 타당성: 통제된 결과가 목표가 모호하고 중단과 결과가 따르는 실제 과제의 성능을 예측하는가.[1]
이 요건들은 서로 충돌할 수 있다. 많은 활동을 표본으로 삼을 만큼 폭넓은 시험은 데이터 오염을 막기 어려울 수 있다. 비공개 시험은 유출을 줄이지만 독립적인 재현을 어렵게 한다. 사람 기준선은 해석 가능성을 높이지만 교육, 문화, 접근성, 전문성에 따라 다르다. 하나의 종합 수치는 안전이 중요한 분야의 심각한 약점을 가릴 수 있다.[1]
5.2. 벤치마크의 변화
ARC 시리즈는 시스템과 학습 방식이 바뀜에 따라 평가가 왜 달라지는지 보여 준다. 첫 ARC는 새로운 격자 변환 과제와 의도적으로 제한한 가정된 사전 지식 집합을 사용했다. ARC-AGI-2는 정적 과제의 추론 깊이를 높였다. 2026년에 도입된 ARC-AGI-3는 에이전트가 자연어 지시 없이 탐색하고, 목표를 추론하고, 내부 모델을 만들고, 계획해야 하는 상호작용형 턴제 환경으로 옮겨 갔다.[14]
벤치마크 저자들이 2026년 3월에 한 시험에서 사람은 보정된 환경을 모두 풀었고, 시험한 최첨단 시스템은 1퍼센트 미만의 점수를 받았다. 이는 벤치마크가 밝힌 조건에서의 그 시스템들에 관한 증거이지, 사람에게 측정 가능한 단일한 일반 지능의 본질이 있다는 증거나 특정 퍼센트가 AGI를 인증한다는 증거가 아니다. 논문 자체도 학습 데이터가 늘어날수록 정적 벤치마크가 직접 최적화와 과적합에 취약해질 수 있다고 강조한다.[14]
이 상황은 여섯 달 안에 바뀌었다. 2026년 9월 3일 ARC Prize Foundation은 OpenAI의 GPT-6 Astra를 준공개(semi-private) 세트에서 직접 돌린 결과를 공개했다. 모델이 직접 남기기로 한 메모만 이월하게 하는 재단의 Standard 하네스에서는 62.7퍼센트, 요청 사이에 모델의 불투명한 추론 상태를 보존하고 긴 대화에 압축(compaction)을 쓰는 Provider Adapter 하네스에서는 99.9퍼센트였다. 재단은 이후 두 조건을 따로 보고하겠다고 밝혔다.[15] 점수 가운데 얼마가 모델의 몫이고 얼마가 그를 둘러싼 하네스의 몫인가가 이 결과를 둘러싼 핵심 논쟁이 되었다.[1]
5.3. 흔한 해석 오류
몇 가지 오류가 되풀이되면서 AGI 주장을 근거보다 강해 보이게 만든다.[1]
- 벤치마크 포화: 높은 성능이 폭넓은 전이가 아니라 알려진 시험을 겨냥한 학습을 반영할 수 있다.
- 데이터 오염: 시험 문항이나 그와 비슷한 것이 학습 데이터에 들어 있을 수 있다.
- 최선 결과만 보고: 최고 표본이나 프롬프트를 고르면, 한 번만 시도하는 사용자가 겪는 신뢰성이 가려진다.
- 도구와 보조 구조의 모호함: 결과가 검색 시스템, 코드 실행, 사람이 쓴 계획, 반복 재시도에 달려 있는데 모델 설명에는 빠져 있을 수 있다.
- 범주 바꿔치기: 수학, 코딩, 대화, 게임에서의 탁월함을 일반 능력의 증거로 취급한다.
- 의인화 추론: 유창한 언어를 이해, 안정된 믿음, 의식, 독립적 목표의 직접 증거로 받아들인다.
- 배포 추론: 실험실 조건의 능력이 경제적이고 합법적이며 믿을 만한 인간 업무 대체를 뜻한다고 가정한다.[1]
2026년 국제 AI 안전 보고서(International AI Safety Report)는 마지막 유형의 문제를 "평가 격차(evaluation gap)"라고 부른다. 배포 전 시험 성능이 실제 환경에서의 효용이나 위험을 안정적으로 예측하지 못한다는 뜻이다. 보고서는 원인으로 좁은 과제 범위, 낡은 평가, 데이터 오염, 프롬프트 민감성, 통제된 실험실 조건을 꼽는다.[5]
6. 현재 상태
현재 시스템은 능력별로 설명하는 것이 가장 방어하기 쉽다. 범용 모델은 여러 언어로 대화하고, 범위가 정해진 과제의 소프트웨어를 만들고, 미디어를 생성하고, 일부 고급 수학·과학 문제를 푼다. 이 모델을 중심으로 만든 에이전트는 일부 유용한 컴퓨터 작업을 제한된 감독으로 해낸다. 사후 학습 방법과 추론 실행 때의 추가 연산이 추론 관련 평가에서 상당한 향상을 낳았다.[5]
그러나 능력 분포는 여전히 들쭉날쭉하다. 시스템이 어려운 형식 문제를 풀고도 표현, 시각 배치, 필요한 기억, 시퀀스 길이가 바뀌면 더 간단한 과제에서 실패할 수 있다. 현재 시스템은 여전히 환각, 일관성 없는 답, 여러 단계 작업을 망치는 실수를 낸다. 과제가 길어지면 성능이 떨어지고, 예상 밖의 장애물에 안정적으로 적응하는 능력은 제한적이다. 로보틱스와의 통합도 텍스트 등 디지털 분야의 성능에 뒤처진다.[5]
이런 이유로 다음 진술들은 서로 다르다.[1]
- 시스템이 여러 과목의 질문에 답할 수 있다.
- 시스템이 평가 조건에서 선별된 전문 과제를 완수할 수 있다.
- 시스템이 낯선 과제를 효율적으로 배울 수 있다.
- 시스템이 대부분의 인지 노동을 안정적이고 경제적으로 수행할 수 있다.
- 시스템이 공개된 특정 AGI 정의를 충족한다.
- 분야가 AGI가 달성되었다는 데 동의한다.[1]
한 진술의 증거가 다음 진술을 자동으로 입증하지는 않는다. 현재 AGI 지위에 관한 주장은 정확한 시스템 버전, 접근 방식, 도구, 평가 날짜, 채점 절차, 정의를 밝혀야 한다. 모델 브랜드나 개발사의 내부 분류는 독립적인 과학적 검증이 아니다.[1]
6.1. GPT-6 Astra 출시(2026년 9월)
가장 눈에 띄는 최근의 도래 주장은 2026년 9월 3일 OpenAI가 GPT-6 Astra를 순차 배포하면서 나왔으며, 이 사례는 앞서 짚은 구분 대부분과 관련된다. OpenAI의 출시 글은 이 모델을 "세계에서 가장 지능적이고 정렬된 모델"이라 부르고 ARC-AGI-3를 99.9% 점수로 "포화시켰다(saturates)"고 하지만, 모델을 AGI라고 부르지는 않는다.[16]
AGI라는 표현은 보도진 브리핑에서 나왔고, 언론은 이를 전언으로 보도했다. The New Stack에 따르면 브록먼은 AGI가 여전히 "회색의 흐릿한 것"이라고 인정하면서, 지금 AGI 시대에 있다고 느끼는 것이 무리한 일은 아니라고 말했다. OpenAI가 AGI 달성을 공식 선언하는 것이냐는 질문에는, 그 용어가 더 이상 계약상 발동 조건과 묶여 있지 않고 "사명 개념 또는 정신적 개념"이라고 답했다. 이 기준을 충족하는지는 독자가 스스로 판단하도록 맡기되, 개인적으로는 도달했다고 보며 이를 뒷받침하는 꽤 좋은 논거가 있다고 했다. 다만 이것은 여정의 끝이 아니라 시작이라고 덧붙였고, 브리핑을 "AGI 시대에 오신 것을 환영합니다"로 마무리했다.[4]
VentureBeat은 정의에 관한 그의 발언을 더 길게 실었다. OpenAI를 시작할 때는 모두가 "저것이 AGI"라고 알아볼 명확한 순간이 올 것이라 생각했지만 실제로는 그렇지 않았고 훨씬 회색의 흐릿한 것이었다는 취지다. 점진적 관점도 인용했는데, 1년 뒤에 돌아보면 그 사이 어느 시점에도 AGI 시대가 아니었다고 말하기는 꽤 어려울 것이라는 말이다.[17] TechCrunch는 계약 관련 발언을 "이제 계약상 AGI 발동 조건은 없으니, 사실 그것은 관련 있는 개념이 아니다"로 보도했다.[18]
Axios는 브록먼이 OpenAI가 AGI에 도달했다고 개인적으로 믿으면서도 Astra가 그 정의를 충족하는지는 사용자가 판단하도록 맡겼다고 요약했고, NBC News는 그가 Astra를 AGI의 한 형태로 보는 것이 합리적이라고 말했다고 보도했다.[19][20] 모델 자체에 대해 그가 내세운 주장은 더 좁았다. CNBC는 그가 "질적으로 개선되었다고 생각하는 의미 있는 무언가가 있다"고 말하며 "사람들이 AI에 맡길 수 있는 일의 종류에 일어난 실제 변화"를 이야기했다고 인용했다.[21]
계약상 언급은 OpenAI와 Microsoft의 계약에 관한 것이다. Microsoft가 2025년 10월 28일 발표한 조건에서는 OpenAI의 AGI 선언을 독립 전문가 패널이 검증하도록 했고, 그 검증(또는 2030년 중 먼저 오는 쪽)이 OpenAI 연구에 대한 Microsoft 권리의 종료일이자 수익 배분 계약의 종료일이 되도록 했다.[22] 양사가 2026년 4월 27일 발표한 수정은 Microsoft의 라이선스를 비독점으로 바꾸고, 수익 배분 지급이 "OpenAI의 기술 진척과 무관하게 2030년까지 계속된다"고 밝혔다. 양사의 4월 조건 요약은 AGI를 언급하지 않으며 전문가 패널 조항이 어떻게 되었는지도 밝히지 않는다.[23][24] 브록먼의 발언은 이 요약들과 맞는다. 앞서 소개한 OpenAI 헌장의 정의는 그가 말한 사명 개념으로 남고, 계약상 결과는 따르지 않는다.[1]
이 주장의 근거로 가장 자주 인용된 것은 ARC-AGI-3 점수였고, 그 산출 방식은 자원 계산이 왜 중요한지 보여 준다. OpenAI가 공개한 표는 99.9%에 각주를 달아, 모델을 "실제 환경의 성능에 더 잘 맞추기 위해 두 가지 설정을 바꾸는 우리의 responses API 하네스로 실행했다"고 적는다. The New Stack이 짚었듯 비교 대상 모델들은 다른 설정에서 평가되었고, 브리핑 전에 배포된 보도 자료에는 98.6%가 적혀 있었으며 The New Stack과 VentureBeat이 이 수치를 실었다.[4][17][16][25]
두 설정은 턴 사이에 추론을 유지하는 것과 긴 컨텍스트를 압축하는 것이다. OpenAI는 2026년 7월 29일, 이를 켜자 모델을 바꾸지 않고도 GPT-5.6 Sol의 공개 과제 세트 점수가 대략 세 배가 되었다고 보고했다.[26] ARC Prize Foundation은 출시 당일 자체 실행 결과를 공개했다. Standard 하네스에서 GPT-6 Astra는 준공개 세트에서 62.7%를 받았고 실행 비용은 약 26,000달러였다. OpenAI의 불투명한 추론 상태를 요청 사이에 보존하고 압축을 쓰는 Provider Adapter 하네스에서는 99.9%에 약 19,000달러였다.[15]
AGI를 "시스템이 사람이 습득할 수 있는 어떤 기술이든 사람만큼 효율적으로 습득하는 능력"으로 정의하는 재단은 이 결과를 "최첨단 모델 능력의 눈에 띄는 계단식 도약(step-function change)"이라 불렀고, 최대 추론 노력에서 모델이 96.0%의 레벨에서 사람 시험자의 중앙값보다 적은 행동을 썼다고 보고했다. 그러면서도 "AGI라고 주장하는 것은 아니다"라고 썼고, 벤치마크를 포화시켜도 "AGI 달성의 증명"은 아니라고 거듭 밝혔으며, ARC-AGI-3는 "범위와 형식이 엄격히 제한되어 있고" "현실 세계의 복잡성과 개방성을 대표하지 않는다"고 했다.[15]
VentureBeat은 브록먼이 ARC-AGI-3 점수를 AGI의 증거로 내세우지 않았고 보편적으로 받아들여진 기술적 기준선을 넘었다고 주장하지도 않았다고 지적했다. 또 출시 자료에 GDPval이 빠졌다고 짚었다. GDPval은 OpenAI가 2025년에 "경제적으로 가치 있는 실제 과제"에서의 성능을 추적하려고 도입한, 44개 지식 노동 직종에서 뽑은 1,320개 과제의 벤치마크이며, 이는 OpenAI 헌장 정의의 기준과 같다. 이 매체는 현재 GDPval이 한 번에 끝나는 과제여서 Astra가 해내도록 만들어진 장기·다중 애플리케이션 작업을 측정하지 못하므로, 이 벤치마크는 주장과 관련이 있으면서도 모델의 가장 에이전트적인 능력과는 맞지 않는다고 덧붙였다.[17]
The New Stack의 벤치마크 결과 분석은 조건부 결론에 이르렀다. AGI가 여러 분야에서 유용한 지적 작업을 하는 것이라면 Astra는 "많은 사람이 한때 마음에 그렸던 것에 놀랄 만큼 가까워지고 있다"고 했고, 전반에 걸쳐 인간의 판단에 맞먹는 것을 뜻한다면 "ARC-AGI-3는 그것을 입증할 수 없다"고 했다.[25] The New Stack은 소유주인 Insight Partners가 OpenAI에 투자한다고 밝힌다.[1]
앞서 소개한 요소에 비추어 보면, 이 출시가 낳은 것은 개발사 인물이 밝힌 개인적 판단, 공개되었으나 표준이 아닌 평가 조건에서 회사가 보고한 점수, 대표 수치를 하네스별로 둘로 가른 독립 검증, 그리고 자기 시험이 AGI를 입증하지 않는다는 한 벤치마크 기관의 명시적 진술이었다. 합의된 정의, 방어 가능한 범위의 과제에 걸친 측정, 분야의 합의는 나오지 않았고, 회사도 공식 선언을 하지 않았다.[1]
7. 전망
AGI 전망은 불확실성 아래의 믿음에 관한 진술이지 기존 능력의 측정이 아니다. 결과는 정의와 질문 문구에 크게 좌우된다.[1]
Katja Grace와 동료들이 보고한 설문은 주요 AI 학회 여섯 곳에 논문을 낸 연구자 2,778명의 응답을 모았다. 과학 활동이 큰 중단 없이 이어진다는 조건에서, 종합 예측은 "도움 없는 기계"가 모든 가능한 과제에서 인간을 능가할 확률을 2027년까지 10퍼센트, 2047년까지 50퍼센트로 보았다. 모든 인간 직업이 완전히 자동화될 수 있다는 예측의 중앙값은 훨씬 늦어, 2116년에 50퍼센트에 이르렀다.[27] 관련돼 보이는 두 질문이 매우 다른 시간표를 낳았다.[1]
저자들은 상당한 프레이밍 효과를 보고했고, 전문가 예측을 객관적 진실로 다뤄서는 안 된다고 명시적으로 경고했다. 질문 속 사건도 모든 AGI 정의와 같지는 않다. 설문은 응답자 믿음의 분포를 측정할 수 있지만, 기술적 기준선이 언제 올지는 확정할 수 없다.[1]
2025년 AAAI 회장 직속 패널(Presidential Panel on the Future of AI Research)은 다른 종류의 의견 증거를 보고했다. 설문 응답자 475명 가운데 76퍼센트는 현재 AI 접근을 확장해 AGI에 이르는 것이 성공할 가능성이 낮거나 매우 낮다고 판단했다. 77퍼센트는 AGI를 직접 추구하기보다 허용 가능한 위험-편익 프로필을 가진 시스템을 설계하는 쪽을 선호했고, 70퍼센트는 완전한 안전·통제 장치가 갖춰질 때까지 AGI를 지향하는 연구를 중단하는 데 반대했다.[28] 이 결과는 그 표본의 견해를 기록할 뿐, 확장이 실패한다거나 AGI가 실현 가능하다는 것을 증명하지 않는다.[1]
경영진, 투자자, 예측 시장, 개별 연구자가 밝힌 공개 도래 시점은 발언자에게 귀속시키고 날짜를 적어야 한다. 움직이는 예측은 기술적 준비 상태에 관한 사실이 아니다. 합의가 없을 때 합의된 연도가 있는 것처럼 제시해서는 안 된다.[1]
8. 연구 접근
어떤 연구 프로그램도 AGI로 가는 필수 경로이거나 충분한 경로임이 입증되지 않았다. 일부 겹치는 여러 접근이 진행 중이다.[1]
8.1. 범용 모델, 사후 학습, 도구
한 접근은 폭넓은 데이터로 점점 더 유능한 파운데이션 모델을 만든 뒤, 지시 조정, 선호 최적화, 강화 학습, 합성 데이터, 도구 사용, 검색, 추론 실행 중 추가 연산으로 개선하는 것이다. 이 경로는 하나의 공유 모델을 언어, 코딩, 비전, 오디오 등 여러 과제에 재사용하는 시스템을 낳았다. 2026년 국제 AI 안전 보고서는 최근 능력 향상의 중요한 부분을 더 큰 초기 학습만이 아니라 사후 학습과 추론 실행 시점 기법 덕으로 돌린다.[5][1]
인터페이스가 넓다고 해서 견고한 일반성이 있는 것은 아니다. 연구 과제로는 사실 신뢰성, 적은 경험으로 효율적으로 배우기, 지속되는 기억, 장기 계획, 불확실성 추정, 분포 변화에서의 전이가 있다. 외부 도구가 일부 약점을 보완할 수 있지만, 그 경우 평가는 기반 모델만이 아니라 시스템 전체를 명시해야 한다.[1]
8.2. 강화 학습 에이전트
강화 학습은 보상 신호를 극대화하도록 환경에서 행동하는 에이전트를 연구한다. 데이비드 실버(David Silver), 사틴더 싱(Satinder Singh), 도이나 프리컵(Doina Precup), 리처드 서튼(Richard Sutton)은 보상 극대화가 원칙적으로 학습, 지각, 일반화, 언어, 사회적 지능 등 지능과 관련된 능력을 낳을 수 있다는 입장을 폈다.[29] 이 논문은 가설을 제시한 것이지, 보상만으로 AGI가 나왔다는 경험적 증명이 아니다.[1]
에이전트 연구는 목표, 행동, 피드백, 탐험, 장기적 결과를 명시적으로 다룬다. 남은 문제로는 사람들이 의도한 바를 반영하는 보상 정하기, 실제 과제는 달성하지 않고 점수만 잘 받는 지름길 피하기, 복잡한 환경에서 효율적으로 배우기, 피드백이 드물거나 지연될 때 안전하게 작동하기가 있다.[1]
8.3. 인지 아키텍처와 월드 모델
인지 아키텍처 연구는 기억, 지각, 행동 선택, 학습, 추론을 일관된 시스템 하나로 통합하려 한다. John Laird, Christian Lebiere, Paul Rosenbloom이 제안한 인지의 공통 모델(Common Model of Cognition)은 여러 인간형 인지 아키텍처에 공통된 구조를 정리하며, 작업 기억, 선언적·절차적 장기 기억, 지각, 운동 시스템이 포함된다.[30]
이런 아키텍처는 능력이 어떻게 상호작용하고 지식이 시간에 걸쳐 어떻게 유지되는지에 관한 명시적 가설을 제공한다. 구성 요소는 기호적일 수도, 신경망적일 수도, 혼합일 수도 있다. 선택한 인지 구조를 재현하면 AGI에 기대하는 폭, 효율, 신뢰성이 나온다는 것이 그것만으로 입증되지는 않는다.[1]
다른 한 갈래는 환경의 예측 표현을 학습해 계획에 쓰는 시스템을 강조한다. 안나 다비트(Anna Dawid)와 얀 르쿤(Yann LeCun)은 계층적 결합 임베딩 예측 아키텍처와 잠재 변수 에너지 기반 모델을 자율적 기계 지능으로 가는 제안된 경로의 구성 요소로 설명했다.[31] 이는 여러 연구 제안 중 하나다.[1]
임바디드 AI는 물리적 또는 시뮬레이션 환경에서의 지각과 행동을 더한다. 신체는 정적 텍스트 예측과 달리 시스템이 인과, 사물의 지속성, 공간, 행동의 결과를 접하게 할 수 있다. 그러나 AGI에 물리적 신체가 필요하다는 주장은 여전히 논쟁적이다. 능력 틀은 물리적 기술을 모든 인지적 정의의 전제 조건으로 삼지 않고 일반성의 추가적 원천으로 다룰 수 있다.[2][1]
8.4. 신경기호 시스템과 인간형 학습
딥러닝은 큰 데이터셋에서 표현을 학습하는 데 효과적이고, 기호 AI는 규칙, 제약, 구조화된 지식을 명시할 수 있다. 신경기호 연구는 신경 학습을 기호적 지식 표현·논리적 추론과 원칙에 따라 결합하는 방법을 탐구한다.[32] 목표는 더 나은 체계적 일반화, 해석 가능성, 추론이지만, 그 모든 문제를 해결하는 합의된 혼합 아키텍처는 없다.[1]
관련 제안들은 학습된 지각을 탐색, 계획, 인과 모델, 프로그램 합성, 외부 기억, 검증과 결합한다. 접근이 다양하다는 것은 현재 모델군에 점진적 개선이 필요한지, 새 구성 요소가 필요한지, 근본적으로 다른 학습 원리가 필요한지가 불확실함을 반영한다.[1]
일부 연구자는 진전에 사람처럼 배우는 시스템이 필요하다고 주장한다. 적은 예에서, 조합적 개념과 사물·행위자에 대한 직관 이론을 바탕으로 인과적 설명을 만들어 배우는 시스템이다. Brenden Lake와 동료들의 2017년 리뷰는 이 속성들을 사람처럼 배우고 생각하는 기계의 재료로 규정했다.[33] 인간의 인지는 가설의 원천이지 모든 세부를 복제해야 할 명세가 아니다. 생물학적 한계와 편향이 저절로 바람직한 공학적 특징이 되는 것은 아니다.[1]
8.5. 목표에 대한 비판
AGI를 목표로 삼는 것이 유용한지부터 논쟁거리다. 유다 골드펠더(Judah Goldfeder), 필리프 와이더(Philippe Wyder), 얀 르쿤(Yann LeCun), 라비드 슈워츠지브(Ravid Shwartz-Ziv)의 2026년 논문은 인간이 제한 없는 의미에서 일반적이지 않다고 주장하며, 중요한 기술을 배우고 인간 능력의 빈틈을 메우는 데 초점을 둔 대안 목표로 "초인적 적응 지능(superhuman adaptable intelligence)"을 제안한다.[34] 이는 최근의 입장 논문이지 새로운 합의 용어가 아니다.[1]
비판자들은 이분법적 AGI 이름표가 문턱 마케팅을 부추기고, 들쭉날쭉한 능력 분포를 가리며, 유용한 보완성보다 인간 대체에 초점을 둔다고도 주장한다. 옹호자들은 폭과 적응력이 질적으로 다른 기회와 위험을 낳을 수 있는 시스템을 논의하는 데 공유된 용어가 유용하다고 답한다. 수준 기반·다차원 틀은 주제를 유지하면서 주장을 더 정밀하게 하려는 시도다.[1]
9. 안전과 통제
AI 안전은 미래의 AGI만이 아니라 현재 시스템도 대상으로 한다. 논쟁적인 AGI 기준선을 넘을 때까지 안전 분석을 미루는 것은 잘못이다. 현재의 범용 시스템도 오용, 신뢰할 수 없는 출력, 개인정보 침해, 편향, 사이버 작전, 정보 환경에 대한 영향으로 이미 위험을 만든다. 더 유능한 시스템은 일부 위험을 키우거나 새로운 조합을 만들 수 있다.[5]
사고 위험에 관한 초기 기술 연구는 의도하지 않은 부작용, 보상 해킹, 불충분한 감독, 안전하지 않은 탐험, 분포 변화에서의 실패를 문제로 꼽았다.[35] 이는 AGI에만 있는 문제가 아니다. 시스템의 접근 범위가 넓거나 자율성이 크거나 중요한 과정에 영향을 줄수록 더 큰 결과를 낳는다.[1]
AI 정렬은 시스템 행동을 사람의 의도, 제약, 가치에 맞추는 방법을 연구한다. 문제에는 최소 세 층이 있다.[1]
- 명세: 목표와 규칙을 학습 신호나 시스템 요구사항으로 옮기기.
- 일반화: 개발 중 나타나지 않은 상황에서도 의도한 행동을 유지하기.
- 통제와 감독: 문제를 감지하고, 접근을 제한하고, 행동을 교정하고, 필요할 때 시스템을 중단하기.[1]
사람의 선호는 불완전하고 맥락에 따라 달라지며 때로 충돌한다. 따라서 정렬은 완벽한 목표를 입력하는 문제만이 아니다. 누구의 이익을 따질지, 충돌을 어떻게 풀지, 누가 시스템을 감사하거나 이의를 제기할 수 있는지에 관한 제도적 선택도 포함한다.[1]
2026년 국제 AI 안전 보고서는 통제 상실 시나리오를, 하나 이상의 범용 AI 시스템이 누구의 통제도 받지 않고 작동하며 통제를 되찾는 데 드는 비용이 극도로 크거나 되찾기가 불가능한 경우로 정의한다. 이런 시나리오의 가능성을 두고 전문가 의견이 크게 갈린다고 보고한다.[5]
보고서는 현재 증거의 경계도 짚는다. 현재 시스템은 실험실 환경에서 관련 능력의 초기 징후를 보이지만 통제 상실을 가능하게 할 수준은 아니다. 심각한 시나리오에는 감독 회피, 장기 계획 실행, 가동 유지, 대응책에 대한 저항 같은 능력의 조합이 필요하다. 현재 에이전트는 긴 과제에서 여전히 신뢰할 수 없고, 그런 시나리오에 필요한 통합과 견고성은 현재 시스템의 능력 밖이다.[5]
이것이 미래의 통제 상실이 불가능하다는 것을 입증하지는 않는다. 증거는 재앙을 AGI의 입증된 결과로 다루는 것도, 논리적으로 배제된 것으로 일축하는 것도 뒷받침하지 않는다는 뜻이다. 위험 분석은 미래 능력, 시스템 행동, 접근, 배포, 대응책에 관한 가정을 밝혀야 한다.[1]
10. 경제·사회적 영향
AGI는 흔히 경제적 문턱으로 논의되지만, 능력과 노동 대체는 같지 않다. 시스템이 벤치마크에서 과제를 수행하더라도 신뢰성이 낮거나, 비싸거나, 느리거나, 보안이 취약하거나, 통합이 어려워 실제 운영에 쓰기 어려울 수 있다. 반대로 더 좁은 시스템 여럿이 AGI 정의를 충족하지 않고도 상당한 업무를 자동화할 수 있다.[1]
고급 AI의 경제적 효과는 시스템이 수행할 수 있는 과제, 도입 비용, 조직 재설계, 노동자의 대응, 규제, 시장 구조, 이득의 분배에 달려 있다. 2026년 국제 AI 안전 보고서는 노동 효과에 관한 현재 증거를 엇갈린다고, 장기 영향은 불확실하다고 설명한다.[5] 이 불확실성이 투명한 모델과 믿을 만한 출처 없이 AGI에 정확한 국내총생산, 실업, 기업 가치 수치를 붙이는 것을 정당화하지는 않는다.[1]
잠재적 이점으로는 과학, 교육, 접근성, 의학, 공학, 공공 서비스에서의 지원이 있다. 잠재적 해악으로는 일자리 대체, 임금과 교섭력의 변화, 경제적·정치적 권력의 집중, 불평등한 접근, 감시, 감사하기 어려운 시스템에 대한 의존이 있다. 어느 것도 AGI라는 말만으로 따라 나오지 않으며, 각각 기술 설계와 배포 제도에 달려 있다.[1]
11. 거버넌스와 위험 관리
AGI에는 합의된 기준선이 없으므로, 거버넌스는 이름표를 기다리지 않고 측정 가능한 속성을 쓸 수 있다. 관련 속성으로는 위험한 분야에서의 능력, 자율성, 도구와 인프라 접근, 소프트웨어를 복사하거나 수정하는 능력, 배포 규모, 실패의 심각도가 있다.[1]
위험 관리 조치로는 배포 전 평가, 독립 시험, 접근 통제, 단계적 공개, 모니터링, 사고 보고, 레드팀 연습, 사이버 보안, 중대한 행동에 대한 사람의 승인, 롤백이나 중단 절차가 있다. 적절한 조합은 시스템과 맥락에 따라 다르다. 국제 AI 안전 보고서는 어떤 단일 조치도 완벽하게 신뢰할 수 없기 때문에 안전장치를 겹쳐 쌓는 심층 방어를 설명한다.[5]
미국 국립표준기술연구소(NIST)의 AI 위험 관리 프레임워크(AI Risk Management Framework)는 AI 시스템의 설계, 개발, 사용, 평가에 신뢰성 고려를 반영하게 하는 자발적 프레임워크다. 2023년에 공개되었고 2024년에 생성형 AI 프로필이 뒤따랐으며, NIST는 AI RMF 1.0이 개정 중이라고 밝힌다.[36] 이 프레임워크는 AI 위험 관리 전반에 적용되며 AGI를 인증하지 않는다.[1]
국제 협력은 어렵다. 개발, 배포, 영향이 국경을 넘는데 법체계와 사회적 우선순위는 다르기 때문이다. 정보 비대칭도 문제다. 개발사는 학습, 능력, 사고, 안전장치에 관한 증거를 가지고 있지만 외부 평가자는 접근할 수 없다. 그래서 거버넌스 제안은 보고 의무, 감사 접근, 컴퓨트 감독, 책임, 모델 공개, 대중 참여를 두고 갈린다.[1]
12. 열린 질문
해결되지 않은 핵심 문제는 다음과 같다.[1]
- "일반"이라는 말을 정당화할 만큼 넓은 과제 범위가 어디까지인지.
- AGI를 평균적 성인, 숙련된 성인, 전문가 집단, 인간 제도 전체의 합산 범위 가운데 무엇에 견줘 측정할지.
- 평가가 도구, 기억 시스템, 반복 시도, 연산, 에너지, 사람의 도움을 어떻게 반영할지.
- 낯선 과제에서의 빠른 학습이 광범위한 학습 뒤의 성능보다 더 핵심적인지.
- 물리적 기술과 로보틱스가 일반성 판단에 어떤 영향을 주어야 하는지.
- 유한한 벤치마크가 오염과 직접 최적화에 맞서 여전히 참고할 가치가 있을 만큼 오래 버틸 수 있는지.
- 신뢰성, 불확실성 보정, 오류 회복을 능력 기준선에 어떻게 포함할지.
- 자율성이 정의에 속하는지, 아니면 별개의 배포 속성으로 남아야 하는지.
- 어떤 안전 요건이 AGI라는 이름표가 아니라 측정된 능력에 따라야 하는지.
- 다차원 프로필이 달성/미달성이라는 이분법적 판단보다 더 유용한지.[1]
이 문제들은 주변적 세부가 아니다. AGI 주장이 무엇을 뜻하는지, 어떤 증거가 그것을 확인하거나 반박할 수 있는지를 결정한다.[1]
각주·출처 36개
- ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12 ↩13 ↩14 ↩15 ↩16 ↩17 ↩18 ↩19 ↩20 ↩21 ↩22 ↩23 ↩24 ↩25 ↩26 ↩27 ↩28 ↩29 ↩30 ↩31 ↩32 ↩33 ↩34 ↩35 ↩36 ↩37 ↩38 ↩39 ↩40 ↩41 ↩42 ↩43 ↩44 ↩45 ↩46 ↩47 ↩48 ↩49 ↩50 ↩51 ↩52 ↩53 ↩54 ↩55 ↩56 ↩57 ↩58 ↩59 ↩60 ↩61 ↩62 ↩63 ↩64 ↩65 ↩66 ↩67 ↩68 ↩69 AI Wiki: Artificial General Intelligence (2026-09-04 수정본) · CC BY 4.0 · 확인 2026-10-10
- ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 Position: Levels of AGI for Operationalizing Progress on the Path to AGI · 확인 2026-10-11
- ↩1 ↩2 AGI-08: First Conference on Artificial General Intelligence (2008 (AI Wiki 인용) · 확인 2026-10-10
- ↩1 ↩2 ↩3 OpenAI launches GPT-6 Astra and says welcome to the 'AGI era' · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 International AI Safety Report, International AI Safety Report 2026 (February 2026 · 확인 2026-10-11
- ↩1 OpenAI Charter (AI Wiki 인용) · 확인 2026-10-10
- ↩1 ↩2 Universal Intelligence: A Definition of Machine Intelligence · 확인 2026-10-11
- ↩1 ↩2 On the Measure of Intelligence · 확인 2026-10-11
- ↩1 Minds, Brains, and Programs · 확인 2026-10-11
- ↩1 A Proposal for the Dartmouth Summer Research Project on Artificial Intelligence · 확인 2026-10-11
- ↩1 Computing Machinery and Intelligence · 확인 2026-10-11
- ↩1 Ben Goertzel and Cassio Pennachin, eds., Artificial General Intelligence (Springer, 2007 · 확인 2026-10-11
- ↩1 A Definition of AGI · 확인 2026-10-11
- ↩1 ↩2 ARC-AGI-3: A New Challenge for Frontier Agentic Intelligence · 확인 2026-10-11
- ↩1 ↩2 ↩3 OpenAI's GPT-6 Astra on ARC-AGI-3 · 확인 2026-10-11
- ↩1 ↩2 GPT-6 Astra: A new generation of intelligence (AI Wiki 인용) · 확인 2026-10-10
- ↩1 ↩2 ↩3 'Welcome to the AGI era': OpenAI launches GPT-6 Astra (AI Wiki 인용) · 확인 2026-10-10
- ↩1 OpenAI launches Astra, its powerful (and controversial) new model · 확인 2026-10-11
- ↩1 'Welcome to the AGI era,' OpenAI says as GPT-6 Astra debuts (AI Wiki 인용) · 확인 2026-10-10
- ↩1 OpenAI releases new model that it says triggered internal security measures · 확인 2026-10-11
- ↩1 OpenAI begins rolling out Astra model after warning of its advanced cyber capabilities · 확인 2026-10-11
- ↩1 The next chapter of the Microsoft-OpenAI partnership · 확인 2026-10-11
- ↩1 The next phase of the Microsoft OpenAI partnership (AI Wiki 인용) · 확인 2026-10-10
- ↩1 The next phase of the Microsoft OpenAI partnership · 확인 2026-10-11
- ↩1 ↩2 GPT-6 Astra aced the hardest AI benchmark. The asterisk matters more than the score · 확인 2026-10-11
- ↩1 How enabling two settings tripled our scores on the ARC-AGI-3 benchmark (AI Wiki 인용) · 확인 2026-10-10
- ↩1 Thousands of AI Authors on the Future of AI · 확인 2026-10-11
- ↩1 AAAI Presidential Panel on the Future of AI Research, The Future of AI Research (2025 · 확인 2026-10-11
- ↩1 Reward is Enough · 확인 2026-10-11
- ↩1 A Standard Model of the Mind · 확인 2026-10-11
- ↩1 Introduction to Latent Variable Energy-Based Models: A Path Towards Autonomous Machine Intelligence · 확인 2026-10-11
- ↩1 Neurosymbolic AI: The 3rd Wave · 확인 2026-10-11
- ↩1 Building Machines That Learn and Think Like People · 확인 2026-10-11
- ↩1 AI Must Embrace Specialization via Superhuman Adaptable Intelligence · 확인 2026-10-11
- ↩1 Concrete Problems in AI Safety · 확인 2026-10-11
- ↩1 AI Risk Management Framework · 확인 2026-10-11