| 분류 | 머신러닝의 모델 구조. 가중치로 연결된 인공 뉴런의 층으로 이루어진다[2] [3] |
|---|---|
| 최초 수학 모델 | 1943년 인공 뉴런의 이진 임계값 모델 제안[4] |
| 최초의 학습 가능 모델 | 1958년 퍼셉트론(Perceptron)[5] |
| 학습 알고리즘 대중화 | 1986년 역전파(backpropagation)[6] |
| 주요 수상 | 2024년 노벨 물리학상: 존 홉필드(John Hopfield), 제프리 힌턴(Geoffrey Hinton)[7] |
쉽게 말하면, 신경망은 작은 계산 단위인 인공 뉴런들이 여러 층으로 연결된 계산 모델이다. 사람이 규칙을 일일이 프로그래밍하는 대신 많은 예시를 보여 주고, 연결마다 붙은 가중치를 조금씩 고쳐 오차를 줄이는 방식으로 과제를 익힌다. 이 구조는 이미지 분류부터 텍스트 생성까지 다양한 일에 쓰인다.[1]
1. 개요
신경망(neural network, 인공 신경망 또는 ANN이라고도 함)은 동물 뇌의 생물학적 신경망에서 느슨하게 영감을 받은 계산 모델이다. 명시적으로 프로그래밍된 규칙을 따르는 대신 단순한 처리 단위들 사이의 연결 강도를 조정하며 과제를 학습한다. 신경망은 층으로 묶인 인공 뉴런 집단으로 구성되고, 뉴런들은 가중치가 붙은 연결을 따라 숫자 신호를 주고받는다. 데이터를 이용해 이 가중치를 조정하면 신경망은 이미지 분류부터 텍스트 생성까지 거의 모든 함수를 근사할 수 있다.[1]
2010년대 초 이후에는 여러 층을 쌓은 심층 신경망(deep neural network)이 머신러닝의 주된 모델 계열이 되었고, 딥러닝과 현대 인공지능의 기술적 토대가 되었다.[2][3]
가장 이른 인공 뉴런의 수학 모델은 1943년 워런 매컬록(Warren McCulloch)과 월터 피츠(Walter Pitts)가 발표했다. 학습 가능한 첫 신경망인 퍼셉트론은 1958년 프랭크 로젠블랫(Frank Rosenblatt)이 내놓았다. 심층 신경망을 실용적으로 만든 역전파 학습 알고리즘은 1986년에 널리 알려졌다.[4][5][6]
2024년에는 존 홉필드와 제프리 힌턴이 인공 신경망으로 머신러닝을 가능하게 한 기초 발견과 발명의 공로로 노벨 물리학상을 받았다.[7]
이 문서는 신경망의 80여 년에 걸친 역사, 수학적 구조, 학습 절차를 개관한다. 주요 구조(예: 합성곱 신경망, 순환 신경망, 트랜스포머), 학습 기법, 이론 개념은 각각 별도 문서에서 다룬다.[1]
2. 쉬운 비유로 보기
작은 계산 담당자가 아주 많이 모인 팀을 상상해 보자. 각 담당자는 들어온 숫자를 곱하고 더한 뒤 결과를 다음 담당자에게 넘기는 단순한 일 하나만 한다. 담당자 한 명은 똑똑하지 않지만, 수천 명을 줄 세워 서로 연결하면 전체 팀이 놀라운 일을 한다. 팀에 고양이 사진을 보여 주면 숫자가 모든 담당자를 거쳐 지나간 뒤 마지막에 팀이 '고양이!'라고 답하게 된다.[1]
팀은 연습으로 실력을 키운다. 처음에는 틀린 답을 내놓는데, 틀릴 때마다 코치가 팀을 거꾸로 훑으며 각 담당자에게 곱셈 값을 아주 조금씩 바꾸라고 알려 준다. 고양이, 개, 자동차 사진을 수천 장 본 뒤 담당자들은 잘 작동하는 숫자에 자리를 잡고, 팀은 한 번도 본 적 없는 것도 알아볼 수 있게 된다.[1]
신경망의 작동 원리도 대략 이와 같다. '담당자'는 인공 뉴런, '곱셈 값'은 가중치이고, '거꾸로 훑는 코치'는 역전파라는 알고리즘이다.[1]
3. 작동 원리
개괄하면, 신경망은 입력(이미지의 픽셀이나 문장의 토큰)을 여러 층에 차례로 통과시켜 출력(라벨이나 다음 단어)으로 바꾼다. 각 인공 뉴런은 입력에 학습된 가중치를 곱하고 편향(bias)을 더한 뒤 비선형 활성화 함수를 적용한다. 이런 층을 많이 쌓을수록 네트워크는 데이터를 점점 더 추상적인 표현으로 만든다.[1]
네트워크는 과제의 규칙을 미리 프로그래밍 받지 않는다. 대신 많은 예시를 보고, 순방향 계산(forward pass), 손실 함수, 그리고 뒤의 학습 절에서 설명하는 역방향 계산(backward pass)을 이용해 오차를 가장 줄이는 가중치를 찾는다. 뒤에 나오는 수학적 정식화 절은 이 과정을 정확한 식으로 적는다.[1]
4. 역사
신경망의 역사는 80년이 넘게 이어졌다. 흔히 'AI 겨울'이라 부르는, 연구 자금과 관심이 크게 줄어든 시기를 사이에 둔 발전기들로 나누어 설명하는 것이 일반적이다.[1]
4.1. 초기 기원 (1940년대)
1943년 신경생리학자 워런 매컬록과 논리학자 월터 피츠는 『Bulletin of Mathematical Biophysics』에 논문 「A Logical Calculus of the Ideas Immanent in Nervous Activity」를 발표했다. 이들은 인공 뉴런의 첫 수학 모델을 제시했다. 가중합이 고정된 임계값을 넘을 때만 발화하는 이진 임계값 유닛이었다.[1]
논문은 신경 활동이 '전부 아니면 전무(all-or-none)'라는 성질을 가지므로, 신경 사건과 그 사이의 관계를 명제 논리로 다룰 수 있다고 전제했다.[4] 이들은 이런 유닛을 적절히 연결한 네트워크가 원리상 명제 논리로 표현 가능한 모든 함수를 계산할 수 있음을 증명했다.[4]
1949년 심리학자 도널드 헤브(Donald Hebb)는 「The Organization of Behavior」를 출간하며 나중에 헤비안 학습 원리로 불리는 개념을 제시했다. 헤브는 한 뉴런이 반복적으로 다른 뉴런의 발화에 참여하면 둘 사이의 연결이 강해진다고 보았으며, 이는 흔히 '함께 발화하는 세포는 함께 연결된다'로 요약된다. 이 원리는 경험이 시냅스 강도를 어떻게 바꿀 수 있는지에 대한 이론적 토대를 제공했고, 신경과학과 인공 신경망에서 쓰이는 많은 학습 규칙의 개념적 뿌리로 남아 있다.[8]
4.2. 퍼셉트론 시대 (1957~1968)
1957년과 1958년 코넬 항공연구소의 로젠블랫은 최초의 학습 가능한 신경망 모델인 퍼셉트론을 소개했다. 그는 1957년 기술 보고서와 널리 인용된 1958년 『Psychological Review』 논문 「The Perceptron: A Probabilistic Model for Information Storage and Organization in the Brain」에서 퍼셉트론을 설명했다.[5]
퍼셉트론은 임계값 뉴런으로 이루어진 단일 층 네트워크이며, 반복적인 보정 규칙으로 데이터에서 가중치를 학습한다. 로젠블랫과 동료들은 광전지 입력을 가진 맞춤형 하드웨어인 Mark I 퍼셉트론도 만들었다.[5]
1960년 스탠퍼드 대학의 버나드 위드로(Bernard Widrow)와 그의 학생 마르시안 '테드' 호프(Marcian 'Ted' Hoff)는 ADALINE(ADAptive LInear NEuron)과 밀접한 관계의 MADALINE 네트워크를 소개했다. ADALINE은 선형 출력 유닛을 사용했고, 목표 출력과 실제 출력의 차이에 비례해 가중치를 바꾸는 위드로-호프 규칙(또는 최소 평균 제곱, LMS)으로 학습했다. LMS 규칙은 현대 경사 하강법의 전신이며, 적응 신호 처리에서 여전히 기초 알고리즘으로 남아 있다.[9]
이런 초기 성과는 강한 낙관론을 낳았다. 1958년 미 해군의 기자회견 이후 『뉴욕 타임스』는 퍼셉트론을 해군이 걷고 말하고 보고 쓰며 스스로를 복제하고 자기 존재를 인식할 수 있기를 기대하는 전자 컴퓨터의 배아라고 보도했다.[10] 이런 보도는 당시 기술로는 충족할 수 없는 기대를 세웠다.[1]
4.3. 첫 번째 AI 겨울 (1969~1979)
1969년 마빈 민스키(Marvin Minsky)와 시모어 페퍼트(Seymour Papert)는 『Perceptrons: An Introduction to Computational Geometry』(MIT 출판부)를 출간했다. 이 책은 단층 퍼셉트론이 계산할 수 있는 것과 없는 것을 엄밀한 수학으로 분석했다. 가장 유명한 결과는 단층 퍼셉트론이 배타적 논리합(XOR) 함수를 표현할 수 없다는 것인데, XOR은 선형으로 분리할 수 없기 때문이다. 두 사람은 다층 네트워크를 효율적으로 학습시킬 수 있을지에 대해서도 비관적이면서도 더 섬세한 질문을 던졌다.[11]
이 책의 영향과 퍼셉트론 붐 때 세워진 비현실적 기대가 맞물리면서 1970년대 내내 신경망 연구 자금이 크게 줄었다. 1973년 라이트힐 보고서와 같은 시기의 연구비 삭감과 함께, 이 시기는 흔히 첫 번째 AI 겨울의 일부로 본다. XOR의 한계는 단층 퍼셉트론에만 해당한다. 다층 네트워크는 XOR과 임의의 불리언 함수를 표현할 수 있었지만, 다층 네트워크를 위한 실용적 학습 알고리즘은 1980년대 중반이 되어서야 널리 알려졌다.[1]
4.4. 연결주의 부흥 (1980년대)
1970년대 후반과 1980년대 초에도 소수의 연구자들은 다층 네트워크의 학습을 계속 연구했다. 1974년 폴 워보스(Paul Werbos)는 하버드 대학 박사 논문에서 역전파 알고리즘을 기술했으며, 이를 층 구조 시스템에 연쇄 법칙(chain rule)을 적용한 것으로 설명했다.[12]
1980년대 초에는 독립적인 재발견과 확장이 이어졌다.[1]
결정적 사건은 1986년 데이비드 럼멜하트(David Rumelhart), 제프리 힌턴, 로널드 윌리엄스(Ronald Williams)가 『Nature』에 발표한 「Learning Representations by Back-Propagating Errors」다. 이 논문은 역전파를 명확히 기술했고, 경사 기반으로 학습한 다층 네트워크가 유용한 내부 표현을 학습할 수 있음을 보였다.[6]
같은 시기 럼멜하트, 제임스 맥클렐런드(James McClelland), 병렬 분산 처리(PDP) 연구 그룹은 두 권짜리 『Parallel Distributed Processing: Explorations in the Microstructure of Cognition』을 출간해 연결주의 연구 프로그램을 정리했다. 인지를 단순한 단위들로 이루어진 큰 네트워크의 창발적 행동으로 보는 관점이었다. 이 책은 힌턴과 요슈아 벤지오 등 한 세대의 연구자들을 키우는 데 도움을 주었다.[13]
1980년대의 다른 주요 기여로는 존 홉필드가 1982년에 제안한 연상 기억 네트워크(홉필드 네트워크), 힌턴과 테런스 세즈노스키(Terrence Sejnowski)가 도입한 볼츠만 머신, 테우보 코호넨(Teuvo Kohonen)의 자기 조직화 지도가 있다. 이 중 홉필드의 연상 기억 네트워크와 볼츠만 머신(힌턴이 세즈노스키와 1983~1985년경 개발한, 홉필드의 1982년 모델을 확률적으로 확장한 모델)은 2024년 노벨 물리학상에서 인정받았다.[7]
4.5. CNN 시대와 두 번째 침체기 (1989~2000년대 중반)
1989년 얀 르쿤(Yann LeCun)과 동료들은 AT&T 벨 연구소에서 손으로 쓴 숫자를 읽기 위해 역전파를 합성곱 신경망에 적용했다. 이 연구는 깊이, 가중치 공유, 국소 수용장만으로도 실용적인 패턴 인식 문제를 풀 수 있음을 보였다.[14]
이후 개선을 거쳐 르쿤 등은 1998년 『Proceedings of the IEEE』에 「Gradient-Based Learning Applied to Document Recognition」을 발표했고, 여기 기술된 LeNet-5 시스템은 미국에서 수표와 우편번호를 읽는 데 대규모로 쓰였다.[15]
같은 시기에 근본적인 이론 결과도 나왔다. 1989년 조지 사이벤코(George Cybenko)는 컴팩트 정의역(compact domain)에서 시그모이드 유닛 하나의 은닉층을 가진 순방향 네트워크가 임의의 연속 함수를 원하는 정확도로 근사할 수 있음을 증명했다.[16] 1991년 Kurt Hornik은 이 보편 근사 결과를 넓은 활성화 함수 부류로 일반화하여, 근사 능력이 특정 비선형 함수가 아니라 다층 구조의 성질임을 밝혔다.[17]
1997년 Sepp Hochreiter와 Jürgen Schmidhuber가 도입한 장단기 메모리(LSTM)는 순환 네트워크의 기울기 소실 문제를 완화한 시퀀스 모델이었다. LSTM은 이후 거의 20년 동안 음성 인식과 언어 모델링을 지배했다.[18]
1990년대와 2000년대 초에는 신경망이 점차 외면받았다. 블라디미르 바프닉(Vladimir Vapnik)과 동료들의 서포트 벡터 머신(SVM)은 강한 이론적 보장과 효과적인 커널 방법을 바탕으로 중간 규모 데이터셋의 분류에서 기본 도구가 되었다. 랜덤 포레스트와 그래디언트 부스팅 트리 같은 앙상블 기법도 많은 벤치마크에서 신경망보다 나은 성능을 냈다. 현대 기준으로는 연산 자원과 데이터가 부족했고 깊은 네트워크를 끝까지 학습시키기도 어려워, 많은 연구자가 신경망 접근을 버렸다. 이 시기는 종종 신경망의 두 번째 AI 겨울로 불리지만, 넓은 AI 분야는 자체적인 주기를 겪었다.[19]
4.6. 딥러닝 혁명 (2006~2016)
현대 신경망의 시대는 2006년 힌턴 등의 「A Fast Learning Algorithm for Deep Belief Nets」가 『Neural Computation』에 실리며 시작되었다. 이 논문은 제한 볼츠만 머신을 이용해 깊은 네트워크를 층별로 사전 학습하는 방법을 보였다. 힌턴 등의 『Science』 짝 논문 「Reducing the Dimensionality of Data with Neural Networks」는 '딥러닝(deep learning)'이라는 용어를 더 널리 알렸다.[20][21]
2012년은 결정적인 전환점이었다. 알렉스 크리제프스키(Alex Krizhevsky), 일리야 수츠케버(Ilya Sutskever), 제프리 힌턴이 ImageNet 대규모 시각 인식 대회에 AlexNet을 출전시켰다. 6,000만 개의 매개변수와 65만 개의 뉴런을 가진 깊은 CNN인 AlexNet은 NVIDIA GTX 580 GPU 두 장으로 학습되었고 ReLU 활성화 함수와 드롭아웃을 사용했다. 상위 5개 오류율은 15.3%로, 두 번째로 좋은 비신경망 출품작의 26.2%보다 크게 낮았다.[22]
이 결과는 손으로 설계한 특징에 대한 딥러닝의 명백한 승리로 널리 받아들여졌고, 시각, 음성, 자연어 처리 전반에서 깊은 신경망의 빠른 도입을 촉발했다.[1]
- 2014년 이언 굿펠로(Ian Goodfellow)와 동료들은 생성기와 판별기 네트워크가 서로 대립하며 학습하는 생성적 적대 신경망(GAN)을 도입했다.[23]
- 2014년 Sutskever, Vinyals, Le는 LSTM으로 시퀀스-투-시퀀스 학습을 도입했다. 이는 이후 Bahdanau 어텐션(2014~2015년)으로 확장되어 기계 번역을 크게 개선했다.
- 2015년 Kaiming He 등은 잔차 연결을 쓰는 ResNet을 도입했다. 잔차 연결 덕분에 152층 깊이의 네트워크를 학습할 수 있었고, 이 모델은 2015년 ImageNet 대회에서 우승했다.[24]
- 2016년 DeepMind의 AlphaGo는 깊은 신경망, 몬테카를로 트리 탐색, 강화 학습을 결합해 세계 챔피언 이세돌을 이겼다.[1]
4.7. 트랜스포머 시대 (2017년~)
2017년 Google Brain의 아시시 바스와니(Ashish Vaswani)와 동료들은 「Attention Is All You Need」에서 트랜스포머를 발표했다. 트랜스포머는 순환과 합성곱을 다중 헤드 셀프 어텐션으로 대체했다. 저자들은 순환과 합성곱을 완전히 버리고 어텐션 메커니즘에만 기반한 새롭고 단순한 구조라고 설명했다. 또한 WMT 2014 영어-독일어 과제에서 28.4 BLEU, 영어-프랑스어 과제에서 41.8 BLEU를 기록해 새로운 최고 수준의 결과를 냈다고 밝혔다. 병렬 처리가 훨씬 쉬운 구조이기도 했다.[25]
몇 년 안에 트랜스포머는 LSTM을 대신하는 기본 시퀀스 모델이 되었고, 비전 트랜스포머(Vision Transformer), 음성 인식 모델 Whisper, 코드, 과학 데이터로 퍼졌다.[1]
제프리 힌턴, 얀 르쿤, 요슈아 벤지오는 2018년 ACM A.M. 튜링상(2019년 발표)을 받았다. 수상 근거는 깊은 신경망을 컴퓨팅의 핵심 요소로 만든 개념적·공학적 돌파구였으며, 역전파, 합성곱 네트워크, 확률 모델, 연결주의 연구 프로그램이 특히 언급되었다.[26]
2024년 10월 노벨 물리학상은 인공 신경망으로 머신러닝을 가능하게 하는 기초적 발견과 발명의 공로로 존 홉필드와 제프리 힌턴에게 공동 수여되었다. 스웨덴 왕립과학원은 홉필드의 1982년 연상 기억 네트워크와 힌턴의 볼츠만 머신 및 그 후속 연구를 근거로 들었으며, 1980년대부터의 연구가 2010년경 시작된 머신러닝 혁명의 토대를 놓았다고 평가했다. 수상 발표는 통계물리학의 도구를 써서 이 공로를 설명했고, 힌턴은 튜링상과 노벨상을 모두 받은 극소수 인물 가운데 한 명이 되었다.[7]
4.8. 파운데이션 모델 시대 (2018년~)
2018년부터 웹 규모의 말뭉치로 사전 학습한 대형 트랜스포머 언어 모델이 지배적 패러다임이 되었다. Google의 BERT는 양방향 마스크 언어 모델링 사전 학습으로 여러 NLP 과제에서 최고 수준의 결과를 얻었다.[27] OpenAI의 GPT 시리즈에서는 2020년 GPT-3(1,750억 개의 매개변수)가 나왔고, 저자들은 이 규모가 이전의 비희소 언어 모델보다 10배 크다고 밝혔다. 2023년에는 GPT-4가 나왔다. 이들 자기회귀 언어 모델은 극단적 규모로 커지면서 문맥 내 학습과 넓은 일반화를 보였다.[28]
스탠퍼드 CRFM 연구 그룹은 2021년 대량의 데이터로 학습되어 폭넓은 하위 과제에 적응할 수 있는 모델을 가리키는 용어로 '파운데이션 모델'을 만들었다.[29]
2025~2026년 무렵의 최전선 신경망 시스템으로는 Anthropic의 Claude, OpenAI의 GPT-4와 GPT-5 계열, Google의 Gemini, Meta의 Llama 계열, DeepMind의 AlphaFold와 Gemini Robotics가 있다. 이들은 일상적으로 멀티모달이고, 밀집 레이어와 희소 전문가 혼합(MoE) 레이어를 섞으며, 수만 개의 가속기에서 몇 주씩 돌아가는 거대한 분산 학습 시스템에 의존한다.[1]
| 연도 | 주요 사건 | 주요 기여자 |
|---|---|---|
| 1943년 | 인공 뉴런의 첫 수학 모델 | 워런 매컬록, 월터 피츠[4] |
| 1949년 | 헤비안 학습 원리 | 도널드 헤브[8] |
| 1958년 | 퍼셉트론 | 프랭크 로젠블랫[5] |
| 1960년 | ADALINE과 위드로-호프 규칙 | 버나드 위드로, 마르시안 '테드' 호프[9] |
| 1969년 | 『Perceptrons』의 XOR 한계 분석 | 마빈 민스키, 시모어 페퍼트[11] |
| 1974년 | 박사 논문 속 역전파 | 폴 워보스[12] |
| 1982년 | 홉필드 네트워크 | 존 홉필드[7] |
| 1986년 | 역전파 대중화, PDP 두 권 | 럼멜하트, 힌턴, 윌리엄스, PDP 그룹[6] [13] |
| 1989년 | 역전파로 학습한 숫자 인식 CNN | 얀 르쿤 등[14] |
| 1989년 | 보편 근사 정리 (1991년 커트 호니크가 일반화) | 조지 사이벤코[16] [17] |
| 1997년 | LSTM | Sepp Hochreiter, Jürgen Schmidhuber[18] |
| 2006년 | 심층 신뢰 신경망, '딥러닝'의 부상 | 제프리 힌턴 등[20] [21] |
| 2012년 | AlexNet, ImageNet 우승 (6,000만 매개변수) | 크리제프스키, 수츠케버, 힌턴[22] |
| 2014년 | 생성적 적대 신경망(GAN) | 이언 굿펠로 등[23] |
| 2015년 | ResNet (152층) | Kaiming He 등[24] |
| 2017년 | 트랜스포머 구조 | 바스와니 등[25] |
| 2018년 | BERT와 GPT 공개 | Google AI; OpenAI[27] [28] |
| 2018년 튜링상(2019년 발표) | 딥러닝 혁명의 아버지들 | 제프리 힌턴, 얀 르쿤, 요슈아 벤지오[26] |
| 2020년 | GPT-3 (1,750억 매개변수) | OpenAI[28] |
| 2022년 | 친칠라 스케일링 법칙; ChatGPT | DeepMind; OpenAI[30] [1] |
| 2024년 | 신경망 기초 연구로 노벨 물리학상 | 존 홉필드, 제프리 힌턴[7] |
| 2023~2026년 | 멀티모달 파운데이션 모델, 희소 MoE, 에이전트 시스템 | 여러 연구소[1] |
5. 수학적 정식화
표준 순방향 신경망은 매개변수 θ로 정의되는 함수 fθ: R → R을 정의한다. θ는 모든 가중치와 편향을 모은 것이다.[1]
단일 인공 뉴런은 다음과 같이 계산한다.[1]
z = w1·x1 + w2·x2 + … + wn·xn + b
a = φ(z)여기서 xi는 입력, wi는 대응하는 가중치, b는 편향 항, φ는 비선형 활성화 함수, a는 이 뉴런의 출력(활성값)이다.[1]
신경망은 뉴런을 층으로 묶는다. 층 ℓ의 활성값을 벡터 a로 쓰면, 완전 연결 층은 아핀 변환을 적용한 뒤 원소별 비선형 함수를 적용한다.[1]
a = φ( W a + b )여기서 W는 가중치 행렬, b는 편향 벡터다. L개의 이런 층을 쌓으면 다음과 같다.[1]
fθ(x) = a(a( … (a(x)) … ))정보는 세 가지 역할로 나뉜다.[1]
- 입력 층: 원시 데이터(픽셀 값, 토큰 임베딩, 센서 값)를 받는다. 입력 노드는 보통 스스로 계산하지 않는다.
- 은닉 층: 가중치, 편향, 활성화 함수를 적용해 점점 더 추상적인 내부 표현을 계산한다. 은닉 층이 둘 이상인 네트워크를 보통 심층 신경망이라 부른다.
- 출력 층: 최종 예측(클래스 확률, 회귀 목표, 토큰 로짓)을 만들며, 그 차원은 과제에 따라 달라진다.[1]
순환, 그래프, 어텐션 기반 같은 비순방향 네트워크에서도 같은 구성 요소가 나타나지만 연결 패턴이 다르다.[1]
6. 학습
신경망 학습은 θ를 골라 fθ가 데이터셋과 맞도록 만드는 과정이다. 표준 방법은 미분 가능한 손실에 대해 확률적 경사 하강법으로 경험적 위험 최소화(empirical risk minimization)를 수행하는 것이며, 기울기는 역전파로 계산한다.[1]
6.1. 순방향 계산과 손실 함수
학습 예시 x가 주어지면 네트워크를 층 단위로 평가해 예측 ŷ = fθ(x)를 얻는다. 이것이 순방향 계산(forward pass)이다. 각 층은 행렬-벡터 곱과 원소별 비선형 함수이므로, 순방향 계산은 조밀한 선형대수 연산의 연속이다. 그래서 병렬 행렬 연산에 특화된 하드웨어인 GPU와 TPU가 효과적이다.[1]
예측 ŷ는 목표 y와 손실 함수 L(ŷ, y)로 비교한다. 흔한 선택은 회귀에 평균 제곱 오차, 분류에 교차 엔트로피이며, 자기 지도 학습과 생성 과제에는 대조 손실이나 시퀀스 수준 손실이 쓰인다. 학습 목표는 학습 분포에 대한 기대 손실이고, 이는 미니배치의 평균 손실로 근사한다.[1]
손실 함수는 과제에서 '틀렸다'가 무엇을 뜻하는지 정한다. 대표적인 예는 다음과 같다.[1]
- 평균 제곱 오차(MSE): L = (1/n) Σ (ŷ − y). 회귀의 표준 손실이다.
- 평균 절대 오차(MAE, L1): MSE보다 이상치에 강하다.
- 이진 교차 엔트로피: 시그모이드 출력을 가진 두 부류 문제에 쓴다.
- 범주형 교차 엔트로피: 다부류 분류의 표준 손실이며, 언어 모델링에서 토큰별 손실로 쓰인다.
- 대조 손실과 삼중항 손실: 표현 학습과 거리 학습에 쓰인다(예: CLIP, SimCLR).
- 강화 학습 손실: 정책 경사와 PPO 손실이 있고, 보상 모델과 KL 제약을 결합한 RLHF와 DPO 목적 함수는 대규모 언어 모델을 인간 선호에 맞추는 데 쓰인다.[1]
6.2. 역방향 계산, 최적화, 규제와 안정화
손실을 줄이려면 모든 매개변수에 대한 손실의 기울기 ∇θL을 계산해야 한다. 역전파는 이를 위한 효율적 알고리즘으로, 연쇄 법칙을 순방향 계산 그래프에 적용해 출력에서 시작해 층마다 편미분을 거꾸로 전파한다. 역전파는 사실상 모든 현대 신경망의 지배적 학습 알고리즘이다.[6]
경사 하강법은 기울기를 이용해 매개변수를 갱신한다.[1]
θ ← θ − η · ∇θL여기서 η는 학습률이다. 실제로는 보통 32~4,096개의 예시로 이루어진 미니배치에서 기울기를 추정하며, 이를 미니배치 확률적 경사 하강법이라 한다. 현대 학습은 거의 항상 모멘텀 기반이나 적응형 변형을 쓰며, 가장 널리 쓰이는 최적화 알고리즘은 모멘텀이 있는 SGD, Adam, AdamW이다. 이 중 AdamW는 트랜스포머 학습의 사실상 표준이다.[1]
대형 네트워크는 쉽게 과적합되므로, 학습은 일반화를 높이고 최적화를 안정시키기 위해 여러 기법을 함께 쓴다.[1]
- 드롭아웃(dropout): 학습 중 활성값의 일정 비율을 무작위로 0으로 만들어 동조 적응(co-adaptation)을 막는다.
- L2 가중치 감쇠: 가중치의 제곱 노름에 벌점을 준다.
- 배치 정규화와 층 정규화는 중간 활성값을 표준화해 학습을 빠르게 한다.
- 잔차 연결(ResNet, 트랜스포머)은 매우 깊은 구조에서 기울기 소실을 완화하는 항등 지름길이다.
- 조기 종료, 데이터 증강, 학습률 스케줄링(워밍업, 코사인 감쇠)이 표준으로 쓰인다.[1]
이런 기법은 신중한 초기화(He, Xavier/Glorot)와 ReLU 계열 활성화 함수와 함께 쓰여, 수백~수천 층, 수십억 매개변수 네트워크를 실제로 학습 가능하게 만든다.[1]
7. 신경망의 종류
신경망에는 여러 구조 계열이 있으며, 각각은 데이터 종류에 맞춰 연결 방식과 매개변수화를 조정한다. 아래는 주요 계열을 훑고 각 구조의 전용 문서로 연결한 것이다.[1]
7.1. 다층 퍼셉트론과 합성곱 신경망
고전적인 완전 연결 순방향 네트워크는 역사적으로 다층 퍼셉트론(MLP) 또는 순방향 신경망이라 불리며, 조밀한 선형 층과 비선형 활성화 함수를 쌓는다. MLP는 더 큰 모델의 구성 요소로 여전히 흔하다. 예를 들어 트랜스포머 안의 위치별 'MLP 블록'은 사실상 각 토큰에 독립적으로 적용되는 2층 MLP다.[1]
합성곱 신경망은 가중치 공유와 국소 수용장을 도입해, 이미지, 영상, 오디오 스펙트로그램 같은 공간 데이터에 잘 맞는다. 핵심 연산은 합성곱(특징 탐지), 풀링(공간 축소), 완전 연결 분류 헤드다. 대표 구조로 LeNet(1989/1998), AlexNet(2012), VGG(2014), GoogLeNet/Inception(2014), ResNet(2015)이 있다.[14][22][24]
7.2. 순환 신경망과 트랜스포머
순환 신경망은 시퀀스를 읽으면서 은닉 상태를 갱신해, 시계열, 텍스트, 음성 모델링에 자연스럽다. 기본 RNN은 기울기 소실과 폭주 문제를 겪으며, 이를 완화하는 게이트형 변형으로 LSTM(Hochreiter and Schmidhuber, 1997)과 더 단순한 GRU(Cho et al., 2014)가 나왔다. RNN은 대략 2014년부터 기계 번역과 음성 인식을 주도했으나, 2017년 이후 대부분 트랜스포머에 밀려났다.[18]
트랜스포머는 2017년 이후 시퀀스 모델링의 지배적 구조다. 핵심 요소는 다중 헤드 셀프 어텐션으로, 시퀀스의 각 위치가 다른 모든 위치의 학습된 가중 조합에 주목한다. 트랜스포머는 병렬화가 쉽고 매개변수 수가 매우 커져도 잘 확장되며, 현재 대규모 언어 모델, 이미지 모델(Vision Transformer), 음성 모델(Whisper), 단백질 모델(AlphaFold 2/3)의 바탕이다.[25]
7.3. 그래프 신경망과 상태 공간 모델
그래프 신경망은 이웃 노드 사이에 메시지를 반복적으로 전달해 합성곱을 임의의 그래프로 일반화한다. 분자 성질 예측, 신약 개발, 추천 시스템, 교통 예측(구글의 도로 도착 시간 모델), 조합 최적화에서 핵심으로 쓰인다.[1]
상태 공간 모델(SSM)인 S4와 Mamba는 구조화된 커널을 가진 선형 순환으로 긴 시퀀스를 모델링하는 최근 계열이다. 이들은 시퀀스 길이에 대해 이차보다 낮은 증가율로 확장하며, 장문맥 모델링에서 트랜스포머의 대안이나 보완으로 점점 쓰인다.[1]
7.4. 오토인코더, 생성 모델, 전문가 혼합
오토인코더(변분 오토인코더 포함)는 입력을 재구성하는 과정에서 압축된 잠재 표현을 학습한다. 생성 계열에는 GAN, 정규화 흐름, 자기회귀 모델, 가장 최근의 확산 모델이 있으며, 확산 모델은 최신 이미지와 영상 합성을 주도한다.[1]
전문가 혼합(MoE) 층은 학습된 게이팅 함수로 각 입력 토큰을 소수의 '전문가' 하위 네트워크에 라우팅한다. MoE는 토큰당 연산량보다 전체 매개변수 수를 훨씬 빠르게 늘릴 수 있게 하며, Mixtral, GPT-4급 시스템, DeepSeek-V3 등 여러 최신 최전선 모델의 바탕이다.[1]
| 구조 | 적합한 용도 | 핵심 메커니즘 | 예시 |
|---|---|---|---|
| MLP | 표 형식 데이터, 큰 네트워크의 구성 요소 | 완전 연결 층 | 표준 MLP[1] |
| CNN | 이미지, 오디오, 영상 | 합성곱 필터, 풀링 | AlexNet, ResNet, Inception[1] |
| RNN / LSTM | 시퀀스, 시계열 | 게이트가 있는 순환 은닉 상태 | LSTM, GRU[1] |
| 트랜스포머 | 텍스트, 시퀀스, 멀티모달 | 다중 헤드 셀프 어텐션 | GPT-4, Claude, BERT, ViT[1] |
| 그래프 신경망 | 그래프, 분자, 소셜 네트워크 | 메시지 전달 | GCN, GAT, GraphSAGE[1] |
| 상태 공간 모델 / Mamba | 매우 긴 시퀀스 | 구조화된 선형 순환 | S4, Mamba[1] |
| 오토인코더 | 압축, 표현 학습 | 인코더-디코더 병목 | VAE, 잡음 제거 AE[1] |
| GAN | 이미지 합성 | 생성기 대 판별기 | StyleGAN, BigGAN[1] |
| 전문가 혼합 | 매개변수를 싸게 늘리기 | 희소 라우팅 | Switch Transformer, Mixtral[1] |
8. 활성화 함수
활성화 함수는 쌓인 층이 단순한 아핀 변환 이상을 표현하게 하는 비선형성을 넣는다. 현재 가장 널리 쓰이는 함수는 다음과 같다.[31]
| 활성화 함수 | 정의 | 비고 |
|---|---|---|
| 시그모이드 | σ(x) = 1 / (1 + e) | (0,1)로 유계. 역사적으로 지배적이었으나 깊은 네트워크에서는 기울기 소실 때문에 쓰임이 제한된다. 이진 분류기 출력에 흔하다.[1] |
| 탄젠트 하이퍼볼릭(tanh) | (e − e) / (e + e) | (−1,1)로 유계. 초기 RNN과 LSTM의 표준이었다.[1] |
| ReLU | max(0, x) | AlexNet(2012) 이후 기본 은닉 활성화 함수. 단순하고 희소하며 수렴을 빠르게 한다.[22] |
| Leaky ReLU / PReLU | max(αx, x) | 기본 ReLU의 '죽은 뉴런' 문제를 피한다.[1] |
| GELU | x · Φ(x) | 부드러운 ReLU 변형으로 BERT, GPT 및 많은 현대 트랜스포머의 기본값이다.[32] |
| SwiGLU | (Swish(xW) ⊙ (xV)) | PaLM, LLaMA 등 최근 LLM에 쓰인 게이트형 활성화 함수다.[33] |
| 소프트맥스 | e / Σj e | 다부류 분류기 출력에서 로짓을 확률 분포로 바꾼다.[1] |
2010~2012년경 시그모이드와 tanh에서 ReLU로, 2018~2020년경 GELU와 SwiGLU 같은 게이트형 변형으로 옮겨 간 것은 깊은 네트워크를 안정적으로 학습할 수 있게 만든 여러 눈에 띄지 않는 변화 가운데 하나였다.[1]
9. 보편 근사 정리
보편 근사 정리는 순방향 신경망의 기본적 표현력 결과다. George Cybenko는 1989년 시그모이드 활성화 함수의 유한 선형 결합이 단위 큐브 위 연속 함수의 공간에서 조밀하다는 것을 증명했다. 즉 은닉 유닛이 충분하면 은닉층 하나짜리 순방향 네트워크가 콤팩트 정의역의 임의 연속 함수를 원하는 정확도로 근사할 수 있다.[16] 1991년 Kurt Hornik은 이 결과를 다항식이 아닌 넓은 활성화 함수 부류로 확장하고, 보편성이 특정 시그모이드가 아니라 다층 구조의 성질임을 밝혔다.[17]
이 정리는 순수한 존재 결과다. 필요한 뉴런 수, 올바른 가중치를 찾는 방법, 경사 하강법이 그 가중치에 실제로 도달하는지는 말해 주지 않는다. 후속 연구는 깊이가 같은 함수를 얕은 네트워크보다 지수적으로 적은 매개변수로 표현하게 해 줄 때가 많다는 것을 보였고, 이것이 현대 심층 모델을 강조하는 핵심 동기다.[1]
10. 현대 학습
현대 신경망 학습은 대규모 시스템 문제다.[1]
10.1. 하드웨어와 대규모 학습
현대 학습은 병렬 행렬 가속기 위에서 돌아간다.[1]
- 그래픽 처리 장치(GPU): 원래 3D 렌더링을 위해 설계되었으나, NVIDIA의 CUDA 플랫폼(2007년)이 범용 연산을 열면서 딥러닝의 주력 장비가 되었다. AlexNet은 2012년 NVIDIA GTX 580 두 장으로 학습되었고, 2025년 무렵의 최전선 시스템은 수만 개의 NVIDIA H100, H200, GB200 또는 AMD Instinct 가속기를 쓴다.[22]
- 텐서 처리 장치(TPU): 딥러닝의 핵심인 조밀한 행렬 곱셈과 저정밀도 연산에 맞춘 Google의 맞춤형 ASIC이다.
- 그 밖의 가속기로 AWS Trainium/Inferentia, Cerebras 웨이퍼 규모 엔진, Graphcore IPU가 있다.[1]
분산 학습은 하나의 모델을 여러 가속기에 나눠 올린다. 표준 병렬화 전략은 다음과 같다.[1]
- 데이터 병렬: 모든 가속기가 모델 사본을 가지고 서로 다른 미니배치를 처리하며, 기울기는 all-reduce 같은 방식으로 동기화된다.
- 텐서·모델 병렬: 큰 가중치 행렬을 여러 장치에 나눈다.
- 파이프라인 병렬: 서로 다른 층을 서로 다른 장치에 두고 파이프라인처럼 실행한다.
- 전문가 병렬: 전문가 혼합에서 서로 다른 토큰을 다른 장치에 있는 전문가에게 보낸다.
- 시퀀스·문맥 병렬: 매우 긴 시퀀스를 여러 장치에 나눠 어텐션을 계산한다.
Megatron-LM, DeepSpeed, FSDP(Fully Sharded Data Parallel), JAX의 pjit/shard_map 같은 프레임워크가 이런 전략을 조율한다.[1]
현대 학습은 가능한 경우 혼합 정밀도(mixed precision)를 쓴다. 가중치는 32비트나 16비트로 저장하고, 행렬 곱셈은 FP16, BF16, FP8 같은 낮은 정밀도 형식으로 수행해 처리량을 크게 높인다. 수치 안정성은 손실 스케일링과 확률적 반올림으로 지킨다. 혼합 정밀도는 희소 MoE와 추론 시점의 KV 캐시 기법과 함께, 지난 5년간 대형 모델 학습의 연산당 성능 향상 가운데 상당 부분을 설명한다.[1]
스케일링 법칙은 Kaplan 등(OpenAI, 2020)이 체계적으로 연구했고, Hoffmann 등(DeepMind, 2022)의 친칠라 연구가 이를 정교하게 했다. 검증 손실은 연산량, 데이터셋 크기, 매개변수 수에 대해 거듭제곱 법칙을 따라 매끄럽게 떨어진다. 친칠라는 연산 예산이 고정되었을 때 모델 크기와 학습 토큰 수를 대략 같은 비율로 키워야 한다는 것을 보였고, 그 결과 이전의 많은 대형 모델이 과소 학습되었다는 함의를 낳았다.[34][30]
대부분의 현대 신경망은 소수의 고수준 프레임워크 가운데 하나로 만든다.[1]
- PyTorch(처음 Meta AI, 현재 Linux Foundation 소속): 2018년 무렵부터 주된 연구 프레임워크로 쓰였다. 즉시 실행 방식, 동적 그래프, 큰 생태계(Hugging Face Transformers, PyTorch Lightning, torch.compile)를 갖췄다.
- TensorFlow(Google): 2015~2018년 주류 프레임워크였으며, Keras와 TFX를 통해 실서비스에서 여전히 널리 쓰인다.
- JAX(Google): XLA 위에 만든 함수형 변환 기반 프레임워크로, DeepMind, Anthropic 및 학계 연구실의 대규모 연구에서 점점 인기를 얻고 있다.
- 그 밖에 MLX(Apple), MindSpore(Huawei), 교환 형식인 ONNX가 있다.[1]
3대 프레임워크는 텐서(다차원 배열), 자동 미분, 최적화된 가속기 코드로의 컴파일(cuDNN, XLA, Triton)이라는 핵심 개념을 공유한다.[1]
11. 활용 분야
CNN과 비전 트랜스포머는 이미지 분류, 객체 탐지, 의미 분할과 인스턴스 분할, 광학 문자 인식, 위성·의료 영상 분석, 자율주행 차량의 인지 스택을 구동한다. AlexNet, ResNet, Inception, YOLO, EfficientNet, ViT, Segment Anything은 모두 신경망이다.[1]
트랜스포머 기반 언어 모델은 기계 번역, 요약, 질의응답, 코드 생성, 감성 분석, 대화형 AI를 주도한다. Claude, GPT-4, Gemini, Llama 3/4 같은 대규모 언어 모델은 확장된 추론 사슬, 함수 호출, 다단계 에이전트 행동을 수행한다.[1]
신경망은 자동 음성 인식(Whisper), 음성 합성(WaveNet, VALL-E), 음악 생성, 오디오 분류의 바탕이다.[1]
DeepMind의 AlphaGo는 2016년 세계 챔피언 이세돌을 바둑에서 이겼다. 이 시스템은 깊은 CNN, 가치·정책 네트워크, 몬테카를로 트리 탐색을 결합했다. AlphaGo Zero(2017년)와 MuZero(2019년)는 이 접근을 자기 대국과 모델 기반 강화 학습으로 일반화했다.[1]
AlphaFold 2(2020년)는 단백질의 3차원 구조를 실험에 가까운 정확도로 예측했다. 이 단백질 구조 예측 기여를 인정해 2024년 노벨 화학상은 데이비드 베이커(David Baker), 데미스 허사비스(Demis Hassabis), 존 점퍼(John Jumper)에게 공동 수여되었다.[35] 같은 해 노벨 물리학상이 신경망 기초 연구로 홉필드(Hopfield)와 제프리 힌턴(Geoffrey Hinton)에게 주어져, 서로 다른 두 과학 노벨상 수상 성과가 모두 신경망 연구에 바탕을 둔 셈이다.[35][7]
신경망은 날씨 예보(GraphCast, GenCast), 소재 발견, 입자 물리, 유체 역학, 양자 화학에도 쓰인다. 물리 정보 신경망(PINN)은 알려진 물리 법칙을 연성 제약으로 넣는다.[1]
의료 분야에서는 방사선과와 병리 영상 분석, 망막 질환 선별, 전자 의무 기록 모델링, 신약 개발, 단일 세포 유전체학에 적용된다.[1]
12. 신경망과 딥러닝의 차이
신경망은 모델 자체, 즉 가중치로 연결된 인공 뉴런 층으로 이루어진 특정 함수 계열이다. 딥러닝은 층을 많이 쌓은 신경망('깊은' 신경망)을 큰 데이터셋으로 학습시키는 더 넓은 분야이자 방법론으로, 구조, 최적화 방법, 규제 기법, 그리고 이런 학습을 가능하게 하는 하드웨어 실무를 포함한다.[1]
쉽게 말해 모든 딥러닝 시스템은 신경망 위에 세워지지만, '딥러닝'이라는 말은 깊이와 규모를 강조한다. 단층 퍼셉트론은 신경망이지만 보통 딥러닝이라 부르지 않고, 100층짜리 ResNet이나 10억 매개변수 규모의 트랜스포머는 부른다. 신경망은 또한 머신러닝이라는 더 넓은 분야 안의 한 모델 계열이며, 머신러닝에는 결정 트리, 서포트 벡터 머신, 선형 회귀 같은 비신경망 방법도 있다.[1]
얀 르쿤, 요슈아 벤지오, 제프리 힌턴의 2015년 『Nature』 리뷰는 딥러닝을 여러 처리 층으로 구성된 계산 모델이 여러 수준의 추상으로 데이터 표현을 학습할 수 있게 하는 방법으로 정의한다.[3]
13. 이론적 이해와 한계
신경망의 경험적 성공은 이론적 이해를 앞질러 왔지만, 몇 가지 방향에서 진전이 있었다.[1]
- 신경 탄젠트 커널(NTK) 이론(Jacot, Gabriel, Hongler, 2018년)은 적절한 무한 폭 극한에서 경사 하강법으로 학습하는 신경망이 고정된 커널을 쓰는 커널 회귀와 같다고 보인다. NTK는 넓은 네트워크에서 심층 네트워크의 학습과 일반화를 다루기 쉬운 모델로 제공한다.[36]
- 이중 하강(Belkin, Hsu, Ma, Mandal, 2019년)은 모델 크기에 따른 시험 오차가 과매개변수화 영역에서 두 번째로 줄어드는 경험적 현상으로, 고전적인 편향-분산 그림과 어긋난다.[37]
- 복권 가설(Frankle, Carbin, 2019년)은 큰 네트워크가 비슷한 성능을 내는 희소한 학습 가능 부분 네트워크('당첨 티켓')를 담고 있다고 제안한다.
- 기계적 해석 가능성은 Anthropic, OpenAI, Google DeepMind 및 학계 연구실이 주도하며, 학습된 네트워크가 구현하도록 익힌 알고리즘을 역공학으로 밝히는 것을 목표로 한다.[1]
열린 이론적 질문으로는 과매개변수화된 네트워크가 왜 일반화하는지, 학습 중 표현이 어떻게 형성되는지, 나타나는 능력이 실제 상전이를 반영하는지, 그리고 확장을 제약하는 근본 한계가 있는지 여부가 있다.[1]
성공에도 불구하고 신경망에는 잘 알려진 한계가 있다.[1]
- 데이터 갈증: 대형 모델을 처음부터 학습하려면 보통 방대한 라벨링 데이터나 웹 규모 데이터셋이 필요하다. 다만 전이 학습, 자기 지도 학습, 지시 튜닝으로 과제별 데이터 요구는 크게 줄었다.
- 연산 비용과 에너지: 최전선 모델 학습은 수만 개의 가속기로 몇 달의 연산과 수십~수백 메가와트시의 에너지를 요구할 수 있다.
- 해석 가능성: 현대 네트워크는 사람이 들여다보기 어렵다. 주목 맵, 어텐션 시각화, 프로빙 분류기, 회로 수준의 기계적 해석 가능성이 이를 부분적으로만 다룬다.
- 적대적 취약성: 입력에 작고 정교하게 만든 변화를 주면 확신에 찬 오분류가 일어날 수 있으며, 이는 중대한 보안 문제를 낳는다.
- 환각과 신뢰성: 대규모 언어 모델은 유창하지만 사실과 다른 결과를 낼 수 있다.
- 편향과 공정성: 신경망은 학습 데이터의 편향을 쉽게 흡수해 증폭하며, 채용, 대출, 치안처럼 결과가 중대한 응용에서 우려를 낳는다.
- 파국적 망각: 여러 과제를 순차적으로 학습할 때 나타나는 문제로, 지속 학습 연구를 촉발했다.
- 생물학적 비현실성: 역전파에는 알려진 직접적 생물학적 대응물이 없고, 뇌가 전역 손실에 대해 경사 하강법을 수행할 것 같지 않다. 생물학적으로 그럴듯한 대안은 아직 열린 연구 분야다.[1]
각주·출처 37개
- ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12 ↩13 ↩14 ↩15 ↩16 ↩17 ↩18 ↩19 ↩20 ↩21 ↩22 ↩23 ↩24 ↩25 ↩26 ↩27 ↩28 ↩29 ↩30 ↩31 ↩32 ↩33 ↩34 ↩35 ↩36 ↩37 ↩38 ↩39 ↩40 ↩41 ↩42 ↩43 ↩44 ↩45 ↩46 ↩47 ↩48 ↩49 ↩50 ↩51 ↩52 ↩53 ↩54 ↩55 ↩56 ↩57 ↩58 ↩59 ↩60 ↩61 ↩62 ↩63 ↩64 ↩65 ↩66 ↩67 ↩68 ↩69 ↩70 ↩71 ↩72 ↩73 ↩74 ↩75 ↩76 ↩77 ↩78 ↩79 ↩80 AI Wiki: Neural Network (2026-07-23 수정본) · CC BY 4.0 · 확인 2026-10-11
- ↩1 ↩2 Goodfellow, I., Bengio, Y., & Courville, A. (2016). Deep Learning. MIT Press · 확인 2026-10-11
- ↩1 ↩2 ↩3 Deep learning · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 ↩5 A logical calculus of the ideas immanent in nervous activity · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 ↩5 The perceptron: A probabilistic model for information storage and organization in the brain · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 ↩5 Learning representations by back-propagating errors · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 The Nobel Prize in Physics 2024 · 확인 2026-10-11
- ↩1 ↩2 Hebb, D. O. (1949). The Organization of Behavior: A Neuropsychological Theory. Wiley (AI Wiki 인용) · 확인 2026-10-11
- ↩1 ↩2 Adaptive switching circuits · 확인 2026-10-11
- ↩1 New Navy Device Learns by Doing (AI Wiki 인용) · 확인 2026-10-11
- ↩1 ↩2 Minsky, M., & Papert, S. (1969). Perceptrons: An Introduction to Computational Geometry. MIT Press (AI Wiki 인용) · 확인 2026-10-11
- ↩1 ↩2 Werbos, P. J. (1974). Beyond Regression: New Tools for Prediction and Analysis in the Behavioral Sciences. PhD thesis, Harvard University (AI Wiki 인용) · 확인 2026-10-11
- ↩1 ↩2 Rumelhart, D. E., McClelland, J. L., & the PDP Research Group (1986). Parallel Distributed Processing: Explorations in the Microstructure of Cognition, Vols. 1-2. MIT Press (AI Wiki 인용) · 확인 2026-10-11
- ↩1 ↩2 ↩3 Backpropagation applied to handwritten zip code recognition (AI Wiki 인용) · 확인 2026-10-11
- ↩1 Gradient-based learning applied to document recognition · 확인 2026-10-11
- ↩1 ↩2 ↩3 Approximation by superpositions of a sigmoidal function · 확인 2026-10-11
- ↩1 ↩2 ↩3 Approximation capabilities of multilayer feedforward networks (AI Wiki 인용) · 확인 2026-10-11
- ↩1 ↩2 ↩3 Long short-term memory (AI Wiki 인용) · 확인 2026-10-11
- ↩1 Support-vector networks · 확인 2026-10-11
- ↩1 ↩2 A fast learning algorithm for deep belief nets (AI Wiki 인용) · 확인 2026-10-11
- ↩1 ↩2 Reducing the dimensionality of data with neural networks (AI Wiki 인용) · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 ↩5 ImageNet classification with deep convolutional neural networks · 확인 2026-10-11
- ↩1 ↩2 Generative adversarial nets (AI Wiki 인용) · 확인 2026-10-11
- ↩1 ↩2 ↩3 Deep residual learning for image recognition · 확인 2026-10-11
- ↩1 ↩2 ↩3 Attention is all you need · 확인 2026-10-11
- ↩1 ↩2 Fathers of the Deep Learning Revolution Receive ACM A.M. Turing Award (AI Wiki 인용) · 확인 2026-10-11
- ↩1 ↩2 BERT: Pre-training of deep bidirectional transformers for language understanding · 확인 2026-10-11
- ↩1 ↩2 ↩3 Language models are few-shot learners · 확인 2026-10-11
- ↩1 On the opportunities and risks of foundation models · 확인 2026-10-11
- ↩1 ↩2 Training compute-optimal large language models · 확인 2026-10-11
- ↩1 Activation functions: Comparison of trends in practice and research for deep learning · 확인 2026-10-11
- ↩1 Gaussian Error Linear Units (GELUs · 확인 2026-10-11
- ↩1 GLU variants improve Transformer · 확인 2026-10-11
- ↩1 Scaling laws for neural language models · 확인 2026-10-11
- ↩1 ↩2 The Nobel Prize in Chemistry 2024 · 확인 2026-10-11
- ↩1 Neural tangent kernel: Convergence and generalization in neural networks · 확인 2026-10-11
- ↩1 Reconciling modern machine-learning practice and the classical bias-variance trade-off (AI Wiki 인용) · 확인 2026-10-11