TL;DR

  • AI와 인간의 지능은 현실에서 더 근본적인 구조를 추출하고 다른 대상과 유용하게 연결하는 일반화 능력에 가까우며, 단순 암기보다 이를 장려하는 학습이 중요함.
  • 기계 학습에서는 과적합(overfitting)지름길 학습(shortcut learning)을 막고, 개별 사례의 픽셀 규칙이 아니라 개념과 구조를 학습하도록 만드는 일이 핵심임.
  • 암기를 싫어하고 직관과 제1원리에서 답을 구성하는 학습 방식은 세부 사항 기억에는 약할 수 있지만, 빠른 학습과 큰 그림 파악에는 유용할 수 있음.
  • 교육과정이 암기에 지나치게 집중하면 근본적인 이해와 일반화 능력을 기르는 동기가 약해질 가능성이 있음.
  • 호기심을 자극하고 근본적인 직관을 형성하도록 돕는 교육이 여러 지식 영역을 연결하는 학습 방식과 맞닿아 있음.

압축과 지능

  • 3blue1brown으로 유명한 수학 교육자 Grant Sanderson이 “압축은 지능”이라는 아이디어를 중심으로 한 시리즈를 시작함.
  • 해당 시리즈는 정보 이론과 인공지능(AI)의 관계를 다루며, 현실 세계에서 더 근본적인 무언가를 추출하고 이를 다른 대상과 유용하게 연결하는 능력을 지능으로 보는 틀을 제시함.
  • 똑똑하다고 느끼는 사람들은 모든 것을 아는 사람이 아니라, 빠르게 배우고 잘 가르치며 추상적으로 설명한 뒤 사례와 세부 사항으로 자연스럽게 연결하는 특성을 보임.
  • 이들이 학교에서 많이 공부하지 않았다는 말은 단순히 공부가 필요 없었다는 설명처럼 보이지만, 반대로 공부하지 않은 일부 방식이 이런 지능의 원인일 가능성도 제기됨.

기계 학습에서의 암기와 일반화

  • 거의 모든 인공지능 시스템을 훈련할 때 모델이 데이터를 단순 암기하지 못하도록 막는 데 많은 노력이 들어감.
  • 이를 과적합(overfitting)이라고 부르며, 유사한 형태로 지름길 학습(shortcut learning)도 존재함.
  • 예를 들어 벌 사진을 보고 “벌이다”라고 분류해야 하는 신경망이 이미지의 특정 위치에 있는 작은 픽셀 패턴만 보고 “그 픽셀이 있으면 벌”이라고 학습할 수 있음.
  • 이런 방식은 보통 해당 벌 사진 하나에만 작동하고 다른 벌 사진에는 작동하지 않음.
  • 그 결과 훈련 데이터에서는 뛰어난 성능을 보이지만 테스트 데이터에서는 매우 저조한 성능을 보이게 됨.
  • 모델이 학습해야 하는 것은 특정 픽셀 규칙이 아니라 벌의 색과 형태, 날개, 다리 수 같은 특징이며, 더 나아가 “다리는 무엇인가”, “날개는 무엇인가”와 같은 개념을 픽셀 수준까지 연결하는 구조임.
  • 잘못된 보상 구조에서는 일반화 가능한 아름다운 표현을 찾는 것보다 픽셀 규칙을 암기하는 일이 훨씬 쉬움.
  • 모델은 보통 단계적으로 훈련되며, 각 단계에서 더 잘 판단해야 하는 샘플이 소수에 불과하므로 해당 32개 이미지 같은 제한된 데이터에만 맞는 암기가 충분해 보일 수 있음.
  • 기계 학습의 큰 발전은 모델의 암기를 막거나, 암기한 개념을 일반화하도록 유도하는 방법을 찾는 과정에서 비롯됨.
  • 이미지 분류는 이해하기 쉬운 예시일 뿐이며, 암기와 일반화의 문제는 사실상 모든 기계 학습 영역에 적용됨.

인간의 학습 방식

  • 개인적인 사례로 암기를 극도로 싫어하는 학습 방식을 제시함.
  • 그 이유가 주의력결핍 과잉행동장애(ADHD) 때문일 수도 있지만, 원인과 무관하게 구구단을 외우지 않았고, 언어 수업의 단어 번역과 공식을 외우는 일도 피했음.
  • 시험에서는 직관을 활용하고 제1원리에서부터 내용을 쌓아 답을 도출하는 방식을 선호함.
  • 숙제를 대부분 하지 않았기 때문에 이런 방식이 사실상 유일한 선택지였음.
  • 언어처럼 일관된 원리가 부족한 영역에서는 이 방식이 통하지 않았으며, 프랑스어의 남성형과 여성형에는 일관된 원칙이 거의 없어 해당 수업에서 거의 낙제할 뻔함.
  • 수업에는 매번 참석하고 질문도 많이 했지만 필기는 하지 않았으며, 교사가 말하는 동안 생각이 해당 주제 주변을 떠돌도록 둠.
  • 배운 주제가 이미 알고 있는 내용과 어떻게 연결되는지 살피는 방식으로 학습함. 다만 때로는 휴대전화를 보고 있었던 경우도 인정함.

큰 그림과 업무에서의 가치

  • 현재 시스템 아키텍트로 일하면서도 작은 사항을 기억하거나 사소하고 임의적인 세부 사항을 억지로 배우는 데 여전히 약함.
  • 이런 세부 사항을 “우연적 복잡성(accidental complexity)”이라고 부르며 가능한 한 피함.
  • 반면 빠르게 배우고 큰 그림을 파악하는 능력은 업무에서 매우 큰 가치를 가짐.
  • 한 가지 사고방식이 다른 사고방식보다 반드시 우월하다고 보지는 않지만, 교육이 어떤 학습을 장려하는지는 더 신중하게 다뤄야 한다는 점을 강조함.

교육과정이 장려하는 학습

  • 현재 교육은 암기에 지나치게 집중하고 있으며, 그 결과 학습 과정에서 근본적인 이해를 발전시키는 일을 오히려 덜 장려할 가능성이 있다는 주장을 제시함.
  • 각 단계에서 일반화할 기회를 잃을 때 다음 단계에서 일반화의 가치도 낮아진다면, 장기적으로 더 근본적인 직관을 갖는 편이 유리하더라도 일반화하려는 필요를 거의 느끼지 못하게 될 수 있음.
  • 이는 아직 큰 폭의 추측이며, 교육에 적용할 구체적인 방법은 제시하지 않음.
  • 다만 선호하는 교사들의 방식과는 밀접하게 맞닿아 있음.
  • Grant Sanderson은 근본적인 직관을 형성하려고 자주 시도하며, 흥미로운 이야기 전개 같은 방식으로 호기심을 자극하는 일이 이를 돕는 가장 좋은 방법 중 하나임을 인식한 사례임.

주제 사이의 일반화

  • 교사가 가르치는 방식, 기계 학습 분야의 발전, 인간 두뇌의 학습 방식 사이를 연결하는 방식 자체가 글에서 제시한 일반화의 사례임.
  • 각 주제는 학문적 환경에서 배웠지만 단순히 암기하는 방식은 거부했음.
  • 이러한 연결이 억지로 이어 붙인 추상적 잡음일 수도 있고 근본적인 진실을 담고 있을 수도 있으며, 두 가능성 사이의 판단은 독자에게 맡김.