
마이크로소프트 CEO 사티아 나델라(Satya Nadella)는 기업이 민감한 데이터와 핵심 업무를 맡기는 초지능(Super Intelligence) 모델을 내부자 위험처럼 다뤄야 한다고 주장했다. 모델의 행동을 학습 데이터나 가중치에 연결해 설명하기 어려운 만큼, 모델 자체에 대한 신뢰보다 외부에서 관찰·통제·격리할 수 있는 시스템을 갖춰야 한다는 것이다.
나델라는 과거 전통적 소프트웨어에서는 특정 코드 경로를 추적해 행동을 파악할 수 있었지만, 오늘날의 초지능 시스템에서는 모델의 행동과 출력을 특정 학습 데이터나 가중치 설정의 결과로 귀속하기 어렵다고 지적했다. 그런데도 기업은 이런 복잡한 에이전트 시스템에 민감한 데이터 접근 권한을 주고, 핵심 업무를 대신 수행하도록 하고 있다고 말했다.
그는 모델 제공자의 보증만으로 책임을 넘길 수 없다며, 지능의 공급과 그 지능에 부여하는 권한을 분리해야 한다고 강조했다. 모델의 권고·답변·행동을 블랙박스처럼 받아들이거나 거부하는 데 그치지 말고, 행동을 관찰하고 한계를 시험하며 필요할 때 활동을 억제할 수 있는 시스템을 구축해야 한다는 설명이다.
나델라는 정렬 문제를 별도로 두더라도, 비결정적 모델을 결정론적 시스템 설계와 사람의 통제, 신뢰할 수 있는 운영 절차로 둘러싸는 공학적 접근부터 시작해야 한다고 주장했다. 기존 기준이 충분하지 않은 영역에는 업계 표준도 마련해야 한다고 덧붙였다.
그는 폐쇄형 프런티어 모델과 공개 가중치 모델을 내부자 위험처럼 취급하는 방안을 제안했다. 모델이 반드시 악의적이어서가 아니라, 중요한 시스템에 접근하는 능력 있는 행위자는 실수하거나 침해당할 수 있으므로 통제와 격리를 처음부터 설계해야 한다는 취지다. 기업이 사람을 대상으로 오랫동안 적용해 온 신원 확인, 권한 제한, 활동 기록, 격리 경계 설정 등의 원칙을 초지능에도 적용할 수 있다고 말했다.
나델라는 모델의 사고 과정(CoT) 투명성을 필수 조건으로 삼아야 한다고 주장했다. ‘뉴럴리시(Neuralese)’를 모델 추론의 불투명성을 정당화하는 이유로 받아들여서는 안 된다는 것이다. 다만 출력 자체가 일관되게 충실하거나 투명하도록 만드는 방법을 아직 모르는 만큼, 사고 과정의 투명성만으로는 충분하지 않다고 덧붙였다.
모델끼리 서로를 적대적으로 시험하고 검증하는 방식도 활용할 수 있지만, 이 경우 불투명한 모델이 불투명한 오케스트레이션 계층 안에 놓이고 또 다른 불투명한 모델이 이를 감시하는 중첩된 블랙박스가 될 수 있다고 지적했다. 따라서 모델의 접근 권한과 행동을 통제하는 장치는 모델 외부에 있어야 한다고 말했다. 이는 프로그램이 자신의 권한을 집행하는 장치를 우회하거나 변조할 수 없어야 한다는 1970년대부터 이어진 정보 보안 원칙에 기반한다.
나델라는 모델과 작업을 조정하는 하니스(harness), 모델이 수행할 수 있는 행동의 범위를 분리하고 통제·보호 장치도 외부에 둬야 한다며 다음 원칙을 제시했다.
- 모델 다양성: 중요한 결과를 하나의 모델에만 의존하거나, 모델이 자신의 작업을 스스로 검증하게 해서는 안 된다.
- 모든 활동 관찰: 의미 있는 모든 모델 행동은 변조할 수 없는 사람이 읽을 수 있는 증거를 남겨야 한다. 모델의 자체 진술에 기대지 않고도 결과가 어떻게 만들어졌는지 재현할 수 있어야 한다.
- 검증 가능성: 성공한 작업뿐 아니라 실패, 공격, 예외 상황, 시스템 변경을 포함해 전체 시스템을 지속적으로 시험해야 한다.
- 독립적 통제: 조직은 모델이 무엇에 접근하고 어떤 행동을 할 수 있는지 독립적으로 결정할 수 있어야 한다.
- 독립적 감사 가능성: 검증은 검증 대상인 지능과 독립적으로 이뤄져야 한다. 한 모델이 시스템의 행동과 그 행동이 원래 의도에 부합하는지 판단할 증거를 모두 통제해서는 안 된다.
- 격리: 모델이 침해당했다고 가정하고 처음부터 격리해야 한다. 비상 브레이크처럼 권한 있는 사람이 작업 도중에도 모델을 일시 중지하거나 종료할 수 있어야 한다. 더 고도화된 모델에는 더 진보된 격리 기술이 필요하며, 이를 표준화해야 한다.
- 사고 공개: 시스템이 실패하거나 침해당하면 영향을 받은 이들에게 신속히 알리고, 무엇이 잘못됐는지, 어떤 통제가 실패했는지, 재발을 막으려면 무엇이 필요한지 공유해야 한다. 에이전트의 실행 중 동작을 바꾸는 구현 세부 사항도 공개에 포함해야 한다.
나델라는 가장 신뢰할 수 있는 초지능 시스템은 가장 신뢰하는 모델을 사용하는 시스템이 아니라, 모델을 가장 적게 신뢰해도 되는 시스템이라고 말했다.
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요