TL;DR
- 항소법원이 국방부의 Anthropic 공급망 위험 지정을 유지한 가운데, 모델이 약관을 위반하지 않는 요청도 거부할 수 있어 Anthropic의 사용 제한은 모델 이용자 모두에게 공급망 위험이 됨.
- NIST는 공급망 위험을 공급품이나 시스템의 기능·무결성·운영 등을 훼손해 감시하거나 사용을 방해·저하할 수 있는 위험으로 정의함.
- Anthropic은 자사 모델을 자율 무기나 국내 대규모 감시에 사용하지 못하도록 제한하며, 회사 평판을 보호하려는 이런 제한은 합리적일 수 있음.
- Claude가 무례한 상대에게 경계를 전하는 표현이나 특정 문장을 암호화하는 코드 요청을 거부하는 사례는 사용 조건을 지킨 요청에도 제한이 작동함을 보여줌.
- 표현과 호기심을 보호하려면 개방형 로컬 모델을 널리 보급하고, AI 시대에 인간의 존엄성을 지켜야 함.
국방부의 공급망 위험 지정
- 작성 시점에 항소법원은 국방부가 Anthropic을 공급망 위험으로 지정한 결정을 유지한 상태임. 정치적 요소가 언제나 개입하지만, NIST의 공급망 위험 정의를 살펴볼 필요가 있음.
적대자가 공급품이나 시스템의 설계, 무결성, 제조, 생산, 유통, 설치, 운영 또는 유지보수를 방해하거나, 악의적으로 원치 않는 기능을 도입하거나, 그 밖의 방식으로 훼손해 시스템의 기능·사용·운영을 감시하거나 거부·중단·저하시킬 수 있는 위험임.
- 이 맥락에서 Anthropic은 적대자가 아니라 공급자이며, 자사 제품을 자율 무기나 국내 대규모 감시에 사용해서는 안 된다고 주장함. 이는 합리적인 제약이며, 다른 법적 집행이나 조치가 없는 한 모델 공급자로서 명시할 수 있는 조건임.
- 회사 모델이 이런 목적으로 사용될 경우 감당해야 할 실질적인 평판 위험이 있으므로, Anthropic이 제한을 두는 이유는 이해할 수 있음.
- 그러나 제한이 합리적이거나 공정한지는 국방부가 Anthropic을 공급망 위험으로 분류해야 하는 문제를 바꾸지 않음. 더 중요한 점은 일반 이용자가 대규모 감시나 자율 무기 용도로 모델을 사용하지 않더라도, 모델 이용자에게 Anthropic이 이미 적극적인 공급망 위험으로 작용한다는 것임.
사용 요청을 거부하는 모델
- Anthropic을 펜 제조사에 비유할 수 있음. 펜은 여러 내용을 쓰거나 문서에 서명하거나 만화를 그리는 데 사용될 수 있음. 펜에 이용 조건과 제한이 있다면 펜의 용도를 관리하고 목적마다 다른 펜을 써야 함.
- 그러나 Anthropic의 펜은 특정 문서에 서명하거나, 특정 만화를 그리거나, 특정 문장을 쓰려 할 때 잉크가 흐르지 않도록 능동적으로 막을 수 있음.
- 이런 일이 가설적이고 터무니없게 들릴 수도 있지만, 해당 모델을 쓰면서 이런 상황을 점점 더 자주 겪고 있음.
- 한 사례에서는 무례한 사람에게 경계를 분명히 전할 때 쓸 표현을 Claude에 요청함. 처음에는 표현 목록을 제공했고, 안내를 두 차례 조정한 뒤에도 새 목록을 제공함. 그러나 세 번째 조정 후에는 대화 내용을 되짚고 이미 충분한 예시를 제공했다고 판단해 추가 답변을 거부함.
- 이 요청은 자율 무기나 대규모 감시를 위한 것이 아니었으며, 이용 약관을 위반하는 내용도 아니었음.
- 또 다른 사례에서는 현재 시각을 암호화 키로 삼아 텍스트를 암호화하는 JavaScript 코드를 요청함. 이후 암호화할 문장을 제공했지만, Claude는 해당 문장에 코드를 실행하는 것을 거부함. 이 요청 역시 이용 약관을 위반하지 않았지만, 모델은 암호화하려던 문장에 이의를 제기함.
도구의 거부와 표현의 위축
- 도구가 특정 사용을 거부하는 일은 인류의 도구 사용 관점에서 전례가 없음. 누드 상태의 파트너를 보는 데 쓰이기를 거부하는 안경, 특정 페이지를 펼쳐주지 않는 사전, 특정인을 앉히지 않는 의자, 특정 개념의 설명을 거부하는 화이트보드와 같은 사례를 상상할 수 있음.
- 이런 사례는 모두 인간의 표현이나 호기심을 위축시키는 결과로 이어짐.
- 국방부가 모델을 자율 무기나 국내 대규모 감시에 사용하는 데 대한 Anthropic의 제한은 지지함. 그 제한으로 Anthropic이 공급망 위험이 된다면 그것도 감수할 수 있음.
- 비속어, 생물무기, 인종차별 또는 파트너 역할극에 관한 프롬프트 거부에는 동의하지 않지만 이해할 수 있음. 그러나 이용 약관이 허용하는 요청까지 모델이 점점 더 강한 의견을 내고 사용 방식을 제한한다면 모두에게 공급망 위험이 됨.
개방형 로컬 모델과 인간 존엄성
- 이런 문제는 개방형 로컬 모델이 더 흔해져야 하는 이유를 더욱 분명히 보여줌.
- 작가가 즐거움을 표현하는 모든 방식을 탐구하거나, 핵물리학자가 핵무기의 발전 과정을 설명하는 데 도움을 받거나, 정치 활동가가 충분한 정보를 바탕으로 선언문을 작성하려 할 때 컴퓨터가 사전 검열에 관여해서는 안 됨.
- 기술은 호기심과 표현을 가능하게 하고 확장해야 하지만, 점점 더 사상 단속이 이뤄지고 있음. TikTok 같은 플랫폼에서는 비속어가 음소거되고 음성 기록에서 빠지며, 정치 문제를 다루는 게시물이 삭제됨. ‘행복한’ 콘텐츠만 허용되는 상황임.
- Pope Leo XIV는 회칙 ‘Magnifica Humanitas’에서 AI 시대의 인간 존엄성을 보호해야 한다고 촉구함. 기술은 인간을 위해 작동해야 하며, 인간에게 맞서 사용되어서는 안 됨.
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요