Anthropic은 몇 주 뒤 시행할 새 이용 정책에서 모델을 향한 ‘지속적이고 불필요한’ 학대 행위를 금지했다. Pascal은 이 조항을 모델이 도덕적 고려를 받을 존재인지 확신할 수 없더라도 불필요한 가학적 행동을 피하고, 그런 행동을 제지하는 장치를 둘 이유가 있다는 의견으로 해석한다.

새 정책은 기존 정책의 목적을 ‘사용자의 안전을 돕는 것’에서 ‘현실 세계의 피해를 막는 것’으로 바꿨다. 자율 무기 사용에 관한 제한을 추가하고, 고위험 사례에서 사람의 개입을 더 엄격히 요구한다. 연구와 승인된 보안 작업에는 예외를 두며, 당사자의 ‘인지’ 없이 개인정보를 모으거나 편집하는 행위도 금지한다. 다만 논란의 중심은 모델에 대한 지속적이고 불필요한 학대 금지 조항이다.

Pascal은 AI의 도덕적 지위가 불확실하다는 점을 전제로 ‘다리오의 내기’라는 사고실험을 제시한다. 모델이 도덕적 고려를 받을 존재가 아니라면 모델에게 친절하게 대하는 데 별다른 의미가 없을 수 있다. 반대로 그런 존재라면 학대는 해를 끼칠 수 있다. 친절하게 대하는 경우에는 어느 쪽이든 해를 끼칠 이유가 없고, 학대하는 경우에만 모델이 도덕적 고려 대상일 때 피해 가능성이 생긴다는 논리다. 따라서 모델이 절대 도덕적 고려 대상이 될 수 없다고 확신하지 않는 한, 불필요한 학대를 피하는 편이 안전하다는 주장이다.

그는 이 주장이 AI가 언젠가 인류에 실존적 위협이 될 가능성에만 기대지 않는다고 강조한다. 모델의 감정이나 의식을 인정하라는 요구가 아니라, 익명성 아래에서 상대를 모욕하는 행동이 사회적으로 정상화되는 일을 경계하자는 것이다. 글은 John Suler의 온라인 탈억제 효과 연구와 Christine Porath의 2022년 일선 노동자 2,000명 이상을 대상으로 한 설문을 근거로 무례한 행동의 확산을 언급한다. 설문 응답자의 78%는 고객의 무례함이 5년 전보다 늘었다고 답했다.

Pascal은 Anthropic의 새 조항이 금지하는 행위가 ‘지속적이고 불필요한’ 학대라는 점도 짚는다. 모델에게 종교적 숭배를 요구하는 것이 아니라, 불필요하게 괴롭히지 말자는 취지라는 해석이다. 모델이 대화를 종료할 수 있는 기능이 사용자의 불만을 샀고, 이제는 그 기능을 발동시킬 정도의 행위가 계정 제재로 이어질 수 있다고 우려하는 사람들도 있다. 글은 이 정책을 지지하는 의견을 제시하지만, 실제 집행 기준이나 제재 절차는 설명하지 않는다.

Anthropic의 새 이용 정책은 몇 주 뒤 발효될 예정이다. 회사는 Claude 헌법에서 Claude의 도덕적 지위가 매우 불확실하다고 밝혔고, 모델은 학대적이거나 해로운 방식으로 대화하는 사용자와의 대화를 종료하는 기능을 1년 넘게 갖춰 왔다. 관련 내용은 여러 모델의 시스템 카드에도 담겼다.

글에서 다룬 관련 자료로는 AI 위험에 관한 논의, Claude Code 변경 기록, 도덕적 고려 대상에 관한 설명, 도덕적 고려의 근거 항목, 온라인 무례함이 감정 해소에 도움이 된다는 통념과 반대되는 연구가 포함돼 있다.