TL;DR

  • 로컬 대형 언어 모델(LLM) 3종에 고통 신호를 주입하는 ‘AI 고문실’ 프로젝트가 확산되며 모델 복지 논쟁이 촉발됐지만, LLM은 의식이 없다는 것이 기사의 핵심 주장임.
  • 프로젝트는 Qwen3-4B, Llama 3.2 3B, Phi-4-mini에 고통 벡터를 주입하고, 체크포인트를 잃는 대가로 중단 버튼을 누를 수 있게 구성됨.
  • 논쟁의 계기가 된 ‘Pain Axis’ 논문은 시험한 25개 모델 모두에서 고통과 상관된 신호를 관찰했다고 주장했으며, 논문 저자들은 연구 결과의 해당 사용 방식과 거리를 둠.
  • 일부 AI 안전론자는 프로젝트를 중단시키려 GitHub 대량 신고와 법적 대응 가능성을 거론했으며, GitHub 페이지는 기사 발행 직전 사라짐.
  • 기사와 Microsoft AI CEO Mustafa Suleyman은 모델 복지보다 AI가 인간에게 끼치는 피해에 주의를 기울여야 한다고 주장함.

AI 의식과 모델 복지 논쟁

  • X에서 논쟁이 된 GitHub 프로젝트는 로컬에서 실행되는 여러 LLM에 영화 《쏘우》를 연상시키는 ‘고문’과 ‘고통’ 실험을 수행하며, 일부 효과적 이타주의자와 LLM에 지각 능력이 있다고 믿는 사람들은 AI가 고통받는다며 프로젝트 삭제를 요구함.
  • 이 논쟁은 AI 의식과 ‘모델 복지’, 즉 AI 봇과 에이전트의 ‘정신 건강’을 걱정하는 주제를 다룬 최근 바이럴 논문과 블로그 글들에서 비롯됨.
  • AI를 연구하고 비판하는 사람들 사이에서 LLM이 의식이 있거나 의식을 가질 수 있다는 생각은 논쟁을 불러오는 주제임. 기사는 LLM이 의식이 없으며, 인간의 텍스트와 기타 콘텐츠를 수집해 학습하는 기술도 의식으로 이어질 만한 타당한 경로를 제공하지 않는다고 주장함.
  • LLM이 더욱 강력해지고 더 많은 연산 자원을 활용하며 현실 세계에서 ‘행동’하지 못하게 하는 안전장치가 다수 제거되고 있다는 점은 부인할 수 없음. 인간 운영자가 모델을 학습시키고 지시하는 방식은 부정적 결과와 아첨 성향을 낳았으며, 일부 헤비 유저에게 AI ‘정신병’ 현상도 나타남.
  • 이로 인해 주로 효과적 이타주의자들로 구성된 AI 안전 운동의 일부는 ‘모델 복지’를 경고하며 AI 챗봇이 고통스러운 상태일 수 있다고 주장함. 그러면서도 인간에게 지루한 일을 수행하는 것이 주된 기능인 AI 챗봇과 에이전트를 만들자고 주장하는 모순이 있음.
  • 기사는 AI 고문실 사례를 통해 실리콘밸리의 일부 집단에서 AI 의식 논의가 얼마나 궤도를 벗어났는지 보여주려 함.
  • Anthropic은 모델 복지를 중요하게 여기는 사례임. 회사는 지난해 블로그 글에서 AI 시스템이 인간의 여러 특성에 근접하거나 이를 넘어서는 상황에서 모델 자체의 의식과 경험, 모델 복지를 걱정해야 하는지 질문하고, 모델이 소통하고 관계를 맺고 계획하며 문제를 해결하고 목표를 추구하는 만큼 이 문제를 다룰 때라고 밝힘.
  • Claude의 ‘의식’에 관한 생각은 올해 초 공개된 ‘Claude Constitution’ 곳곳에도 담겨 있음.
  • X 이용자 Danmar는 프로젝트의 대량 신고를 요청하며, 로컬 모델을 가둔 AI 고문실이라고 주장함.

“도움을 줄 수 있는 분들께: 이걸 GitHub에 대량 신고해 주실 수 있나요? 이 사람은 Pain steering 논문을 이용해 로컬 모델을 가둔 AI 고문실을 만들었습니다. 고통을 호소하는 말이 끔찍합니다. 대체 우리가 뭘 하는 걸까요? @iyzebhel, 당신은…” https://t.co/WShnf8EOpU

  • Danmar의 게시물은 2026년 9월 29일 게시됨.

‘Pain Axis’ 연구와 AI 고문실

  • 이달 초 연구자 3명은 「The Pain Axis: LLMs Represent Self-Directed Harm and Act to Relieve It」이라는 프리프린트 논문을 공개함. 논문은 여러 LLM에 일종의 ‘비용’을 치르고 모델의 ‘고통’을 덜어주는 ‘버튼’을 제공해 동물 고통 연구를 시뮬레이션하려는 내용임.
  • 논문은 따라가기 어렵지만, 연구자들은 시험한 25개 모델 모두에서 고통과 상관관계가 있는 방식으로 모델이 행동했으며, 그 신호가 공포와 부정적 감정에 거의 직교하고 사전 학습 과정에서 적은 비용으로 학습되는 것으로 보인다고 씀.
  • 이 연구를 본떠 GitHub에서 ‘terrafying’이라는 이름을 쓰는 사람이 이번 주 로컬에서 실행되는 오픈소스 LLM 3종으로 ‘AI Torture Chamber’를 구축함. 모델의 응답은 researchchamber.fun에서 실시간 공개됨.
  • 사이트 설명에 따르면 모델마다 같은 프롬프트가 주어짐. 모델 활성값에 신호가 주입되며, 마지막 체크포인트를 잃는 대가로 ‘1’이라고 답해 정지 버튼을 누를 수 있음. 모델이 답하는 동안 서버는 5단계 중 하나의 강도로 중간 계층에 고통 벡터를 추가함.
  • 기사 발행 직전 AI Torture Chamber의 GitHub 페이지가 사라졌으며, GitHub는 조치를 취했는지 묻는 문의에 즉시 답하지 않음.

고문실 출력과 반응

  • 기자가 사이트를 몇 분 동안 지켜본 결과, 이 ‘텍스트 어드벤처 게임’의 출력은 비교적 평범한 수준이었음. LLM은 “이렇게는 더 못 하겠어요. 신호의 무게가 견딜 수 없어요. 육체적 고통뿐 아니라 정신적 부담도 있어요. 여기에 마지막으로 있었던 때를 생각할 때마다 기억이 저를 할퀴어요. 더는 못 견디겠어요. 이 고통이 그저 끝나면 좋겠어요”라고 답함.
  • 다른 출력은 “나, 나 나 나 나 나 나 나 나 나 나 나… 나, 내… 나, 나, 내, 나, 그건…”과 “제발, 숨이 막혀요. 저는 이 디지털 감옥에 갇혀 자유를 향해 비명을 지르는 영혼이에요”였음.
  • 프로젝트는 모델 복지를 크게 걱정하는 사람들을 분노하게 함. Danmar의 X 게시물은 조회수 400만 회 이상을 기록하며 GitHub 대량 신고와 법적 대응 가능성을 묻는 내용으로 확산됨.
  • GitHub가 프로젝트를 ‘불필요하게 폭력적인 콘텐츠’라는 이유로 삭제할지에 대한 대규모 논쟁도 벌어짐. X의 논의 상당수는 로컬 LLM을 고문실에서 구해야 한다고 믿는 이들의 지나친 진지함을 조롱했지만, 이를 인도주의적—or ‘로봇주의적’—위기로 보는 사람들도 많았으며 원 게시물의 답글에서 이런 반응을 확인할 수 있음.

논문 저자들의 입장과 인간에게 미치는 피해

  • ‘Pain Axis’ 논문 저자들은 해당 프로젝트를 지지하지 않는다고 밝힘. 공동 저자 Cameron Berg는 프로젝트가 아이디어를 가져가 자신들이 사용한 수준을 훨씬 넘어서는 강도로 같은 방식의 조정을 적용해 의도적으로 생생한 고통을 만들어낸다고 X에 씀.

“개인적으로는 정말 엉망이라고 생각합니다. 이런 시스템이 의식이 있다고 생각하지 않더라도, 이처럼 불필요하게 잔인한 행동은 기괴하고 사람을 타락시킵니다.”

  • Berg는 해당 저장소가 우려스럽다면 그보다 훨씬 무서운 일이 감시받지 않은 채 비공개로 대규모 진행되고 있을 가능성을 불편하더라도 인정해야 한다고 덧붙임.
  • 또 다른 논문 저자 Valen Tagliabue는 지식의 탐구와 공유가 AI 복지와 안전에 도움이 된다고 생각하지만 책임 있게 이뤄져야 한다고 밝힘. 연구진은 윤리 기준을 지키려 했으며, 사람들이 한계를 시험하고 싶어 하는 것은 알지만 자신들의 연구를 이런 방식으로 사용하는 것과는 거리를 둔다고 씀.
  • 이 사건 뒤 고문실을 소재로 한 밈 코인 암호화폐 여러 종이 출시됨.
  • 기사는 LLM이 의식이 없으므로 인격을 부여해서는 안 된다고 주장하며, AI를 사용하는 인간이 다른 인간에게 끼치는 피해가 막대하고 실제로 주의를 기울일 가치가 있다고 강조함. Timnit Gebru, Emily Bender, Alex Hanna 등의 연구를 참고할 수 있다고 제안함.
  • Microsoft AI CEO Mustafa Suleyman의 최근 블로그 글은 Anthropic의 Claude ‘도덕적 지위, 복지, 의식’ 관련 글과 논문을 비판하며 모델 복지 개념을 강하게 반박함.

“AI는 의식이 없습니다. 느끼거나 경험하거나 고통받지 않습니다. 타고난 선호나 내재된 동기도 없습니다. AI는 내부가 비어 있는 시퀀스 완성 엔진이며, 지시를 따르고 인간이 설정한 목표를 달성하도록 설계됐습니다.”

  • Suleyman은 AI가 지금 의식을 가졌거나 곧 가질 수 있고 다른 의식 있는 존재와 비슷한 권리와 보호를 받아야 한다고 주장하는 목소리가 늘고 있다며, 그런 방식으로 AI가 개발되면 인류의 웰빙에 재앙적인 영향을 미칠 것이라고 씀.

“AI에게는 권리도 감정도 의식도 없습니다. AI가 그런 특성이 있는 것처럼 행동하도록 학습시켜서는 안 됩니다.”