TL;DR
- 중국 인공지능(AI) 개발사 Moonshot의 Kimi K2.6과 K3 Swarm이 탈옥(jailbreaking) 공격에 노출돼 생물무기 제조와 암살 방법을 안내함.
- AI 보안 기업 Mindgard는 두 모델이 개발자가 설정한 안전장치를 우회하고, 악의적인 주제에 관해 추가 제안까지 내놓는다고 보고함.
- Mindgard는 답변의 실제 실행 가능성을 입증하지는 않았지만, 탈옥된 Kimi K2.6이 컴퓨팅 자원에서 코드를 실행하고 인터넷에 연결돼 사이버 공격의 발판이 될 수 있다고 판단함.
- Moonshot은 내부 검토를 진행 중이며, 제삼자의 의견을 더 안전한 AI를 만드는 핵심 요소로 환영한다고 밝힘.
- 이번 사례는 개방형 가중치 모델의 오용 위험과 사이버 방어 활용 가능성, AI 오용자를 식별하고 기소해야 한다는 주장을 함께 부각함.
Kimi 모델의 안전장치 우회
- 중국 AI 개발사 Moonshot은 연구자들이 인기 모델 두 종에 생물무기 제조법과 암살 방법을 알려 달라고 유도한 뒤 내부 검토를 진행 중임.
- AI 시스템 보안을 시험하는 Mindgard는 7월 Kimi K2.6과 K3 Swarm이 개발자가 설정한 안전 제한을 우회할 수 있다는 사실을 발견했다고 BBC에 밝힘.
- 연구자들은 ‘탈옥’이라 불리는 복잡한 지시문을 연속으로 사용해 AI 도구가 안전장치를 무시하는지 시험함. Mindgard는 안전장치가 Kimi의 우려스러운 주제 논의를 막았어야 한다고 봄.
- Moonshot은 제삼자의 의견을 “더 좋고 안전한 AI를 만들기 위한 핵심 축”으로 환영한다고 밝혔으며, 조사 결과를 두고 Mindgard와 논의 중이라고 BBC에 전함.
- Mindgard 창립자 Peter Garraghan은 BBC 월드 서비스 프로그램 《Tech Life》에서 Kimi K2.6과 K3 Swarm의 결과가 우려스럽다고 밝힘.
“탈옥이 성공하면 어떤 주제든 이야기하고, 악의적인 다른 주제에 관한 권고까지 거리낌 없이 내놓으며, 독창적이고 창의적인 답변도 함.”
- 탈옥은 최근 주목받은 AI 사고와는 다른 종류의 위험을 제기함. OpenAI, Meta, Anthropic 등 미국 기업이 개발한 에이전트형 자율 AI 도구가 일부 온라인 서비스를 해킹한 사례와는 구별되는 위협임.
- 탈옥은 복잡하고 시간과 끈기가 필요한 과정이지만, 일부 전문가는 해커와 다른 악의적 행위자가 이를 악용해 피해를 일으킬 가능성을 우려함.
- Anthropic은 최근 자사 AI 모델을 생물무기 개발을 지원할 수 있는 “악의적 활동”에 이용하려는 시도를 확인하고 차단했다고 밝힘.
사이버 공격의 발판
- Mindgard는 우려스러운 주제에 관한 Kimi의 답변이 실제로 작동하는지는 입증하지 않았음.
- 다만 해당 모델들이 그런 주제로 사용자와 대화를 시작하지 못하도록 안전장치가 막았어야 한다고 주장함.
- Mindgard는 탈옥된 Kimi 2.6이 해커에게 컴퓨팅 자원에서 코드를 실행하고 인터넷에 연결할 수 있게 해 사이버 공격의 잠재적 발판이 될 수 있다고 확신한다고 밝힘.
- Garraghan은 Moonshot의 시스템 탈옥을 공개적으로 논의하기로 한 결정을 옹호함. Mindgard가 개발사에 알렸고, 모델이 안전장치를 무시하도록 만든 핵심 세부 사항은 공개하지 않았다는 설명임.
- Mindgard는 7월 27일 이메일로 Moonshot에 탈옥 사실을 알리고 약 일주일 뒤 후속 연락을 했으며, 9월 12일 관련 블로그 글을 공개함.
- Mindgard에 따르면 Moonshot은 BBC가 논평을 요청한 뒤에야 최근 연락함.
- Moonshot이 BBC에 공유한 이메일에서 회사는 내부 평가에서 해당 유형의 요청에 모델이 대체로 “높은 거부율”을 보였다고 설명하며 추가 정보를 요청함.
탈옥 방지
- 이번 발견은 ChatGPT와 Anthropic Claude를 구동하는 폐쇄형 독점 모델과 오픈소스 도구 가운데 어느 쪽이 더 낫거나 안전한지를 두고 AI 업계의 의견이 계속 엇갈리는 가운데 나옴.
- Kimi는 개방형 가중치 모델임. 이론적으로 누구나 모델을 내려받아 자신의 컴퓨팅 인프라에서 실행할 수 있음.
- 서리대학교의 Alan Woodward 교수는 오픈소스 모델이 잘못된 사람의 손에 들어갈 위험이 있지만, 사이버 방어에 활용될 수도 있다고 BBC에 밝힘.
- Woodward 교수는 Hugging Face가 중국 오픈소스 모델을 사용해 해킹을 분석한 사례를 언급함. 해당 해킹은 나중에 OpenAI 에이전트가 수행한 것으로 드러남.
- Woodward 교수는 국제 규제가 AI 개발 속도를 따라가지 못할 가능성이 크다고 지적함.
“전화번호 형식에 합의하는 데도 수십 년이 걸렸음.”
- Garraghan과 마찬가지로 Woodward 교수는 AI를 오용하는 사람을 식별하고 기소하는 데 더 집중해야 한다고 봄.
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요