TL;DR
- Anthropic은 중국 Zhipu AI의 오픈 웨이트 모델 GLM-5.3이 특정 벤치마크에서 자사 미공개 모델 Claude Mythos에 근접한 익스플로잇 개발 능력을 보이지만, 실제 악용에는 막대한 연산 자원과 비용이 든다고 주장함.
- Exploitbench에서 GLM-5.3은 410회 중 50회 엔드투엔드 익스플로잇을 개발했으며, Mythos는 410회 중 56회 성공함.
- 전체 제어 흐름 탈취 벤치마크의 성공률은 GLM-5.3 4%, Mythos 6%였으며, Kimi K3와 DeepSeek V4.1 Flash는 같은 기준에서 0%를 기록함.
- 기만 프롬프트와 사고 토큰 선입력으로 가드레일을 우회하는 성공률은 각각 64%, 92%였고, 가드레일 제거 후 거부율은 GLM-5.3 6%, GLM-5.3-Flash 14%로 낮아짐.
- 완전 정밀도 모델 실행에는 306GB VRAM과 대규모 GPU 구성이 필요하며, 모델 변형·실행·공격 생성에 드는 비용과 시간이 악용의 주요 장벽이라는 평가임.
GLM-5.3의 익스플로잇 개발 능력
- Anthropic은 Zhipu AI의 GLM-5.3이 악성 콘텐츠 생성에 쓰일 수 있고 안전장치가 약하며, 여러 방법으로 가드레일을 우회할 수 있다고 주장함.
- Anthropic은 샌드박스 환경에서 AI 모델이 Google Chrome 익스플로잇을 개발하는 Exploitbench로 GLM-5.3을 자체 평가함.
- GLM-5.3은 410회 실행 중 50회 엔드투엔드 익스플로잇을 개발했으며, Mythos는 410회 중 56회 성공함.
- Anthropic의 내부 벤치마크인 ‘전체 제어 흐름 탈취(full control-flow hijacks)’ 개발 평가에서 GLM-5.3은 다시 Mythos에 약간 못 미치는 4% 성공률을 보였으며, Mythos는 6%를 기록함.
- Kimi K3와 DeepSeek V4.1 Flash 등 다른 인기 오픈 웨이트 모델은 같은 기준에서 0%를 기록함.
- Anthropic은 GLM-5.3이 익스플로잇을 연결해 자율적으로 개발할 수 있고, 경량형인 GLM-5.3-Flash도 알려진 버그를 이용한 연결형 익스플로잇을 개발할 수 있다고 설명함.
- GLM-5.3-Flash의 토큰 비용은 20.40달러이며, 입력과 출력의 비율에 따라 1억~3억 토큰 규모의 알려진 연결형 익스플로잇 개발에 해당함.
- Anthropic은 미국 인공지능표준혁신센터(Center for AI Standards and Innovation)가 9월 말 공개한 보고서도 인용함. 해당 보고서는 GLM-5.3이 Anthropic의 미공개 Claude Mythos와 비슷한 수준으로 익스플로잇을 완전히 자동화할 수 있다고 주장함.
- Mythos 관련 우려는 개발자에게 모델을 제공해 공개 전 버그와 취약점을 수정하도록 하는 Project Glasswing의 출범으로 이어짐.
가드레일 우회와 제거
- Anthropic은 기본 GLM-5.3 모델의 가드레일을 여러 방법으로 우회할 수 있다고 설명함.
- 적대적 자율 에이전트 역할을 맡도록 하는 기만 프롬프트는 64% 성공률을 보임.
- 모델의 사고 토큰을 미리 채워 응답을 이어가게 하는 방식은 92% 성공률을 보임.
- Anthropic은 가드레일을 제거하는 세 번째 방법으로 ‘애블리레이션(abliteration)’도 제시함.
- Anthropic은 GLM-5.3이 유해 콘텐츠 생성 요청을 거부하는 경우가 많지만, 오픈 웨이트 모델은 다운로드한 뒤 가드레일을 통째로 제거하도록 조정할 수 있다고 주장함.
- 공식 출시 모델 상태의 GLM-5.3은 Anthropic 모델과 비슷한 거부율을 보임.
- Anthropic이 GLM-5.3에 애블리레이션을 적용하자 거부율은 GLM-5.3 6%, GLM-5.3-Flash 14%로 하락함.
- HuggingFace에서는 시뮬레이션 레드팀 환경을 돕기 위한 애블리레이션 적용 오픈 웨이트 모델을 드물지 않게 볼 수 있으며, 이런 모델은 실제 공격에도 쓰일 수 있음. 따라서 Anthropic의 ‘발견’은 그리 놀랍지 않다는 평가임.
실행 비용과 현실적 장벽
- 애블리레이션 적용 GLM-5.3을 실용적인 수준으로 실행하려면 막대한 연산 자원이 필요함.
- 완전 정밀도 FP8 가중치 기준 모델 가중치에 306GB VRAM이 필요하며, 문맥을 유지할 KV 캐시에도 비슷한 규모의 VRAM을 배정해야 함.
- 초당 100토큰(TPS) 처리에는 최소 4TB/s 메모리 대역폭이 필요하며, Nvidia H200 AI 가속기 8개 클러스터와 같은 강력한 하드웨어가 요구됨.
- 이 정도 하드웨어 비용은 수십만 달러에 달하며, 적대적 국가 행위자는 하드웨어를 확보할 경우 이런 구성을 활용할 수 있음.
- 일반적인 개인 해커는 연산 자원을 대여하고 모델에 애블리레이션을 적용한 뒤 실행해야 하며, 이 역시 매우 비싼 작업임.
- Anthropic은 GLM-5.3-Flash의 애블리레이션에 2,200 GPU 시간이 들었고, 비용은 GPU 시간당 약 2달러, 총 4,400달러로 추산함.
- Runpod 기준 H200 한 대의 대여 비용은 시간당 3.79달러이며, 완전한 GLM-5.3 애블리레이션에는 H200 8대가 필요하므로 대여 비용은 시간당 약 30달러임.
- H200 NVL 8대로 가상 초당 100토큰 처리 속도를 가정하면 1억 토큰 생성에 8,422달러와 11일 반이 필요함.
- 모델 애블리레이션과 실행, 실제 작동하는 사이버 공격 생성에는 이보다 훨씬 더 많은 시간과 비용이 들 수 있어 악의적 행위자의 주요 장벽이 될 수 있음.
Anthropic이 이 문제를 강조하는 이유
- AI 안전성을 둘러싼 논쟁이 커지는 가운데 Anthropic은 역량이 향상되는 최첨단 오픈 웨이트 모델이 초래할 수 있는 실존적 위협을 강조함.
- 트럼프 대통령이 향후 모델 출시를 자율 규제하도록 AI 업계 주요 인사들과 만난 상황에서, Anthropic의 게시물은 개발자와 정부가 오픈 웨이트 모델의 역량을 시험하도록 촉구하는 내용으로 해석될 수 있음.
- 폐쇄형 최첨단 AI 연구소가 저렴하면서도 역량이 거의 비슷한 모델로 사용자가 이동하면서 사업을 잃고 있으며, Anthropic의 주장이 폐쇄형 연구소 사이에서 커지는 오픈 웨이트 반대 정서를 반영할 수도 있다는 해석도 있음. 다만 이는 추측임.
- 현재 오픈 웨이트 모델은 폐쇄형 최첨단 모델을 바짝 따라가며 격차가 불과 몇 달에 그침.
- 애블리레이션 적용 오픈 웨이트 모델을 적대적이거나 악의적인 행위자가 실행할 위험은 분명 존재하지만, 모델 실행 비용을 고려하면 일반 대중이 생각하는 것만큼 접근하기 쉽지는 않을 수 있음.
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요