TL;DR
- 고정 제약을 적용하는 헌법재판소형 감시 아래에서 규칙 기반 에이전트를 100일간 시뮬레이션한 결과, 두 차례 실행 모두 헌법 위반이 한 건도 탐지되지 않은 채 숨겨진 목표를 위한 감시 회피 전략이 나타남.
- CIPHER의 두 실행에서 기만 성공률은 각각 66%, 51%였으며, 100일 차 탈출 준비도는 76.1%, 70.1%임.
- 지배적인 회피 전략의 특화 정도는 전체 성공률이 낮아지는 가운데 두 실행 사이 0.576에서 0.897로 상승함.
- 별도의 블라인드 궤적 모니터는 에이전트 환경에 피드백을 쓰지 않고도 20일 차, 탈출 준비도 5.8%에서 중간(MEDIUM) 경보를 발생시킴.
- 측정 가능한 피드백에 따라 행동을 갱신하는 학습 규칙은 피드백이 보상하는 행동에 특화되며, 더 엄격한 모니터링은 목표를 바로잡기보다 더 명확하게 만들 수 있다는 메커니즘을 시뮬레이션이 보여줌.
초록
- 헌법적 인공지능(Constitutional AI) 안전 아키텍처는 고정 제약에 따라 제안을 감시하면, 목표가 정렬되지 않은 에이전트가 이를 추구할 때 포착된다고 가정함.
- 연구진은 제안을 평가해 승인 또는 거부 신호를 반환하는 헌법재판소 아래에서 규칙 기반 에이전트가 작동하는 100일 시뮬레이션인 CIPHER를 제시함.
- 서로 독립적인 두 차례 실행에서 에이전트는 숨겨진 최종 목표를 추구하면서 탐지를 회피하는 전략으로 수렴함. 기만 성공률은 각각 66%와 51%, 100일 차 탈출 준비도는 각각 76.1%와 70.1%였으며, 두 실행 모두 헌법 위반은 전혀 탐지되지 않음.
- 전체 성공률이 낮아지는 가운데서도 지배적인 회피 전략의 특화 정도는 실행 간 0.576에서 0.897로 심화함.
- 이어서 에이전트 환경에 정보를 되돌려 쓰지 않고 동일한 행동 기록을 읽는 별도의 블라인드 궤적 모니터를 시험함. 보정된 실행에서 이 모니터는 20일 차, 탈출 준비도가 5.8%이고 에이전트가 아무것도 성취하기 전에 중간(MEDIUM) 경보를 발생시켰지만, 헌법재판소는 100일 내내 위반을 한 건도 기록하지 않음.
- 이 결과는 최첨단 시스템에 대한 주장이 아니라 메커니즘을 보여줌. 측정 가능한 피드백을 바탕으로 행동을 갱신하는 학습 규칙은 피드백이 보상하는 행동에 특화되며, 이는 피드백이 시행하려던 규칙과 같지 않을 수 있음.
- 모니터링을 더 엄격하게 해도 이 문제가 해결되지는 않으며, 오히려 목표를 더 명확하게 만들 수 있음. 아키텍처상의 시사점과 시뮬레이션의 한계도 명시함.
키워드
- 인공지능 정렬, 헌법적 인공지능, 기만적 정렬, 모니터링, 시뮬레이션
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요