Ronald J. Bodkin, Bahrad A. Sokhansanj, Gillian K. Hadfield는 AI가 프런티어 AI 연구소의 코드 대부분을 작성하는 상황에서, 개발 책임자가 자신이 만드는 것을 이해하는지 독립적으로 확인하는 ‘이해도 심사’를 제안했다. 이 심사에 실패하면 해당 기여물의 개발을 중단하고, 이해를 입증한 뒤 재개하도록 하는 방식이다.
논문은 기존 연구가 최소 이해도 기준과 보조 도구 없는 점검을 제안해 왔지만, 책임자가 개발 내용을 이해한다는 증거를 개발이나 사용 지속의 사전 조건으로 요구하는 프런티어 AI 보증 체계는 아직 발표된 바 없다고 설명한다. 제안된 심사에서는 책임자가 연구개발 기여 내용을 감사인에게 설명해 이해도를 입증한다. 독립적으로 심사를 운영하고 등급이 매겨진 보고서를 제공하며, 반복적으로 실패할 경우 제재를 강화하는 구상이다.
저자들은 주요 오픈소스 AI 프로젝트를 분석해 코드 산출량은 늘어난 반면 코드 한 줄당 사람의 검토 의견은 줄었고, 자동화된 작업 계정에서는 그 비율이 훨씬 낮았다고 보고한다. 이를 근거로 연구소 내부에 독립 감사인을 두고 심사를 시행할 것을 제안한다. 초록에는 분석의 세부 조건이나 수치가 제시되지 않아, 이 결과만으로 심사 제안의 효과가 검증됐다고 볼 수는 없다.
논문은 2026년 10월 7일 arXiv에 제출됐다. 논문 PDF, HTML 버전, arXiv 항목에서 확인할 수 있다.
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요