OpenAI는 EU AI법을 준수하기 위해 유럽연합(EU)에서 ChatGPT와 Codex가 생성한 텍스트에 보이지 않는 워터마크를 넣기 시작한다고 월요일 블로그 게시물에서 밝혔다.

EU AI법의 투명성 규정은 8월 2일 발효됐다. 이 규정은 AI 기업이 다른 시스템으로 식별할 수 있는 방식으로 AI 생성 콘텐츠를 표시하도록 요구한다.

워터마크는 앞으로 몇 주 동안 EU의 ChatGPT 및 Codex 사용자 가운데 적용 대상에게 모든 요금제에서 제공된다. 반면 전 세계에서 OpenAI API를 사용하는 개발자는 오늘부터 일부 모델에서 이 기능을 켤 수 있으며, 기본 설정은 꺼짐이다. OpenAI는 출시 시점에 텍스트 워터마크를 전 세계 기본 설정으로 적용하지는 않는다고 밝혔다.

워터마크는 별도의 기호가 아니다. 모델이 단어를 고르는 방식을 미묘하게 조정해 독자는 알아차리지 못하지만 탐지기는 식별할 수 있는 패턴을 만든다. 텍스트 자체에 패턴이 들어가므로 복사해 붙여넣어도 유지된다. OpenAI는 워터마크로 사용자를 식별할 수 없으며, 워터마크를 켜도 모델 성능에 의미 있는 변화가 없었다고 밝혔다.

OpenAI는 발표와 함께 textGrain이라는 방식의 기술 보고서도 공개했다. 펜실베이니아대학교와 예일대학교 연구자들이 공동 작성한 보고서는 비밀 키를 사용해 다음 단어 예측을 정렬하고 문장을 완성하는 사례를 설명한다. 이런 조정을 수백 번 거듭하면 탐지기는 텍스트와 키만으로 AI 생성 콘텐츠를 찾아낼 수 있다.

편집으로 워터마크를 지울 수 있을까? OpenAI의 시험 결과에 따르면 가능하다. 한 시험에서는 단어의 10%를 동의어로 바꾸자 탐지율이 약 92%에서 66%로 떨어졌다. 짧은 글, 수학 답변, 번역된 텍스트도 탐지하기 어렵다고 OpenAI는 밝혔다.

OpenAI는 이런 한계 때문에 초기 탐지기 접근 권한을 승인된 연구자와 전문 기관에만 제공한다고 설명했다. 이들이 신뢰성과 책임 있는 활용 방식을 평가하는 데 도움을 줄 수 있다는 이유다.

OpenAI는 워터마크가 없다고 해서 “사람이 작성했다는 증거가 되지는 않는다”고도 경고했다. 텍스트가 너무 짧거나 많이 편집됐을 수 있고, 다른 회사의 AI가 생성했을 수도 있다.

OpenAI는 “워터마크는 OpenAI 시스템이 글의 일부를 생성하거나 처리했음을 나타낼 수 있지만, 사람이 얼마나 판단하고 편집하거나 창의성을 발휘했는지는 보여주지 않는다”고 밝혔다.

이번 발표는 Anthropic이 두 달 전 Claude 생성 텍스트에 워터마크를 적용하고 전 세계에 도입하겠다고 밝힌 뒤 나왔다. 이 결정은 Claude 이용자 일부의 반발을 불렀다. 이들은 자신들이 “지시와 맥락, 결정을 제공했다”며 Claude는 “도구”일 뿐이라고 주장했다. 관련 보도는 Anthropic의 워터마크 도입 발표와 일부 Claude 이용자의 반발에서 확인할 수 있다.

OpenAI는 이전에도 텍스트 워터마크를 개발했지만 출시를 보류했다. 2024년 월스트리트저널 보도에 따르면, 워터마크를 적용하지 않는 경쟁사로 사용자가 옮겨갈 수 있다는 우려 등이 이유였다.

Anthropic, Google, Meta, Microsoft, OpenAI는 AI 생성 콘텐츠 투명성에 관한 EU 실천 강령을 따르기로 약속한 기업에 포함된다.