TL;DR
- OpenAI는 유럽연합(EU) AI법 준수를 위해 일부 모델의 텍스트에 워터마크를 적용하지만, 짧은 문장이나 단어를 바꾼 문장에서는 탐지율이 낮아지는 방식임.
- OpenAI는 API 고객에게 일부 모델 출력에 워터마크를 적용하는 선택지를 제공하며, 몇 주 안에 EU 내 적격 ChatGPT와 Codex 텍스트 출력에 워터마크를 적용할 계획임.
- OpenAI의 textGrain은 단어 선택에 보이지 않는 통계적 신호를 넣고, 승인된 연구자와 기관에만 제공하는 탐지기가 그 신호를 찾는 방식임.
- 탐지기는 200단어 문장에서 워터마크의 80%, 400단어 문장에서 95%를 찾아내는 수준이며, 수학·코드 등 기능성 텍스트에서는 성능이 더 낮아짐.
- 400토큰 문장의 단어 중 10%를 동의어로 바꾸면 탐지율이 92%에서 66%로, 25%를 바꾸면 17%로 떨어짐.
워터마크 적용 범위와 규제 배경
- OpenAI는 유럽연합 AI법의 문언상 요구사항을 충족하기 위해 API 고객에게 일부 모델 출력에 텍스트 워터마크를 적용하는 선택지를 제공함.
- OpenAI는 몇 주 안에 EU 내 적격 ChatGPT와 Codex 텍스트 출력에 디지털 워터마크를 적용할 계획이며, 이 적용은 선택이 아닌 방식으로 이뤄짐.
- OpenAI는 Anthropic과 달리 유럽 밖에서 생성된 콘텐츠에는 워터마크를 적용하지 않음. 다만 API 고객은 어느 지역에서 만든 콘텐츠든 워터마크 적용을 선택할 수 있음.
- EU AI법은 생성형 AI 서비스 제공자가 모델 출력을 기계가 읽을 수 있는 방식으로 식별 가능하게 만들도록 요구함.
- Anthropic은 주요 AI 기업 가운데 처음으로 AI법 준수 방식을 발표했으며, Google의 SynthID-Text 알고리즘을 적용하는 방식을 전 세계적으로 사용함.
- Microsoft와 Meta는 이미지 기반 AI 콘텐츠를 위한 유사 기술을 개발 중임. 콘텐츠 출처와 AI 생성 콘텐츠를 이용한 허위 정보 제작에 대한 우려는 EU에만 국한되지 않음.
- OpenAI는 이미 AI 생성 이미지·오디오·비디오에 다른 콘텐츠 출처 신호를 적용함.
textGrain의 작동 방식
- OpenAI의 텍스트 워터마킹 방식인 textGrain은 모델의 단어 선택에 보이지 않는 통계적 신호를 추가함.
- 대형 언어 모델(LLM)은 잠재적 단어의 확률 분포를 바탕으로 토큰을 한 번에 하나씩 예측함. 모델이 주기적으로 다른 단어, 가능하면 동의어를 선택하면 편향되지 않은 모델이 만든 텍스트의 통계적 패턴에서 벗어남.
- OpenAI가 승인된 연구자와 기관에만 제공하는 탐지기는 어휘 선택의 이런 차이를 찾아 워터마크 여부를 판단함.
- [textGrain 논문 PDF]
탐지 성능과 한계
- OpenAI가 목표로 삼은 오류율은 1%지만, 실제 탐지 결과는 문장 길이에 따라 달라짐. 200단어 문장에서는 워터마크의 80%, 400단어 문장에서는 95%를 탐지할 수 있음.
- 수학이나 코드에 관한 문장처럼 기능적인 텍스트에서는 단어를 바꾸면 오류가 생길 가능성이 커져 탐지 성능이 더 낮아짐.
- textGrain 논문은 통계적 신호를 넣기 위한 단어 선택 변경이 문장의 의미를 바꿀 가능성을 다루지 않음. 알고리즘이 중요한 사실이나 수치를 바꾸면 의미가 달라질 수 있음.
- 특정 출력 단어를 다른 알고리즘으로 대체하는 Anthropic의 접근 방식에도 유사한 위험이 있음.
- OpenAI의 워터마크는 단어를 바꾸는 방식으로 쉽게 무력화됨. 400토큰 문장에서 단어의 10%를 동의어로 바꾸자 탐지율이 92%에서 66%로 낮아졌으며, 25%를 바꿨을 때는 17%의 경우에만 워터마크를 탐지함.
이제 간신히 쓸 만하지만 규정에는 맞는 AI 탐지기의 화력을 보라…
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요