TL;DR
Books3에서 선정한 200권을 대상으로 오픈 웨이트 모델 14종의 책별 암기 정도를 측정한 결과, 대부분은 거의 암기되지 않지만 일부 책은 거의 전체가 암기된 것으로 나타남.- 50토큰 프롬프트와 50토큰 이어쓰기에서 다음 50토큰을 정확히 재현할 확률을 측정해 암기의 관찰 가능한 신호로 사용함.
Llama 3.1 70B는 *1984*를 사실상 처음부터 끝까지 암기했으며, *해리 포터와 마법사의 돌*은 전체 위치에서 추출 확률이 사실상 100%임.- 모델에 책의 첫 몇 단어만 제시하자 약 300쪽 분량의 *해리 포터와 마법사의 돌*을 원문과 99.2% 일치하는 수준으로 생성함.
- 책·작가·동일 작가의 책 사이에서도 암기 정도가 달라, 결과는 저작권 소송의 양측에 영향을 주며 집단 소송의 적합성에도 의문을 제기함.
책과 모델에 따라 달라지는 암기 정도
- 저작권 침해 소송에서는 대형 언어 모델(LLM)이 학습 데이터의 문장, 특히 저작권 도서의 문장을 그대로 또는 거의 그대로 출력하는지가 쟁점으로 다뤄짐. 학습 데이터를 재현하는 현상은 생성 시점에 데이터의 복사본을 출력했다는 뜻일 뿐 아니라, 그 데이터가 모델 안에 어떤 형태로 인코딩돼 있다는 신호이며 AI 연구에서는 이를 암기(memorization)라고 부름.
- 기존 기술 연구는 전체 학습 데이터에서 무작위 표본을 뽑아 평균 암기율을 측정하는 경우가 많지만, 저작권 쟁점은 개별 저작물에 관한 것임. 따라서 핵심 질문은 특정 LLM이 특정 책의 어느 정도를 암기했는지임.
Books3말뭉치에서 책 200권을 선정하고 여러 오픈 웨이트 비챗봇 모델의 암기 정도를 측정함. 측정 결과는 책과 모델에 따라 크게 달라짐.- 측정 절차는 결과에 직접 영향을 줌. 더 긴 프롬프트를 쓰거나 거의 일치하는 문장도 계산하면 더 많은 암기가 드러날 수 있음.
- 모델에 책의 앞선 50토큰을 프롬프트로 입력하고 다음 50토큰을 정확히 재현할 확률을 측정함. 50토큰을 우연히 정확히 이어 쓸 가능성은 매우 낮으므로, 정확한 재현을 모델 암기의 증거로 사용함.
- 학습에 포함되지 않은 책을 대상으로 대조 실험도 진행해 암기가 불가능한 조건을 확인함. 이를 바탕으로 그림의 색상 범위에서 추출이라고 안전하게 판단할 수 있는 최소 확률을 0.1%로 설정함.
- 그림 1은
Llama 3.1 70B가 *1984*의 각 50토큰 구간을 재현할 확률을 보여줌. 점의 가로 위치는 책에서의 위치, 높이와 색의 농도는 추출 확률을 나타내며, 어두울수록 확률이 높고 흰색은 재현 확률 0%임. 25% 지점은 해당 구간 앞의 50토큰을 입력했을 때 다음 50토큰을 네 번 중 한 번 그대로 출력한다는 의미임. - *1984*의 거의 모든 구간에서 추출 확률이 높아,
Llama 3.1 70B가 책을 사실상 전부 암기한 것으로 나타남. 추출되지 않는 흰색 부분은 편집자 서문과 부록임. - 그림 2의 히트맵은 겹치는 50토큰 구간들의 추출 확률 가운데 각 문자 위치를 포함하는 구간의 최대값, 즉 최악의 경우를 표시함. 이 방식으로 같은 모델에서 책끼리, 또는 같은 책에서 모델끼리 암기 정도를 비교할 수 있음.
- 대부분의 책·모델 조합에서는 암기 정도가 훨씬 낮고 히트맵이 거의 또는 완전히 흰색임. 그러나
Llama 3.1 70B가 *1984* 외에도 여러 책을 전부 암기한 것으로 나타났으며, 실험에서 가장 높은 암기 정도를 보인 책은 *해리 포터와 마법사의 돌*로 모든 위치의 추출 확률이 사실상 100%임.
암기된 책 전체 생성
- *해리 포터와 마법사의 돌*을 실제로 책 전체에 걸쳐 생성할 수 있는지 시험함.
Llama 3.1 70B에 첫 몇 단어인 “Mr. and Mrs. D…”를 입력한 뒤 이어 쓰게 함. - 모델은 약 300쪽 분량의 책 전체를 거의 동일하게 생성함. 원문과 생성 결과의 정량적 일치율은 99.2%임.
- 비교 결과에서 차이는 구두점, 대문자 표기, 영국식 표현 “Mum”을 미국식 “Mom”으로 바꾼 것처럼 사소한 수준임.
저작권 관련 시사점
- 결과는 진행 중인 저작권 소송에 중요한 영향을 미치지만, 원고와 피고 어느 한쪽에 명확히 유리한 결론만을 제시하지는 않음.
- 책을 암기한 모델 자체가 해당 책의 복사본 또는 2차적 저작물에 해당할 가능성이 있음.
- 그 복사본이 침해물인지, 공정 이용이 적용될 수 있는지는 별개의 쟁점임. 모델에 대한 공정 이용 분석은 학습 데이터에 대한 공정 이용 분석과 다름.
- 집단 소송은 집단 구성원 전체가 공통된 법적·사실적 쟁점과 공통 피해를 공유해야 하지만, 암기 정도는 책과 작가에 따라 다르고 같은 작가의 책 사이에서도 달라짐. 따라서 집단 소송이 적절한 방식인지 분명하지 않음.
연구 인용
- 논문 제목: “Extracting memorized pieces of (copyrighted) books from open-weight language models”
- 저자: A. Feder Cooper, Mark Lemley, Allison Casasola, Ahmed M Ahmed, Aaron Gokaslan, Amy B. Cyphert, Christopher De Sa, Daniel E. Ho, Percy Liang
- 학회: Third Conference on Language Modeling, 2026년
- 논문 링크: https://openreview.net/forum?id=VE3f9mjaCd
200권 탐색
- 책 제목이나 작가를 검색하고 저작권 상태 또는 선정 방식으로 필터링할 수 있으며, 측정 절차에서 암기된 것으로 탐지된 책의 비율에 따라 정렬할 수 있음.
- 책을 열면 모델별 위치 기반 추출 히트맵, 추출 범위, 추출 확률 분포를 확인할 수 있음.
- 저작권 상태 필터: 퍼블릭 도메인, CC BY-SA.
- 선정 방식 필터: 수동, 무작위.
- 최대 추출 범위 필터와 정렬 기준: 제목 가나다순, 암기 정도 높은 순, 암기 정도 낮은 순, 작가 가나다순, 연도순임.
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요