
LLM 생성 텍스트에 감지 가능한 신호를 삽입하면서 품질을 유지하는 최적 커플링 기반 무왜곡 텍스트 워터마킹 구현.
왜곡 없는 텍스트 워터마킹을 위한 최적 커플링 의 공식 코드
대규모 언어 모델(LLM)은 이제 인간이 생성한 콘텐츠와 구별할 수 없는 텍스트를 생성할 수 있게 되었다. 이는 LLM 출력을 최소한으로 교란하면서 LLM이 생성한 텍스트에 '신호'를 새겨 넣는 워터마크 개발을 촉진했다. 본 논문은 원샷(one-shot) 설정에서 텍스트 워터마킹에 대한 분석을 제공한다. 부가 정보를 활용한 가설 검정의 관점에서, 우리는 워터마크 탐지 성능과 생성된 텍스트 품질 왜곡 사이의 근본적인 트레이드오프를 정식화하고 분석한다. 우리는 워터마크 설계의 핵심 요소가 워터마크 탐지기와 공유되는 부가 정보와 LLM 어휘의 랜덤 분할 사이의 커플링을 생성하는 것이라고 주장한다. 우리의 분석은 최소 엔트로피(min-entropy) 제약을 만족하는 최악의 경우 LLM 다음 토큰 분포 하에서 최적의 커플링 및 무작위화 전략을 식별한다. 우리는 제안된 기법 하에서 결과적 탐지율의 폐쇄형(closed-form) 표현식을 제공하고, 맥스-민(max-min) 의미에서 비용을 정량화한다. 마지막으로, 우리는 제안된 기법을 이론적 최적값과 수치적으로 비교한다.