
Реализация искажающего свободного текстового водяного знака на основе оптимальной связи для встраивания обнаруживаемых сигналов в текст, сгенерированный LLM, с сохранением качества.
Официальный код Optimal Couplings for Distortion-Free Text Watermarking
Большие языковые модели (LLM) теперь способны создавать текст, неотличимый от контента, созданного человеком. Это стимулировало разработку вотермарков, которые впечатывают «сигнал» в текст, сгенерированный LLM, с минимальным возмущением вывода модели. В этой статье представлен анализ текстового вотермаркирования в одношаговой постановке (one-shot). С точки зрения проверки гипотез с побочной информацией мы формулируем и анализируем фундаментальный компромисс между мощностью обнаружения вотермарка и искажением качества генерируемого текста. Мы утверждаем, что ключевым компонентом в разработке вотермарков является порождение связки между побочной информацией, доступной детектору вотермарка, и случайным разбиением словаря LLM. Наш анализ определяет оптимальную связку и стратегию рандомизации при наихудшем распределении следующего токена LLM, удовлетворяющем ограничению на минимальную энтропию. Мы приводим выражение в замкнутой форме для результирующей частоты обнаружения в предложенной схеме и оцениваем стоимость в смысле максимина. Наконец, мы численно сравниваем предложенную схему с теоретическим оптимумом.