
Implementación de marca de agua de texto sin distorsión basada en acoplamiento óptimo para incrustar señales detectables en texto generado por LLM mientras se preserva la calidad.
El código oficial de Acoplamientos Óptimos para el Marcado de Agua de Texto Sin Distorsión
Los modelos de lenguaje de gran tamaño (LLMs) ahora son capaces de producir texto que es indistinguible del contenido generado por humanos. Esto ha impulsado el desarrollo de marcas de agua que imprimen una 'señal' en el texto generado por LLM con una perturbación mínima de la salida de un LLM. Este artículo proporciona un análisis del marcado de agua de texto en un entorno de una sola muestra. A través de la lente de las pruebas de hipótesis con información lateral, formulamos y analizamos el equilibrio fundamental entre el poder de detección de la marca de agua y la distorsión en la calidad del texto generado. Sostenemos que un componente clave en el diseño de marcas de agua es la generación de un acoplamiento entre la información lateral compartida con el detector de marcas de agua y una partición aleatoria del vocabulario del LLM. Nuestro análisis identifica la estrategia óptima de acoplamiento y aleatorización bajo la distribución en el peor caso del siguiente token del LLM que satisface una restricción de entropía mínima. Proporcionamos una expresión de forma cerrada de la tasa de detección resultante bajo el esquema propuesto y cuantificamos el costo en un sentido max-min. Finalmente, comparamos numéricamente el esquema propuesto con el óptimo teórico.