
Implementação de marcação d'água de texto sem distorção baseada em acoplamento ótimo para incorporar sinais detectáveis em texto gerado por LLM, preservando a qualidade.
O código oficial de Acoplamentos Ótimos para Marca d'Água de Texto Sem Distorção
Modelos de linguagem de grande escala (LLMs) agora são capazes de produzir texto indistinguível do conteúdo gerado por humanos. Isso impulsionou o desenvolvimento de marcas d'água que imprimem um 'sinal' em texto gerado por LLM com perturbação mínima da saída de um LLM. Este artigo fornece uma análise da marca d'água de texto em um cenário de uma única tentativa. Através da lente do teste de hipóteses com informação lateral, formulamos e analisamos o trade-off fundamental entre o poder de detecção de marca d'água e a distorção na qualidade textual gerada. Argumentamos que um componente-chave no design de marcas d'água é gerar um acoplamento entre a informação lateral compartilhada com o detector de marca d'água e uma partição aleatória do vocabulário do LLM. Nossa análise identifica a estratégia ótima de acoplamento e randomização sob a distribuição de próximo token do LLM no pior caso que satisfaz uma restrição de entropia mínima. Fornecemos uma expressão de forma fechada da taxa de detecção resultante sob o esquema proposto e quantificamos o custo em um sentido max-min. Por fim, comparamos numericamente o esquema proposto com o ótimo teórico.