
Implémentation d'un tatouage de texte sans distorsion basé sur le couplage optimal afin d'intégrer des signaux détectables dans un texte généré par LLM tout en préservant la qualité.
Le code officiel de Couplages optimaux pour le tatouage de texte sans distorsion
Les grands modèles de langage (LLM) sont désormais capables de produire un texte impossible à distinguer d'un contenu généré par un humain. Cela a stimulé le développement de tatouages qui impriment un « signal » dans le texte généré par un LLM avec une perturbation minimale de la sortie d'un LLM. Cet article propose une analyse du tatouage de texte dans un cadre one-shot. À travers le prisme des tests d'hypothèses avec information auxiliaire, nous formulons et analysons le compromis fondamental entre la puissance de détection du tatouage et la distorsion de la qualité textuelle générée. Nous soutenons qu'un composant clé de la conception de tatouage consiste à générer un couplage entre l'information auxiliaire partagée avec le détecteur de tatouage et une partition aléatoire du vocabulaire du LLM. Notre analyse identifie le couplage optimal et la stratégie de randomisation sous la distribution du prochain jeton du LLM dans le pire des cas qui satisfait une contrainte d'entropie minimale. Nous fournissons une expression de forme fermée du taux de détection résultant dans le cadre du schéma proposé et quantifions le coût au sens du max-min. Enfin, nous comparons numériquement le schéma proposé avec l'optimum théorique.