
Sites Web que j'ai personnellement trouvés et qui sont entièrement générés par l'IA. Les pull requests sont les bienvenues.
Une liste personnelle pour uBlock Origin bloquant les fermes de contenu AI. Les pull requests sont les bienvenues.
Vous pouvez cliquez ici pour vous abonner automatiquement à cette liste. Ce lien fonctionne uniquement si uBlock Origin est installé.
Alternativement, importez l'URL suivante comme liste tierce dans uBlock Origin.
https://raw.githubusercontent.com/alvi-se/ai-ublock-blacklist/master/list.txtEn naviguant, il arrive parfois la plupart du temps que je tombe sur des sites web dont le texte est écrit par l'IA générative. Ces sites ne fournissent aucune information utile, ont un contenu médiocre et sont remplis de publicités et de liens de parrainage pour gagner de l'argent.
Donc quand je trouve ce genre de site, je le mets ici.
L'idée clé est simple : si je voulais que ma question soit répondue par l'IA, moi je demanderais à l'IA. Si je cherche en ligne, cela signifie que je veux une réponse écrite par une personne. Une personne a de l'expérience, des opinions, des idées, de la créativité et beaucoup plus d'informations qu'elle pourrait vouloir partager sur le web. Pas l'IA.
De plus, le contenu AI peut aussi être dangereux : les articles dans les fermes de contenu ne sont vérifiés par personne avant d'être publiés, car ils sont générés massivement. Une IA peut halluciner en écrivant sur des sujets dangereux : elle pourrait vous suggérer de court-circuiter votre carte de circuit imprimé. Ou d'exécuter des commandes dangereuses sur votre PC comme rm -rf /. Ou de mélanger de l'eau de Javel et de l'ammoniac (NE FAITES PAS CES CHOSES). Le contenu généré par l'IA n'est pas fiable, et si personne ne vérifie ce qui est publié, il doit être bloqué.
Comme je l'ai dit, j'ajoute les pages au fur et à mesure que je navigue, donc chaque entrée est ajoutée manuellement. Je n'envisage pas d'utiliser des outils automatisés simplement parce qu'il est difficile pour un algorithme de comprendre si une page est générée par l'IA ou non, surtout avec les directives que j'ai écrites ci-dessous. On pourrait argumenter que cette liste est inutile car trop courte. Cependant, comme ces sites font du SEO pour apparaître en premier dans les moteurs de recherche, vous rencontrerez le même site plus d'une fois, surtout pour des recherches liées entre elles. J'ai constaté que cette liste bloque des sites dès le premier jour où j'ai commencé à l'écrire, même avec très peu d'entrées.
Cependant, il y a effectivement un certain biais dans mes entrées. Par exemple, étant citoyen italien, vous trouverez beaucoup de sites italiens. C'est une autre raison pour laquelle les pull requests sont les bienvenues.
Si vous n'êtes pas un utilisateur technique et ne savez pas comment fonctionne GitHub, signalez simplement vos suspicions en créant une issue, en cliquant ici.
Si vous voulez créer une pull request, voici comment ajouter un site à la liste. D'abord, essayez de trouver le périmètre du spammeur AI. Habituellement, ce sera un domaine, mais j'ai aussi trouvé beaucoup de blogs Medium ou dev.to. Ces plateformes ne doivent pas être bloquées entièrement, mais seulement le blog qui spamme.
Disons que vous voulez ajouter l'entrée example.com/@slopUser, mettez simplement une ligne dans le fichier list.txt comme suit :
||example.com/@slopUser^$doc
Le domaine entier example.com héberge des déchets AI, dites-vous ? Ajoutez seulement le domaine :
||example.com^$doc
Si vous détestez vraiment l'IA et avez beaucoup de temps à consacrer, vous êtes invité à faire des recherches sur le site que vous avez trouvé. La plupart de ces fermes de contenu sont construites par des personnes ou des organisations qui vendent du SEO et du marketing digital. Si vous trouvez la source, vous pourriez aussi trouver d'autres fermes de contenu qu'ils ont créées. Si c'est le cas, ajoutez-les en bas du fichier.
Les fermes de contenu ont certains schémas qui les rendent reconnaissables. Voici ceux que j'ai compris. Bien sûr, ce ne sont pas des règles strictes.
Introduction et conclusion inutiles : c'est probablement le moyen le plus facile de repérer les fermes de contenu. Souvent, l'introduction est aussi désagréablement baroque. Par exemple, vous cliquez sur un guide sur la façon d'utiliser une fonctionnalité spécifique dans Flutter. L'article commencerait par une introduction sur Flutter lui-même comme ceci :
Dans le paysage numérique en évolution rapide d'aujourd'hui, les utilisateurs s'attendent à ce que les applications soient rapides, belles et cohérentes sur tous les appareils qu'ils touchent.
Probablement, aucun humain n'écrirait une telle introduction pour expliquer une fonctionnalité spécifique. Cela pourrait convenir pour parler généralement de Flutter (encore trop baroque cependant), mais pas pour un code très spécifique qui ne peut être compris que par des développeurs expérimentés. Si j'écris un tel article, je suppose que le lecteur sait déjà ce qu'est Flutter !
[sujet] : Un guide complet/Un guide étape par étape/Guide ultime : les LLM adorent ces accroches pour les titres de tutoriels et guides.
Peu ou pas de liens vers du contenu externe
Absence de sources et références : pareil que ci-dessus, mais pour les sources sur les faits. C'est très important à vérifier, surtout pour les articles sur la (pseudo)science, la politique et le contenu qui pourrait propager de la désinformation.
Liens de parrainage partout : les fermes de contenu sont là juste pour gagner de l'argent. J'ai personnellement vu des sites mettre sans vergogne des conseils d'achat dans les barres de navigation ou les pieds de page.
Référence au produit d'une entreprise : le site appartient à une entreprise qui vend un produit ou service. La page sera probablement du genre « Comment résoudre [problème] » -> achetez notre produit.
Blog avec des centaines de milliers d'articles : surtout lorsqu'ils sont publiés sur une très courte période. Beaucoup de blogs de contenu AI de piètre qualité publient des dizaines ou centaines d'articles par jour, principalement par le même auteur.
Hallucinations : le contenu est tout simplement faux.
Date postérieure à novembre 2022 : le battage médiatique autour de l'IA a commencé avec la sortie de ChatGPT en novembre 2022. Une directive faible bien sûr, mais elle s'ajoute à toutes les autres. Les dates peuvent cependant être facilement falsifiées.
Peu ou pas d'images, vidéos, médias non textuels : ces pages sont générées et publiées automatiquement, et il est difficile de générer d'autres types de contenu à mettre dans la page.
Parce que les utilisateurs d'IA sont assez stupides pour copier-coller les réponses des LLM sans les lire, le LLM se révélera parfois, par exemple dans l'introduction du contenu.
Voici quelques Google Dorks pour trouver des pages générées à 100% par l'IA. Ces pages auront leur domaine entier mis dans la liste uBlock.
Les Dorks peuvent être facilement générés en demandant à un LLM de générer du contenu naïf, par exemple en lui demandant Generate an article for my blog about dogs.
Le LLM répondra avec une introduction comme Sure! Here's an article about. Prenez cette phrase et cherchez-la entre guillemets.
# Anglais
"Sure! Here's an article about"
# Italien
"Certo! Ecco un articolo"
Quand les spécialistes du SEO font leur publicité, ils publient parfois des Google Spreadsheets dans lesquelles ils listent les sites web qu'ils contrôlent. C'est principalement pour vendre des backlinks : quand votre site est lié par beaucoup d'autres, les moteurs de recherche ont tendance à le considérer comme plus fiable et augmentent ainsi son classement. Ou du moins, c'est ce que disent les personnes qui vendent des backlinks. Je ne suis pas expert SEO, donc je ne sais pas vraiment si cela fonctionne. Ce que j'ai remarqué cependant, c'est que les sites listés dans ces feuilles de calcul sont principalement du contenu AI de piètre qualité. Cela peut être un moyen efficace d'ajouter massivement des sites à la liste. Cependant, cela augmente les risques de faux positifs : rien ne garantit que les sites sont réellement du contenu AI de mauvaise qualité. L'issue 31 montre un exemple clair où des sites populaires ont été accidentellement ajoutés à la liste.
Ce que je suggère est de télécharger la feuille de calcul et de l'analyser, pour trouver les faux positifs potentiels et les supprimer de la liste. Voici quelques façons d'analyser la feuille de calcul :
Images, logos générés par l'IA : généralement la bannière de l'article ou le logo du blog.
Mauvais formatage du texte
Caractères Markdown non rendus : le texte n'a pas de formatage et contient de la syntaxe Markdown.
Long article, avec du contenu inutile ou hors contexte : à un moment donné, l'article peut commencer à parler d'un autre sujet, qui peut être lié à l'original mais non pertinent.
Toujours en haut des résultats des moteurs de recherche : ils abusent bien sûr du SEO.
Blog qui sait tout : le même blog apparaît dans le moteur de recherche pour des sujets complètement différents.
Contenu vague : beaucoup de titres, chacun avec un court contenu qui ne fournit aucune information utile.
Informations de contact non professionnelles ou manquantes : ils ont acheté un domaine, pourquoi utilisent-ils Gmail pour le contact ?
Page à propos vague ou absente
Contenu enthousiaste pour l'IA : si quelqu'un aime ChatGPT, il l'utilisera pour tout. Donc si vous tombez sur un blog dédié à l'IA, il est à 100% généré par l'IA.