
Websites, die meiner persönlichen Meinung nach vollständig von KI generiert wurden. Pull requests willkommen.
Eine persönliche Liste für uBlock Origin zum Blockieren von KI-Inhaltsfarmen. Pull Requests willkommen.
Sie können hier klicken, um diese Liste automatisch zu abonnieren. Dieser Link funktioniert nur, wenn Sie uBlock Origin installiert haben.
Alternativ importieren Sie die folgende URL als Drittanbieterliste in uBlock Origin.
https://raw.githubusercontent.com/alvi-se/ai-ublock-blacklist/master/list.txtBeim Surfen stoße ich manchmal die meiste Zeit auf Websites, deren Text von generativer KI geschrieben wurde. Diese Websites bieten keine nützlichen Informationen, haben mittelmäßige Inhalte und sind voll mit Werbung und Affiliate-Links, um Geld zu verdienen. Wenn ich also diese Art von Website finde, packe ich sie hier rein.
Die Kernidee ist einfach: Wenn ich meine Frage von einer KI beantwortet haben möchte, würde ich die KI fragen. Wenn ich online suche, möchte ich eine Antwort, die von einer Person geschrieben wurde. Eine Person hat Erfahrungen, Meinungen, Ideen, Kreativität und viele weitere Informationen, die sie mit dem Web teilen möchte. KI nicht.
Hinzu kommt, dass KI-Inhalte auch gefährlich sein können: Artikel in Content-Farmen werden vor der Veröffentlichung von niemandem überprüft, da sie massenhaft generiert werden. Eine KI könnte halluzinieren, wenn sie über gefährliche Themen schreibt: Sie könnte Ihnen vorschlagen, einen Kurzschluss auf Ihrer Platine zu verursachen. Oder gefährliche Befehle auf Ihrem PC auszuführen wie rm -rf /. Oder Bleichmittel und Ammoniak zu mischen (TUN SIE DIESE DINGE NICHT). KI-generierte Inhalte sind nicht zuverlässig, und wenn niemand überprüft, was veröffentlicht wird, müssen sie blockiert werden.
Wie gesagt, ich füge Seiten hinzu, während ich surfe, daher wird jeder Eintrag manuell hinzugefügt. Ich erwäge nicht, automatisierte Tools zu verwenden, einfach weil es für einen Algorithmus schwierig ist zu erkennen, ob eine Seite KI-generiert ist oder nicht, besonders mit den Richtlinien, die ich als nächstes geschrieben habe. Man könnte argumentieren, dass diese Liste nutzlos ist, weil sie zu kurz ist. Da diese Websites jedoch SEO betreiben, um in Suchmaschinen an erster Stelle zu erscheinen, werden Sie dieselbe Website mehr als einmal treffen, insbesondere bei zusammenhängenden Suchanfragen. Ich habe festgestellt, dass diese Liste bereits am ersten Tag, an dem ich sie zu schreiben begann, Websites blockierte, selbst mit sehr wenigen Einträgen.
Es gibt jedoch eine gewisse Voreingenommenheit bei meinen Einträgen. Da ich zum Beispiel italienischer Staatsbürger bin, finden Sie viele italienische Websites. Dies ist ein weiterer Grund, warum Pull Requests willkommen sind.
Wenn Sie kein technischer Benutzer sind und nicht wissen, wie GitHub funktioniert, melden Sie Ihre Verdachtsfälle einfach, indem Sie ein Issue erstellen. Klicken Sie dazu hier.
Wenn Sie einen Pull Request erstellen möchten, zeigen ich Ihnen, wie Sie eine Website zur Liste hinzufügen. Versuchen Sie zunächst, den Umfang des KI-Spammers zu finden. Normalerweise handelt es sich um eine Domain, aber ich habe auch viele Medium-Blogs oder dev.to-Blogs gefunden. Diese Plattformen sollten nicht als Ganzes blockiert werden, sondern nur der Blog, der spammt.
Angenommen, Sie möchten den Eintrag example.com/@slopUser hinzufügen, fügen Sie einfach eine Zeile in die Datei list.txt wie folgt ein:
||example.com/@slopUser^$doc
Die gesamte Domain example.com hostet KI-Müll? Dann fügen Sie nur die Domain hinzu:
||example.com^$doc
Wenn Sie KI wirklich hassen und viel Zeit haben, können Sie gerne Nachforschungen über die von Ihnen gefundene Website anstellen. Die meisten dieser Content-Farmen werden von Personen oder Organisationen erstellt, die SEO und digitales Marketing verkaufen. Wenn Sie die Quelle finden, könnten Sie auch andere Content-Farmen finden, die sie erstellt haben. Wenn Sie dies tun, fügen Sie sie am Ende der Datei hinzu.
Content-Farmen haben bestimmte Muster, die sie erkennbar machen. Hier sind die, die ich verstanden habe. Natürlich sind dies keine strengen Regeln.
Unnötige Einleitung und Schluss: Dies ist wahrscheinlich der einfachste Weg, Content-Farmen zu erkennen. Oft ist die Einleitung auch ärgerlich barock. Sie klicken zum Beispiel auf einen Leitfaden zur Verwendung einer bestimmten Funktion in Flutter. Der Artikel würde mit einer Einleitung über Flutter selbst beginnen wie folgt:
In der heutigen schnelllebigen digitalen Landschaft erwarten Benutzer, dass Apps schnell, schön und auf jedem von ihnen berührten Gerät konsistent sind.
Wahrscheinlich würde kein Mensch eine solche Einleitung schreiben, um eine spezifische Funktion zu erklären. Es könnte passen, um allgemein über Flutter zu sprechen (immer noch zu barock), aber nicht für einen superspezifischen Code, der nur von erfahrenen Entwicklern verstanden werden kann. Wenn ich einen solchen Artikel schreibe, gehe ich davon aus, dass der Leser bereits weiß, was Flutter ist!
[Thema]: Ein umfassender Leitfaden/Eine Schritt-für-Schritt-Anleitung/Der ultimative Leitfaden: LLMs lieben diese Schlagwörter für Titel von Tutorials und Leitfäden.
Keine/wenige Links zu externen Inhalten
Keine Quellen und Referenzen: Gleiches wie oben, aber für Quellen zu Fakten. Dies ist sehr wichtig zu überprüfen, insbesondere bei Artikeln über (Pseudo-)Wissenschaft, Politik und Inhalten, die Fehlinformationen verbreiten könnten.
Affiliate-Links überall: Content-Farmen dienen nur dem Geldverdienen. Ich habe persönlich Seiten gesehen, die schamlos Kaufberatung in Navigationsleisten oder Fußzeilen platzierten.
Verweis auf Produkt eines Unternehmens: Die Website gehört einem Unternehmen, das ein Produkt oder eine Dienstleistung verkauft. Die Seite wird wahrscheinlich so aussehen: „Wie löse ich [Problem]“ -> kaufen Sie unser Produkt.
Blog mit Hunderttausenden von Artikeln: Besonders wenn sie in sehr kurzer Zeit veröffentlicht wurden. Viele KI-Schrott-Blogs veröffentlichen täglich Dutzende oder Hunderte von Artikeln, meist vom selben Autor.
Halluzinationen: Der Inhalt ist schlichtweg falsch.
Datum nach November 2022: Der KI-Hype begann mit der Veröffentlichung von ChatGPT im November 2022. Eine schwache Richtlinie, aber sie ergänzt alle anderen. Daten können jedoch leicht gefälscht werden.
Keine/wenige Bilder, Videos, Nicht-Text-Medien: Diese Seiten werden automatisch generiert und veröffentlicht, und es ist schwierig, andere Arten von Inhalten zu generieren, die auf der Seite platziert werden können.
Da KI-Benutzer dumm genug sind, LLM-Antworten zu kopieren und einzufügen, ohne sie zu lesen, wird sich das LLM manchmal selbst verraten, zum Beispiel in der Einleitung des Inhalts.
Die folgenden sind einige Google Dorks, um 100 % KI-generierte Seiten zu finden. Solche Seiten werden mit ihrer gesamten Domain in die uBlock-Liste aufgenommen.
Dorks können leicht generiert werden, indem man ein LLM auffordert, naiven Inhalt zu generieren, zum Beispiel durch die Eingabeaufforderung Generate an article for my blog about dogs.
Das LLM wird mit einer Einleitung wie Sure! Here's an article about antworten. Nehmen Sie diesen Satz und suchen Sie ihn in Anführungszeichen.
# Englisch
"Sure! Here's an article about"
# Italienisch
"Certo! Ecco un articolo"
Wenn SEO-Vermarkter für sich werben, veröffentlichen sie manchmal Google-Tabellen, in denen sie die Websites auflisten, die sie kontrollieren. Dies dient hauptsächlich dazu, Backlinks zu verkaufen: Wenn Ihre Website von vielen anderen verlinkt wird, neigen Suchmaschinen dazu, sie als vertrauenswürdiger einzustufen und erhöhen so ihr Ranking. Oder zumindest sagen das die Leute, die Backlinks verkaufen. Ich bin kein SEO-Experte, daher weiß ich nicht, ob dies tatsächlich funktioniert. Was mir jedoch aufgefallen ist, ist, dass die in diesen Tabellen aufgeführten Websites meistens KI-Schrott sind. Dies kann eine effektive Methode sein, um massenhaft Websites zur Liste hinzuzufügen. Allerdings erhöht dies die Wahrscheinlichkeit von Fehlalarmen: Es gibt keine Garantie, dass es sich bei den Websites tatsächlich um KI-Schrott handelt. Issue 31 zeigt ein klares Beispiel, in dem beliebte Websites versehentlich zur Liste hinzugefügt wurden.
Was ich vorschlage, ist, die Tabelle herunterzuladen und zu analysieren, um potenzielle Fehlalarme zu finden und aus der Liste zu entfernen. Hier sind einige Möglichkeiten, die Tabelle zu analysieren:
KI-generierte Bilder, Logos: Meistens das Banner des Artikels oder das Blog-Logo.
Schlechte Textformatierung
Nicht gerenderte Markdown-Zeichen: Der Text hat keine Formatierung und enthält Markdown-Syntax.
Langer Beitrag mit unnötigen oder aus dem Zusammenhang gerissenen Inhalten: An einem bestimmten Punkt kann der Artikel über ein anderes Thema sprechen, das mit dem ursprünglichen verwandt, aber irrelevant ist.
Immer ganz oben in den Suchergebnissen: Sie missbrauchen natürlich SEO.
Alleswisser-Blog: Derselbe Blog erscheint in der Suchmaschine für völlig unterschiedliche Themen.
Vage Inhalte: Viele Überschriften, jede mit einem kurzen Inhalt, der keine nützlichen Informationen liefert.
Unprofessionelle oder fehlende Kontaktinformationen: Sie haben eine Domain gekauft, warum verwenden sie Gmail für Kontakt?
Vage oder fehlende „Über uns“-Seite
KI-begeisterte Inhalte: Wenn jemand ChatGPT liebt, wird er es für alles verwenden. Wenn Sie also auf einen KI-gewidmeten Blog stoßen, ist dieser zu 100 % KI-generiert.