用于 uBlock Origin 的私人列表,用于屏蔽 AI 内容农场。欢迎提交 Pull Request。
你可以 点击此处 自动订阅此列表。此链接仅在您安装了 uBlock Origin 时才有效。
或者,在 uBlock Origin 中将以下 URL 作为第三方列表导入。
https://raw.githubusercontent.com/alvi-se/ai-ublock-blacklist/master/list.txt浏览网页时,我 —— 有时、大多数时候 —— 会遇到那些文本由生成式 AI 撰写的网站。这些网站不提供有用信息,内容平庸,并充斥着广告和推广链接以牟利。 因此,当我发现这类网站时,就会将其收录在此。
核心理念很简单:如果我想要 AI 回答我的问题,我会直接问 AI。如果我在网上搜索,说明我想要一个由真人撰写的答案。一个人拥有经验、观点、想法、创造力以及许多愿意与网络分享的信息。而 AI 没有。
更有甚者,AI 内容还可能很危险:内容农场中的文章在发布前没有人审核,因为它们是大规模生成的。AI 在撰写危险话题时可能会产生幻觉:它可能建议你短路电路板、在 PC 上执行危险命令(如 rm -rf /),或者混合漂白剂和氨水(请勿尝试)。AI 生成的内容不可靠,如果没有人检查发布的内容,它就需要被屏蔽。
如前所述,我在浏览时手动添加页面,因此每条记录都是手动添加的。我不考虑使用自动工具,因为算法很难判断页面是否为 AI 生成,尤其是根据我接下来写的准则。有人可能认为这个列表太短而无用。然而,由于这些网站正在做 SEO 以在搜索引擎中排名靠前,您会遇到相同的网站不止一次,尤其是在相关的搜索中。我发现这个列表从我编写它的第一天起就开始屏蔽网站,即使条目很少。
不过,我的收录确实存在一些偏差。例如,由于我是意大利公民,您会发现很多意大利网站。这也是欢迎 Pull Request 的另一个原因。
如果您不是技术用户,不知道 GitHub 的工作方式,只需通过创建 Issue 来报告您的怀疑,点击 此处。
如果您想创建 pull request,以下是向列表添加网站的方法。 首先,尝试找到 AI 垃圾内容发送者的范围。通常是一个域名,但我也发现了很多 Medium 博客或 dev.to 博客。这些平台不应被整体屏蔽,而应仅屏蔽那些发送垃圾内容的博客。
假设您要添加条目 example.com/@slopUser,只需在文件 list.txt 中添加一行如下内容:
||example.com/@slopUser^$doc
您认为整个 example.com 域名都托管 AI 垃圾内容?只添加域名:
||example.com^$doc
如果您真的讨厌 AI 且有很多时间,欢迎对您发现的网站进行一些研究。这些内容农场大多由出售 SEO 和数字营销 的个人或组织建立。 如果您找到了源头,可能还会发现他们创建的其他内容农场。如果发现了,将它们添加到文件底部。
内容农场有一些可识别的模式。以下是我了解到的模式。当然,这些并非严格规则。
不必要的引言和结论:这可能是发现内容农场的最简单方法。通常,引言也令人恼火地华丽。例如,您点击某个关于如何使用 Flutter 特定功能的指南。 文章会像下面这样开始介绍 Flutter 本身:
在当今快节奏的数字环境中,用户期望应用程序在他们接触的每个设备上快速、美观且一致。
很可能,没有人会为了解释一个 特定的 功能而写这样的引言。 它可能适合一般性地谈论 Flutter(尽管仍然过于华丽),但不适合一个只有经验丰富的开发者才能理解的超级具体代码。如果我要写这样的文章,我假设读者已经知道 Flutter 是什么!
[主题]:一份全面指南/分步指南/终极指南:LLM 喜欢这些教程和指南标题中的流行语。
没有/很少有指向外部内容的链接
没有来源和引用:同上,但针对事实的来源。这一点非常重要,尤其是对于(伪)科学、政治以及可能传播错误信息的文章。
到处都是推广链接:内容农场只是为了赚钱。我亲眼见过一些网站厚颜无耻地将购买建议放在导航栏或页脚。
引用公司产品:网站由某个销售产品或服务的公司拥有。页面可能会像“如何解决[问题]”-> 购买我们的产品。
拥有数十万篇文章的博客:尤其是在很短的时间内发布的。许多 AI 垃圾博客每天发布数十或数百篇文章,大多由同一位作者编写。
幻觉:内容明显错误。
2022 年 11 月之后的日期:AI 热潮始于 2022 年 11 月 ChatGPT 的发布。这当然是一个薄弱的指南,但与其他准则综合起来看很有用。不过日期很容易伪造。
没有/很少有图像、视频、非文本媒体:这些页面是自动生成并发布的,很难生成其他类型的内容放入页面。
AI 生成的图像、标志:通常是文章横幅或博客标志。
文本格式不佳
未渲染的 Markdown 字符:文本没有格式,包含 Markdown 语法。
长文章,包含不必要或脱离上下文的内容:文章有时会开始谈论另一个话题,可能与原话题相关但无关。
始终位于搜索引擎结果顶部:它们当然在滥用 SEO。
无所不知的博客:同一个博客在搜索引擎中出现在完全不同的主题中。
模糊的内容:很多标题,每个标题下有简短的内容,不提供有用信息。
不专业或缺失的联系信息:他们购买了域名,为何使用 Gmail 作为联系方式?
模糊或缺失的“关于”页面
AI 热衷者内容:如果有人喜欢 ChatGPT,他们会用它来做 所有事情。因此,如果您偶然发现一个专注于 AI 的博客,它肯定 100% 是 AI 生成的。
由于 AI 用户足够愚蠢,会直接复制粘贴 LLM 的回复而不阅读,LLM 有时会暴露自己,例如在内容引言中。
以下是一些用于查找 100% AI 生成页面的 Google Dork。这些页面会将整个域名放入 uBlock 列表中。
可以通过询问 LLM 生成天真的内容来轻松生成 Dork,例如提示 Generate an article for my blog about dogs。
LLM 会回答一个像 Sure! Here's an article about 这样的引言。用引号括起来搜索这个短语。
# 英语
"Sure! Here's an article about"
# 意大利语
"Certo! Ecco un articolo"
当 SEO 营销人员宣传自己时,有时他们会发布 Google 电子表格,列出他们控制的网站。这主要是为了出售反向链接:当您的网站被许多其他网站链接时,搜索引擎倾向于认为它更可信,从而提高其排名。或者至少,这是出售反向链接的人所说的。我不是 SEO 专家,所以实际上不知道这是否有效。然而,我注意到的是,这些电子表格中列出的网站 大多是 AI 垃圾内容。这可能是向列表添加大量网站的有效方法。然而,这增加了误报的可能性:无法保证这些网站确实是 AI 垃圾内容。Issue 31 展示了一个明显的例子,其中流行的网站被意外添加到了列表中。
我建议的做法是下载电子表格并进行分析,找出潜在的误报并将其从列表中移除。以下是一些分析电子表格的方法: