你是否曾发现一个网页似乎完全符合你的需要,但它已经被删除了?没错,Google 缓存是一个答案,但如果缓存也被移除了呢?如果网站只存在于 Google 索引页面中呢?你无法找回这个网页,但你知道它曾经存在。
Google 索引检索器 将尝试从 Google 中检索出索引,以便你能找回部分文本,或许还能找回你需要的那段已删除内容。Google 缓存并非永久存在。不时地,它们就会被彻底移除。Archive.org 及其 WayBackMachine 并不会为小众页面拍摄那么多快照……因此,在某些情况下,一个网页唯一残存的部分就是 Google 索引中的内容。
Google 索引是用户在搜索结果页中看到的那一小段文本,显示在 Google 搜索引擎结果中。在“索引”中,搜索到的匹配词会以粗体显示。Google 索引是网页消失前的最后一道防线。所以总会有这样的情况:索引是唯一剩下的部分。Google 会保留同一网页的多个不同“索引”,因此,如果能把它们全部整合起来,文本就有可能被重建并显现出来。
但这并非该工具唯一有用的场景。如果索引中包含密码、信用卡号或其他敏感信息呢?事实上,这正是创建该工具的原因之一:用以证明仅仅删除带有攻击性或敏感内容的网页及其缓存是不够的。内容可能仍然可以访问。这一切都在这个 中有所解释。
非常简单。该工具的输入是一个产生索引结果的 Google 搜索。它会尝试通过暴力破解 Google 搜索(“刺激它”)来尽可能多地检索内容。然后,它提供了一些不同的选项:
激发索引并取回信息的逻辑如下:
当然,由于持续使用其服务,Google 会不时弹出验证码。这完全正常。Google 索引检索器会捕获验证码,从而方便你解决并继续操作。
该工具也可用于检查一个网站是否可能已被入侵,并被注入了垃圾信息和黑帽 SEO。常见的做法是,攻击者入侵网页,在其中注入垃圾词,从而“窃取”其页面排名。
这些内容对访问者不可见,只有 Google 机器人(爬虫)能看到,因此通常能在索引中看到。这个标签页的工作原理与其他标签页相同,但采用不同的逻辑:
这样,就更容易判断一个网页是否已被入侵并注入了 SEO 垃圾信息。
该程序使用 Java 编写,因此应在任何系统和版本上都能运行,尽管它已在 Windows 系统上测试过。结果可以导出到本地计算机的 HTML 文档。Keywords 和 spamKeywords 是完全可定制的。它们可以单独添加,也可以直接从 TXT 文件中编辑。