
注意: 该工具已不再可用。我曾向谷歌团队报告过此问题,他们告知我这不是一个合理的问题,但现在他们只是默默修复了它。
goop 可以执行 Google 搜索而不会被 CAPTCHA 拦截或遭受任何速率限制。
Facebook 为其抓取器提供了一个调试器工具。
有趣的是,Google 并不会限制该调试器发出的请求(白名单?),因此它可以用来抓取 Google 搜索结果而无需绕过 CAPTCHA。
由于涉及 Facebook,每次请求时必须向库提供 Facebook 会话 Cookie。
pip install goop
from goop import goop
page_1 = goop.search('red shoes', '<你的 facebook cookie>')
page_2 = goop.search('red shoes', '<你的 facebook cookie>', page='1')
include_omitited_results = goop.search('red shoes', '<你的 facebook cookie>', page='8', full=True)
返回一个如下结构的 dict
{
"0": {
"url": "https://example.com",
"text": "Example webpage",
"summary": "This is an example webpage whose aim is to demonstrate the usage of ..."
},
"1": {
...
cli.py 演示了如何通过终端使用以下命令执行 Google 搜索
python cli.py <query> <number_of_pages>

抓取 Google 搜索结果是非法的。本库仅作为绕过方法的概念验证。作者不对最终用户的任何行为负责。