
注記: これはもう動作しません。Google チームは、私が報告した際に正当な問題ではないと伝えましたが、今では静かに修正されています。
goop は CAPTCHA によるブロックやレート制限に引っかかることなく Google 検索を実行できます。
Facebook はそのスクレイパー用に デバッガーツール を提供しています。
興味深いことに、Google はこのデバッガーからのリクエストを制限していないため(ホワイトリスト化されている?)、CAPTCHA にブロックされることなく Google 検索結果をスクレイピングするために使用できます。
Facebook が関与しているため、各リクエストには Facebook セッションの Cookie をライブラリに提供する必要があります。
pip install goop
from goop import goop
page_1 = goop.search('red shoes', '<your facebook cookie>')
page_2 = goop.search('red shoes', '<your facebook cookie>', page='1')
include_omitted_results = goop.search('red shoes', '<your facebook cookie>', page='8', full=True)
以下の構造を持つ dict が返されます
{
"0": {
"url": "https://example.com",
"text": "Example webpage",
"summary": "This is an example webpage whose aim is to demonstrate the usage of ..."
},
"1": {
...
cli.py は、以下のコマンドでターミナルから Google 検索を実行する使用方法を示しています。
python cli.py <query> <number_of_pages>

Google 検索結果のスクレイピングは違法です。このライブラリは回避策の概念実証に過ぎません。作者はエンドユーザーの行動について一切の責任を負いません。