
Google Search Scraper
Примечание: Больше не работает. Команда Google сказала мне, что это не является легитимной проблемой, когда я сообщил им об этом, но теперь они просто молча это исправили.
goop может выполнять поиск в Google, не блокируясь CAPTCHA и не достигая ограничений частоты запросов.
Facebook предоставляет инструмент отладки для своего скрапера. Интересно, что Google не ограничивает запросы, сделанные этим отладчиком (в белом списке?), и поэтому его можно использовать для скрапинга результатов поиска Google без блокировки CAPTCHA.
Поскольку задействован Facebook, с каждым запросом в библиотеку необходимо передавать сессионный Cookie Facebook.
pip install goop
from goop import goop
page_1 = goop.search('red shoes', '<your facebook cookie>')
page_2 = goop.search('red shoes', '<your facebook cookie>', page='1')
include_omitted_results = goop.search('red shoes', '<your facebook cookie>', page='8', full=True)
Возвращается dict следующей структуры
{
"0": {
"url": "https://example.com",
"text": "Example webpage",
"summary": "This is an example webpage whose aim is to demonstrate the usage of ..."
},
"1": {
...
cli.py демонстрирует использование, выполняя поиск в Google из терминала следующей командой
python cli.py <query> <number_of_pages>

Скрапинг результатов поиска Google незаконен. Эта библиотека является всего лишь доказательством концепции обхода. Автор не несет ответственности за действия конечных пользователей.