
Google Search Scraper
Note : Cela ne fonctionne plus. L'équipe de Google m'a dit que ce n'était pas un problème légitime lorsque je le leur ai signalé, mais ils l'ont simplement corrigé en silence.
goop peut effectuer des recherches Google sans être bloqué par le CAPTCHA ou sans atteindre aucune limite de taux.
Facebook fournit un outil de débogage pour son scraper.
Fait intéressant, Google ne limite pas les requêtes effectuées par ce débogueur (whitelisté ?) et il peut donc être utilisé pour scraper les résultats de recherche Google sans être bloqué par le CAPTCHA.
Puisque Facebook est impliqué, un Cookie de session Facebook doit être fourni à la bibliothèque avec chaque requête.
pip install goop
from goop import goop
page_1 = goop.search('red shoes', '<your facebook cookie>')
page_2 = goop.search('red shoes', '<your facebook cookie>', page='1')
include_omitted_results = goop.search('red shoes', '<your facebook cookie>', page='8', full=True)
Un dict de la structure suivante est renvoyé
{
"0": {
"url": "https://example.com",
"text": "Example webpage",
"summary": "This is an example webpage whose aim is to demonstrate the usage of ..."
},
"1": {
...
cli.py démontre l'utilisation en effectuant des recherches Google depuis le terminal avec la commande suivante
python cli.py <query> <number_of_pages>

Le scraping des résultats de recherche Google est illégal. Cette bibliothèque est simplement une preuve de concept du contournement. L'auteur n'est pas responsable des actions des utilisateurs finaux.