
Google Search Scraper
Nota: Non funziona più. Il team di Google mi ha detto che non era un problema legittimo quando l'ho segnalato, ma ora lo hanno semplicemente risolto in silenzio.
goop può eseguire ricerche Google senza essere bloccato dal CAPTCHA o senza incorrere in limiti di frequenza.
Facebook fornisce uno strumento di debug per il suo scraper.
È interessante notare che Google non limita le richieste effettuate da questo debugger (whitelist?) e quindi può essere utilizzato per raschiare i risultati di ricerca di Google senza essere bloccati dal CAPTCHA.
Poiché è coinvolto Facebook, un Cookie di sessione Facebook deve essere fornito alla libreria con ogni richiesta.
pip install goop
from goop import goop
page_1 = goop.search('scarpe rosse', '<il tuo cookie facebook>')
page_2 = goop.search('scarpe rosse', '<il tuo cookie facebook>', page='1')
include_omitted_results = goop.search('scarpe rosse', '<il tuo cookie facebook>', page='8', full=True)
Viene restituito un dict con la seguente struttura
{
"0": {
"url": "https://example.com",
"text": "Pagina web di esempio",
"summary": "Questa è una pagina web di esempio il cui scopo è dimostrare l'utilizzo di ..."
},
"1": {
...
cli.py dimostra l'utilizzo eseguendo ricerche Google dal terminale con il seguente comando
python cli.py <query> <numero_di_pagine>

Raschiare i risultati di ricerca di Google è illegale. Questa libreria è semplicemente una prova di concetto del bypass. L'autore non è responsabile per le azioni degli utenti finali.