
Scraper de Google
Nota: Ya no funciona. El equipo de Google me dijo que no era un problema legítimo cuando lo reporté, pero ahora simplemente lo arreglaron silenciosamente.
goop puede realizar búsquedas en Google sin ser bloqueado por el CAPTCHA ni alcanzar límites de velocidad.
Facebook proporciona un depurador para su rastreador.
Curiosamente, Google no limita las solicitudes realizadas por este depurador (¿whitelisted?) y por lo tanto puede utilizarse para raspar los resultados de búsqueda de Google sin ser bloqueado por el CAPTCHA.
Dado que Facebook está involucrado, se debe proporcionar una Cookie de sesión de Facebook a la biblioteca con cada solicitud.
pip install goop
from goop import goop
page_1 = goop.search('red shoes', '<tu cookie de facebook>')
page_2 = goop.search('red shoes', '<tu cookie de facebook>', page='1')
include_omitted_results = goop.search('red shoes', '<tu cookie de facebook>', page='8', full=True)
Se devuelve un dict con la siguiente estructura
{
"0": {
"url": "https://example.com",
"text": "Example webpage",
"summary": "This is an example webpage whose aim is to demonstrate the usage of ..."
},
"1": {
...
cli.py demuestra el uso realizando búsquedas en Google desde la terminal con el siguiente comando
python cli.py <consulta> <número_de_páginas>

Raspar los resultados de búsqueda de Google es ilegal. Esta biblioteca es meramente una prueba de concepto del bypass. El autor no es responsable de las acciones de los usuarios finales.