
Raspador de Pesquisa do Google
Nota: Não funciona mais. A equipe do Google me disse que não era um problema legítimo quando o relatei a eles, mas agora eles simplesmente o corrigiram silenciosamente.
o goop pode realizar pesquisas no Google sem ser bloqueado pelo CAPTCHA ou atingir quaisquer limites de taxa.
O Facebook fornece uma ferramenta de depuração para seu raspador.
Curiosamente, o Google não limita as requisições feitas por este depurador (na lista de permissões?) e, portanto, pode ser usado para raspar os resultados da pesquisa do Google sem ser bloqueado pelo CAPTCHA.
Como o Facebook está envolvido, um Cookie de sessão do Facebook deve ser fornecido à biblioteca em cada requisição.
pip install goop
from goop import goop
page_1 = goop.search('red shoes', '<your facebook cookie>')
page_2 = goop.search('red shoes', '<your facebook cookie>', page='1')
include_omitted_results = goop.search('red shoes', '<your facebook cookie>', page='8', full=True)
Um dict com a seguinte estrutura é retornado
{
"0": {
"url": "https://example.com",
"text": "Example webpage",
"summary": "This is an example webpage whose aim is to demonstrate the usage of ..."
},
"1": {
...
cli.py demonstra o uso realizando pesquisas no Google a partir do terminal com o seguinte comando
python cli.py <query> <number_of_pages>

Raspar resultados de pesquisa do Google é ilegal. Esta biblioteca é meramente uma prova de conceito do bypass. O autor não é responsável pelas ações dos usuários finais.