
Google Search Scraper
Hinweis: Es funktioniert nicht mehr. Google hat mir mitgeteilt, dass es kein legitimes Problem sei, als ich es meldete, aber jetzt haben sie es stillschweigend behoben.
goop kann Google-Suchen durchführen, ohne durch das CAPTCHA blockiert zu werden oder Ratenbegrenzungen zu erreichen.
Facebook stellt ein Debugger-Tool für seinen Scraper bereit.
Interessanterweise begrenzt Google die Anfragen, die von diesem Debugger gestellt werden, nicht (whitelisted?) und daher kann es verwendet werden, um die Google-Suchergebnisse zu scrapen, ohne durch das CAPTCHA blockiert zu werden.
Da Facebook involviert ist, muss dem Bibliotheksaufruf bei jeder Anfrage ein Facebook-Sitzungs-Cookie mitgeliefert werden.
pip install goop
from goop import goop
page_1 = goop.search('red shoes', '<your facebook cookie>')
page_2 = goop.search('red shoes', '<your facebook cookie>', page='1')
include_omitted_results = goop.search('red shoes', '<your facebook cookie>', page='8', full=True)
Ein dict der folgenden Struktur wird zurückgegeben
{
"0": {
"url": "https://example.com",
"text": "Example webpage",
"summary": "This is an example webpage whose aim is to demonstrate the usage of ..."
},
"1": {
...
cli.py demonstriert die Verwendung, indem es Google-Suchen vom Terminal aus mit dem folgenden Befehl durchführt:
python cli.py <query> <number_of_pages>

Das Scrapen von Google-Suchergebnissen ist illegal. Diese Bibliothek ist lediglich ein Proof of Concept für den Umgehungsweg. Der Autor ist nicht verantwortlich für die Handlungen der Endnutzer.