
गूगल खोज स्क्रेपर
नोट: यह अब काम नहीं करता। जब मैंने Google टीम को इसकी सूचना दी तो उन्होंने बताया कि यह कोई वैध समस्या नहीं है, लेकिन अब उन्होंने चुपचाप इसे ठीक कर दिया है।
goop CAPTCHA द्वारा अवरुद्ध हुए बिना या किसी दर सीमा को हिट किए बिना Google खोज कर सकता है।
Facebook अपने स्क्रैपर के लिए एक डीबगर टूल प्रदान करता है।
दिलचस्प बात यह है कि Google इस डीबगर द्वारा किए गए अनुरोधों को सीमित नहीं करता (श्वेतसूचीबद्ध?), और इसलिए इसका उपयोग CAPTCHA द्वारा अवरुद्ध हुए बिना Google खोज परिणामों को स्क्रैप करने के लिए किया जा सकता है।
चूंकि Facebook शामिल है, प्रत्येक अनुरोध के साथ लाइब्रेरी को एक Facebook सत्र Cookie प्रदान की जानी चाहिए।
pip install goop
from goop import goop
page_1 = goop.search('red shoes', '<your facebook cookie>')
page_2 = goop.search('red shoes', '<your facebook cookie>', page='1')
include_omitted_results = goop.search('red shoes', '<your facebook cookie>', page='8', full=True)
निम्नलिखित संरचना का एक dict लौटाया जाता है
{
"0": {
"url": "https://example.com",
"text": "Example webpage",
"summary": "This is an example webpage whose aim is to demonstrate the usage of ..."
},
"1": {
...
cli.py निम्नलिखित कमांड के साथ टर्मिनल से Google खोज करके उपयोग प्रदर्शित करता है
python cli.py <query> <number_of_pages>

Google खोज परिणामों को स्क्रैप करना अवैध है। यह लाइब्रेरी केवल बायपास का एक प्रूफ ऑफ कॉन्सेप्ट है। लेखक अंतिम उपयोगकर्ताओं के कार्यों के लिए जिम्मेदार नहीं है।