
Google के इंडेक्स से हटाई गई वेब सामग्री को पुनर्प्राप्त करता है, खोज प्रश्नों को बलपूर्वक प्रयास करके पाठ को पुनर्निर्मित करता है, छिपे हुए स्पैम इंजेक्शन का पता लगाता है, और कैश की गई पृष्ठों में संवेदनशील डेटा एक्सपोजर का खुलासा करता है।
क्या आपने कभी कोई वेबपेज पाया है जो आपकी ज़रूरत के बारे में बिल्कुल सही बात करता प्रतीत होता है, लेकिन वह हटा दिया गया है? हाँ, Google कैश इसका उत्तर है, लेकिन... क्या होगा यदि कैश भी हटा दिया गया हो? क्या होगा यदि साइट केवल Google इंडेक्स पेज पर हो? आप वेबपेज वापस नहीं पा सकते, लेकिन आप जानते हैं कि वह वहाँ था।
Google Index Retriever Google में इंडेक्स को वापस प्राप्त करने का प्रयास करेगा, ताकि आप पाठ का कुछ हिस्सा वापस पा सकें, और शायद वह हटाई गई सामग्री जिसकी आपको आवश्यकता है। Google कैश हमेशा के लिए नहीं रहता। समय-समय पर, वे हमेशा के लिए हटा दिए जाते हैं। Archive.org और इसका WayBackMachine कम लोकप्रिय पृष्ठों के उतने स्नैपशॉट नहीं लेता... इसलिए, कुछ स्थितियाँ ऐसी होती हैं जहाँ किसी वेब का एकमात्र शेष भाग Google इंडेक्स में होता है।
Google इंडेक्स, परिणाम पृष्ठ पर पाठ का वह छोटा सा भाग है जो Google खोज इंजन उपयोगकर्ता को कुछ खोजने पर दिखाता है। "इंडेक्स" में, खोजे गए शब्दों के मिलान बोल्ड में दिखाई देते हैं। Google इंडेक्स किसी वेब के गायब होने का अंतिम भाग होता है। इसलिए ऐसी स्थितियाँ होंगी जहाँ यही एकमात्र शेष भाग हो। Google एक ही वेबपेज के अलग-अलग "इंडेक्स" रखता है, इसलिए यदि उन सभी को एक साथ रखा जा सके, तो पाठ पुनर्निर्मित हो सकता है और शायद सामने आ सकता है।
लेकिन यही एकमात्र स्थिति नहीं है जहाँ यह उपकरण उपयोगी हो सकता है। क्या होगा यदि इंडेक्स में पासवर्ड, क्रेडिट कार्ड नंबर या कोई अन्य संवेदनशील जानकारी हो? वास्तव में यह उपकरण बनाने का एक कारण यह था: यह प्रदर्शित करना कि आपत्तिजनक या संवेदनशील सामग्री वाले वेबपेज और कैश को हटाना पर्याप्त नहीं है। सामग्री अभी भी पहुँच योग्य हो सकती है। यह सब इस में समझाया गया है।
यह बहुत आसान है। उपकरण को एक Google खोज दी जाती है जो एक इंडेक्स परिणाम उत्पन्न करती है। यह Google खोज को बलपूर्वक ("उत्तेजित करके") अधिक से अधिक प्राप्त करने का प्रयास करेगा। फिर, इसके कुछ अलग विकल्प हैं:
इंडेक्स को "उत्तेजित" करने और जानकारी वापस पाने का तर्क इस प्रकार है:
बेशक, Google अपनी सेवा के निरंतर उपयोग के कारण समय-समय पर CAPTCHA लॉन्च करेगा। यह पूरी तरह से ठीक है। Google Index Retriever CAPTCHA को कैप्चर करेगा ताकि इसे हल करना और जारी रखना आसान हो।
इस उपकरण का उपयोग यह जाँचने के लिए भी किया जा सकता है कि कोई साइट संभवतः हैक हुई है और उसमें स्पैम और ब्लैक SEO इंजेक्ट किया गया है या नहीं। यह आम बात है कि हमलावर वेबपेजों को हैक करते हैं और उनमें स्पैम शब्द इंजेक्ट करते हैं ताकि वे उनके पेजरैंक को "चुरा" सकें।
यह सामग्री आगंतुकों को दिखाई नहीं देती, केवल Google रोबोट और स्पाइडर को दिखाई देती है, इसलिए यह आमतौर पर इस इंडेक्स में दिखाई देती है। यह टैब बिल्कुल दूसरे की तरह काम करता है, लेकिन एक अलग तर्क के साथ:
इस प्रकार, यह जानना आसान हो जाता है कि कोई वेबपेज हैक हुआ है और उसमें SEO स्पैम इंजेक्ट किया गया है या नहीं।
प्रोग्राम Java में लिखा गया है, इसलिए इसे किसी भी सिस्टम और संस्करण पर काम करना चाहिए, हालाँकि इसका परीक्षण Windows पर किया गया है। परिणामों को स्थानीय कंप्यूटर पर एक HTML दस्तावेज़ में निर्यात किया जा सकता है। कीवर्ड और स्पैम कीवर्ड पूरी तरह से अनुकूलन योग्य हैं। उन्हें व्यक्तिगत रूप से जोड़ा जा सकता है या सीधे TXT फ़ाइल से संपादित किया जा सकता है।