
Récupère le contenu web supprimé de l'index de Google en forçant les requêtes de recherche par brute force pour reconstituer le texte, détecter les injections de spam cachées et découvrir l'exposition de données sensibles dans les pages mises en cache.
Avez-vous déjà trouvé une page web qui semble parler exactement de ce dont vous avez besoin, mais qui a été supprimée ? Oui, le cache Google est la réponse, mais... Et si le cache a également été supprimé ? Et si le site n'existe plus que dans la page d'index de Google ? Vous ne pouvez pas récupérer la page web, mais vous savez qu'elle était là.
Google Index Retriever tentera de récupérer l'index dans Google, afin que vous puissiez récupérer une partie du texte, et peut-être ce contenu supprimé dont vous avez besoin. Le cache Google n'est pas éternel. De temps en temps, il est définitivement supprimé. Archive.org et sa WayBackMachine ne prennent pas autant d'instantanés des pages moins connues... il existe donc des situations où la seule partie d'un site web qui subsiste se trouve dans l'index Google.
L'index Google est ce petit morceau de texte dans la page de résultats que le moteur de recherche Google affiche lorsque l'utilisateur recherche quelque chose. Dans "l'index", les mots recherchés correspondants apparaissent en gras. L'index Google est la dernière partie d'un site web à disparaître. Il y aura donc des situations où ce sera la seule partie restante. Google conserve différents "index" de la même page web, donc s'ils pouvaient tous être rassemblés, le texte serait reconstruit et pourrait peut-être réapparaître.
Mais ce n'est pas la seule situation où l'outil peut être utile. Et si l'index contient des mots de passe, des numéros de carte de crédit ou toute autre information sensible ? En fait, c'est l'une des raisons de la création de l'outil : démontrer que la suppression de la page web et du cache contenant du contenu offensant ou sensible ne suffit pas. Le contenu peut encore être accessible. Tout cela est expliqué dans cette .
C'est très simple. L'outil reçoit une recherche Google qui produit un résultat d'index. Il tentera, en forçant la recherche Google (en la "stimulant"), d'en récupérer le plus possible. Ensuite, il offre plusieurs options différentes :
La logique pour tenter de "stimuler" l'index et récupérer l'information est la suivante :
Google, bien sûr, lancera un CAPTCHA de temps en temps en raison de l'utilisation continue de son service. C'est tout à fait normal. Google Index Retriever capturera le CAPTCHA pour qu'il soit facile à résoudre et continuer.
Cet outil peut également être utilisé pour vérifier si un site a probablement été compromis et injecté avec du spam et du black SEO. Il est courant que des attaquants compromettent des pages web et y injectent des mots de spam afin de "voler" leur pagerank.
Ce contenu n'est pas visible pour les visiteurs, mais seulement pour le robot et l'araignée de Google, il est donc généralement visible dans cet index. Cet onglet fonctionne exactement comme l'autre, mais avec une autre logique :
Ainsi, il est plus facile de savoir si une page web a été compromise et injectée avec du spam SEO.
Le programme est écrit en Java, il devrait donc fonctionner sous n'importe quel système et version, bien qu'il ait été testé sous Windows. Les résultats peuvent être exportés vers un document HTML sur l'ordinateur local. Les mots-clés et spamKeywords sont entièrement personnalisables. Ils peuvent être ajoutés individuellement ou modifiés directement à partir d'un fichier TXT.