
Stellt gelöschte Webinhalte aus dem Google-Index wieder her, indem es Suchanfragen durch Brute-Force durchführt, um Text zu rekonstruieren, versteckte Spam-Injektionen zu erkennen und Datenlecks in gecachten Seiten aufzudecken.
Haben Sie jemals eine Webseite gefunden, die genau das zu behandeln scheint, was Sie brauchen, aber sie wurde entfernt? Ja, der Google-Cache ist die Antwort, aber... Was, wenn auch der Cache entfernt wurde? Was, wenn die Seite nur noch in der Google-Index-Seite existiert? Sie können die Webseite nicht zurückbekommen, aber Sie wissen, dass sie da war.
Google Index Retriever wird versuchen, den Index bei Google zurückzubekommen, sodass Sie einen Teil des Textes zurückerhalten können, und vielleicht den entfernten Inhalt, den Sie benötigen. Der Google-Cache ist nicht für immer da. Von Zeit zu Zeit wird er endgültig entfernt. Archive.org und seine WayBackMachine machen nicht so viele Schnappschüsse von weniger populären Seiten... daher gibt es Situationen, in denen der einzige Teil einer Webseite, der übrig bleibt, im Google-Index ist.
Der Google-Index ist dieser kleine Textabschnitt auf der Ergebnisseite, den die Google-Suchmaschine anzeigt, wenn der Benutzer nach etwas sucht. Im "Index" erscheinen die passenden Suchwörter fett gedruckt. Der Google-Index ist der letzte Teil einer Webseite, der verschwindet. Es wird also Situationen geben, in denen dies der einzige übriggebliebene Teil ist. Google bewahrt verschiedene "Indizes" derselben Webseite auf. Wenn sie alle zusammengefügt werden könnten, würde der Text rekonstruiert werden und vielleicht wieder auftauchen.
Aber das ist nicht die einzige Situation, in der das Tool nützlich sein kann. Was, wenn der Index Passwörter, Kreditkartennummern oder andere sensible Informationen enthält? Tatsächlich war das einer der Gründe für die Erstellung des Tools: um zu demonstrieren, dass das Entfernen der Webseite und des Caches mit anstößigen oder sensiblen Inhalten nicht ausreicht. Der Inhalt kann immer noch erreichbar sein. Dies wird in dieser erklärt.
Es ist sehr einfach. Dem Tool wird eine Google-Suche zugeführt, die ein Index-Ergebnis liefert. Es wird versuchen, durch Brute-Force der Google-Suche ("Stimulation") so viel wie möglich abzurufen. Dann bietet es verschiedene Optionen:
Die Logik, um den Index zu "stimulieren" und die Informationen zurückzubekommen, ist:
Google wird natürlich von Zeit zu Zeit ein CAPTCHA auslösen, aufgrund der kontinuierlichen Nutzung ihres Dienstes. Das ist völlig in Ordnung. Google Index Retriever erfasst das CAPTCHA, sodass es einfach zu lösen ist und weitergemacht werden kann.
Dieses Tool kann auch verwendet werden, um zu überprüfen, ob eine Website wahrscheinlich kompromittiert und mit Spam und Black-Hat-SEO injiziert wurde. Es ist üblich, dass Angreifer Webseiten kompromittieren und Spam-Wörter einfügen, um deren Pagerank zu "stehlen".
Dieser Inhalt ist für Besucher nicht sichtbar, sondern nur für den Google-Roboter und -Spider, daher ist er normalerweise in diesem Index sichtbar. Dieser Tab funktioniert genau wie der andere, jedoch mit einer anderen Logik:
Auf diese Weise ist es einfacher zu erkennen, ob eine Webseite kompromittiert und mit SEO-Spam infiziert wurde.
Das Programm ist in Java geschrieben, daher sollte es unter jedem System und jeder Version funktionieren, obwohl es unter Windows getestet wurde. Die Ergebnisse können in ein HTML-Dokument auf dem lokalen Computer exportiert werden. Schlüsselwörter und Spam-Schlüsselwörter sind vollständig anpassbar. Sie können einzeln hinzugefügt oder direkt aus einer TXT-Datei bearbeitet werden.