
Recupera contenuti web cancellati dall'indice di Google forzando le query di ricerca per ricostruire il testo, rilevare iniezioni di spam nascoste e scoprire esposizioni di dati sensibili nelle pagine memorizzate nella cache.
Hai mai trovato una pagina web che sembra parlare esattamente di ciò di cui hai bisogno, ma è stata rimossa? Sì, la cache di Google è la risposta, ma... E se anche la cache fosse stata rimossa? E se il sito è solo nella pagina dell'indice di Google? Non puoi recuperare la pagina web, ma sai che c'era.
Google Index Retriever cercherà di recuperare l'indice in Google, così puoi ottenere parte del testo, e forse quel contenuto rimosso di cui hai bisogno. La cache di Google non è eterna. Di tanto in tanto, vengono semplicemente rimosse definitivamente. Archive.org e la sua WayBackMachine non fanno molti snapshot delle pagine meno popolari... quindi ci sono situazioni in cui l'unica parte di un sito web rimasta è nell'Indice di Google.
L'indice di Google è quella piccola parte di testo nella pagina dei risultati che il motore di ricerca Google mostra quando l'utente cerca qualcosa. Nell' "indice", le parole cercate che corrispondono appaiono in grassetto. L'indice di Google è l'ultima parte di un sito web a scomparire. Quindi ci saranno situazioni in cui quella è l'unica parte rimasta. Google conserva diversi "indici" della stessa pagina web, quindi, se potessero essere tutti messi insieme, il testo verrebbe ricostruito e potrebbe emergere.
Ma non è l'unica situazione in cui lo strumento può essere utile. E se l'indice contenesse password, numeri di carte di credito o altre informazioni sensibili? In effetti questo è stato uno dei motivi per creare lo strumento: dimostrare che rimuovere la pagina web e la cache con contenuti offensivi o sensibili non è sufficiente. Il contenuto potrebbe essere ancora raggiungibile. Tutto ciò è spiegato in questa .
È molto semplice. Lo strumento viene alimentato con una ricerca Google che produce un risultato di indice. Proverà, forzando la ricerca Google ("stimolandola") a recuperare il più possibile. Poi, ha alcune diverse opzioni:
La logica per cercare di "stimolare" l'indice e recuperare le informazioni è:
Google, ovviamente, lancerà un CAPTCHA di tanto in tanto a causa dell'uso continuo del loro servizio. Questo è perfettamente normale. Google Index Retriever catturerà il CAPTCHA in modo che sia facile risolverlo e continuare.
Questo strumento può essere utilizzato anche per verificare se un sito è stato probabilmente compromesso e iniettato con spam e black SEO. È comune che gli aggressori compromettano pagine web e iniettino parole di spam per "rubare" il loro pagerank.
Questo contenuto non è visibile ai visitatori ma solo al robot e spider di Google, quindi è solitamente visibile in questo indice. Questa scheda funziona esattamente come l'altra, ma con una logica diversa:
In questo modo, è più facile sapere se una pagina web è stata compromessa e iniettata con spam SEO.
Il programma è scritto in Java, quindi dovrebbe funzionare su qualsiasi sistema e versione, anche se è stato testato su Windows. I risultati possono essere esportati in un documento html sul computer locale. Le parole chiave e spamKeywords sono completamente personalizzabili. Possono essere aggiunte individualmente o modificate direttamente da un file TXT.