
Recupera contenido web eliminado del índice de Google mediante fuerza bruta en consultas de búsqueda para reconstruir texto, detectar inyecciones de spam ocultas y descubrir exposición de datos sensibles en páginas en caché.
¿Alguna vez has encontrado una página web que parece hablar exactamente de lo que necesitas, pero ha sido eliminada? Sí, el caché de Google es la respuesta, pero... ¿Qué pasa si el caché también ha sido eliminado? ¿Qué pasa si el sitio solo está en la página de índice de Google? No puedes recuperar la página web, pero sabes que estaba allí.
Google Index Retriever intentará recuperar el índice en Google, para que puedas obtener parte del texto de vuelta, y quizás ese contenido eliminado que necesitas. El caché de Google no está ahí para siempre. De vez en cuando, se eliminan definitivamente. Archive.org y su WayBackMachine no toman tantas instantáneas de las páginas menos populares... así que hay algunas situaciones donde la única parte de una web que queda está en el índice de Google.
El índice de Google es esa pequeña parte de texto en la página de resultados que el motor de búsqueda de Google muestra cuando el usuario busca algo. En el "índice", las palabras buscadas que coinciden aparecen en negrita. El índice de Google es la última parte de una web en desaparecer. Así que habrá situaciones donde esa es la única parte que queda. Google mantiene diferentes "índices" de la misma página web, por lo que si se pudieran juntar todos, el texto se reconstruiría y quizás aparecería.
Pero esa no es la única situación donde la herramienta puede ser útil. ¿Qué pasa si el índice contiene contraseñas, números de tarjetas de crédito u otra información sensible? De hecho, esa fue una de las razones para crear la herramienta: demostrar que eliminar la página web y el caché con contenido ofensivo o sensible no es suficiente. El contenido aún puede ser accesible. Todo esto se explica en esta .
Es muy fácil. La herramienta se alimenta con una búsqueda de Google que produce un resultado de índice. Intentará, forzando la búsqueda de Google ("estimulándola") para recuperar tanto como sea posible. Luego, tiene algunas opciones diferentes:
La lógica para intentar "estimular" el índice y recuperar la información es:
Google, por supuesto, lanzará un CAPTCHA de vez en cuando debido al uso continuo de su servicio. Esto está perfectamente bien. Google Index Retriever capturará el CAPTCHA para que sea fácil de resolver y continuar.
Esta herramienta también se puede usar para comprobar si un sitio ha sido probablemente comprometido e inyectado con spam y SEO negro. Es habitual que los atacantes comprometan páginas web e inyecten palabras de spam para "robar" su PageRank.
Este contenido no es visible para los visitantes, sino solo para el robot y spider de Google, por lo que normalmente es visible en este índice. Esta pestaña funciona exactamente igual que la otra, pero con otra lógica:
De esta manera, es más fácil saber si una página web ha sido comprometida e inyectada con spam SEO.
El programa está escrito en Java, por lo que debería funcionar en cualquier sistema y versión, aunque se ha probado en Windows. Los resultados pueden exportarse a un documento HTML en el ordenador local. Las palabras clave y spamKeywords son completamente personalizables. Se pueden añadir individualmente o editar directamente desde un archivo TXT.