
Восстанавливает удалённый веб-контент из индекса Google путём перебора поисковых запросов для реконструкции текста, обнаружения скрытых спам-вставок и выявления утечек конфиденциальных данных в кэшированных страницах.
Вы когда-нибудь находили веб-страницу, которая, казалось бы, говорит именно о том, что вам нужно, но она была удалена? Да, кеш Google — это ответ, но... Что, если кеш тоже удален? Что, если сайт находится только на странице индекса Google? Вы не можете вернуть веб-страницу, но вы знаете, что она была.
Google Index Retriever попытается восстановить индекс в Google, чтобы вы могли получить часть текста обратно, а возможно, и тот удаленный контент, который вам нужен. Кеш Google не хранится вечно. Время от времени они просто удаляются навсегда. Archive.org и его WayBackMachine не делают столько снимков менее популярных страниц... поэтому бывают ситуации, когда единственная часть веб-сайта, которая осталась, находится в индексе Google.
Индекс Google — это та маленькая часть текста на странице результатов, которую показывает поисковая система Google, когда пользователь что-то ищет. В «индексе» совпадающие слова поиска выделяются жирным шрифтом. Индекс Google — это последняя часть веб-страницы, которая исчезает. Поэтому будут ситуации, когда это единственная оставшаяся часть. Google хранит разные «индексы» одной и той же веб-страницы, поэтому, если их все собрать вместе, текст можно реконструировать, и он, возможно, появится.
Но это не единственная ситуация, когда инструмент может быть полезен. Что, если индекс содержит пароли, номера кредитных карт или любую другую конфиденциальную информацию? На самом деле это была одна из причин создания инструмента: чтобы продемонстрировать, что удаления веб-страницы и кеша с оскорбительным или конфиденциальным содержанием недостаточно. Контент может быть все еще доступен. Все это объясняется в этой .
Это очень просто. Инструменту подается поисковый запрос Google, который дает результат индекса. Он будет пытаться, перебирая поисковые запросы Google («стимулируя его»), извлечь как можно больше. Затем у него есть несколько различных опций:
Логика попытки «стимулировать» индекс и получить информацию обратно следующая:
Google, конечно, время от времени будет показывать CAPTCHA из-за постоянного использования его сервиса. Это совершенно нормально. Google Index Retriever перехватит CAPTCHA, чтобы ее было легко решить и продолжить.
Этот инструмент также можно использовать для проверки того, не был ли сайт, вероятно, скомпрометирован и не заражен спамом и черным SEO. Обычно злоумышленники взламывают веб-страницы и вставляют в них спам-слова, чтобы «украсть» их PageRank.
Этот контент не виден посетителям, а только роботу и пауку Google, поэтому он обычно виден в этом индексе. Эта вкладка работает точно так же, как и другая, но с другой логикой:
Таким образом, легче узнать, была ли веб-страница скомпрометирована и заражена SEO-спамом.
Программа написана на Java, поэтому она должна работать в любой системе и версии, хотя тестировалась в Windows. Результаты могут быть экспортированы в HTML-документ на локальном компьютере. Ключевые слова и спам-ключевые слова полностью настраиваются. Их можно добавлять по отдельности или редактировать непосредственно из TXT-файла.