
구글 색인에서 삭제된 웹 콘텐츠를 복구하며, 검색 쿼리를 무차별 대입하여 텍스트를 재구성하고, 숨겨진 스팸 삽입을 탐지하며, 캐시된 페이지에서 민감한 데이터 노출을 발견합니다.
당신이 필요로 하는 내용을 정확히 다루는 것 같은 웹페이지를 발견했는데 삭제된 적이 있나요? 네, Google 캐시가 답이지만... 캐시도 삭제되었다면요? 사이트가 Google 색인 페이지에만 있다면요? 웹페이지를 되찾을 수는 없지만, 그 페이지가 존재했다는 것은 알고 있습니다.
Google Index Retriever는 Google에서 색인을 다시 검색하여 텍스트의 일부를 되찾고, 아마도 당신이 필요로 하는 삭제된 콘텐츠를 되찾으려고 시도할 것입니다. Google 캐시는 영원히 존재하지 않습니다. 때때로 영구히 삭제되기도 합니다. Archive.org와 그 WayBackMachine은 인기가 적은 페이지의 스냅샷을 많이 저장하지 않습니다... 그래서 웹의 남은 유일한 부분이 Google 색인에 있는 상황이 있습니다.
Google 색인은 사용자가 무엇이든 검색할 때 Google 검색 엔진이 결과 페이지에 표시하는 작은 텍스트 부분입니다. '색인'에서는 검색어와 일치하는 단어가 굵게 표시됩니다. Google 색인은 웹에서 마지막으로 사라지는 부분입니다. 따라서 그것만 남는 상황이 발생할 수 있습니다. Google은 동일한 웹페이지에서 여러 '색인'을 유지하므로, 그것들을 모두 합칠 수 있다면 텍스트가 재구성되어 나타날 수도 있습니다.
하지만 이 도구가 유용할 수 있는 상황은 그것뿐만이 아닙니다. 색인에 비밀번호, 신용카드 번호 또는 기타 민감한 정보가 포함되어 있다면요? 사실 그것이 이 도구를 만든 이유 중 하나였습니다: 공격적이거나 민감한 콘텐츠가 있는 웹페이지와 캐시를 삭제하는 것만으로는 충분하지 않다는 것을 보여주기 위해서입니다. 콘텐츠는 여전히 접근 가능할 수 있습니다. 이 모든 것은 이 에 설명되어 있습니다.
매우 쉽습니다. 도구는 색인 결과를 생성하는 Google 검색을 입력받습니다. Google 검색을 무차별 대입 방식('자극')으로 시도하여 가능한 한 많은 내용을 검색합니다. 그런 다음 몇 가지 다른 옵션이 있습니다:
색인을 '자극'하고 정보를 되찾기 위한 로직은 다음과 같습니다:
Google은 물론 지속적인 서비스 사용으로 인해 때때로 CAPTCHA를 표시합니다. 이는 완전히 정상입니다. Google Index Retriever는 CAPTCHA를 캡처하여 쉽게 해결하고 계속 진행할 수 있도록 합니다.
이 도구는 사이트가 손상되어 스팸 및 블랙 SEO가 삽입되었는지 확인하는 데도 사용될 수 있습니다. 공격자가 웹페이지를 손상시키고 스팸 단어를 삽입하여 페이지랭크를 '훔치는' 경우가 일반적입니다.
이 콘텐츠는 방문자에게는 보이지 않지만 Google 로봇과 스파이더에게만 보이므로 일반적으로 이 색인에서 볼 수 있습니다. 이 탭은 다른 탭과 정확히 동일하게 작동하지만 다른 로직을 사용합니다:
이렇게 하면 웹페이지가 손상되어 SEO 스팸이 삽입되었는지 더 쉽게 알 수 있습니다.
프로그램은 Java로 작성되었으므로 Windows에서 테스트되었지만 모든 시스템과 버전에서 작동해야 합니다. 결과는 로컬 컴퓨터의 HTML 문서로 내보낼 수 있습니다. 키워드와 스팸 키워드는 완전히 사용자 정의할 수 있습니다. 개별적으로 추가하거나 TXT 파일에서 직접 편집할 수 있습니다.