Skip to content
KitploitKITPLOIT
도구익스플로잇블로그
Log in
제출
도구익스플로잇블로그
제출

해킹, 침투 테스트 및 사이버 보안 도구를 당신의 보안 무기고에!

Kitploit은 해킹, 사이버 보안 및 침투 테스트 도구 디렉토리입니다. 최신 프로젝트 업데이트를 발견하여 취약점을 찾고, 시스템을 분석하고, 테스트를 자동화하고, 보안을 강화하세요.

··피드·문의·개인정보·© 2026 Kitploit

도구 디렉토리

카테고리

모든 카테고리 보기
Loading categories
Crawlector — Crawlector는 악성 객체를 검사하기 위해 웹사이트를 스캔하도록 설계된 위협 헌팅 프레임워크입니다. | Kitploit
도구/GitHubGitHub/mfmokbel/crawlector
OSINT (Open Source Intelligence)Vulnerability ScannersThreat Feeds & AggregatorsInformation GatheringWeb SecurityMalware AnalysisThreat IntelligenceCrawler
GitHubmfmokbel/crawlector

Crawlector

Crawlector는 악성 객체를 검사하기 위해 웹사이트를 스캔하도록 설계된 위협 헌팅 프레임워크입니다.

저장소 보기
12310359개월 전Kitploit 검토 완료

인기

모두 보기 →

커뮤니티에서 가장 많이 사용되는 도구를 찾아보세요.

모든 도구 탐색

도구 컬렉션을 둘러보세요

모든 도구 보기 →
공유
웹사이트

Crawlector

Crawlector (이름 Crawlector는 Crawler & Detector의 조합입니다)는 웹사이트에서 악성 객체를 스캔하기 위해 설계된 위협 헌팅 프레임워크입니다.

참고-1: 이 프레임워크는 2022년 10월 22일 이탈리아 베르가모에서 열린 No Hat 컨퍼런스에서 처음 발표되었습니다 (슬라이드, YouTube 녹화). 또한, 2022년 12월 2일 싱가포르에서 열린 AVAR 컨퍼런스에서 두 번째로 발표되었습니다.

참고-2: 발표에서 언급된 동반 도구 EKFiddle2Yara (EKFiddle 규칙을 가져와 Yara 규칙으로 변환하는 도구)도 두 컨퍼런스에서 함께 공개되었습니다.

참고-3: 버전 2.0 (Photoid Build:180923)은 2023년 9월 18일에 출시된 중요한 릴리스입니다.

참고-4: 버전 2.1 (Universe-647 Build:031023)은 2023년 10월 3일에 출시되었습니다. 주요 추가 사항은 Slack 알림 기능입니다.

참고-5: 버전 2.2 (Hallstatt Build:051123)은 2023년 11월 5일에 출시되었습니다. 주요 추가 사항은 Slack 원격 제어 기능입니다.

참고-6: 버전 2.3 (Munich Build:241123)은 2023년 11월 24일에 출시되었습니다. 주요 추가 사항은 DNS 네임서버 기능입니다.

참고-6: 버전 2.3.1 {Nero Build:131225}은 2025년 12월 13일에 출시되었습니다. 유지보수 릴리스입니다.

기능

  • 웹사이트 스파이더링을 지원하여 추가 링크 찾기 (최대 2레벨 깊이)
  • Yara를 백엔드 엔진으로 통합하여 규칙 스캔
  • 온라인 및 오프라인 스캔 지원
  • 도메인/사이트 디지털 인증서 크롤링 지원
  • URLhaus 쿼리를 통해 페이지 내 악성 URL 탐지 지원
  • 심층 객체 추출 (DOE)
  • Slack 알림
  • HTTP 리디렉션에 대한 파라미터화된 지원
  • Whois 정보 검색
  • 페이지 콘텐츠 해싱 지원: TLSH (Trend Micro Locality Sensitive Hash) 및 md5, sha1, sha256, ripemd128 등 기타 표준 암호화 해시 함수
    • TLSH는 페이지 크기가 50바이트 미만이거나 데이터에 충분한 무작위성이 없으면 값을 반환하지 않음
  • 모든 URL의 평점 및 카테고리 조회 지원
  • 주어진 사이트에 대해 동일한 도메인의 사용 가능한 모든 TLD 및/또는 서브도메인을 찾아 확장 지원
    • 이 기능은 Omnisint Labs API (이 사이트는 2023년 3월 10일 기준 다운됨) 및 RapidAPI API 사용
    • TLD 확장 구현은 네이티브
    • 이 기능은 평점 및 카테고리화와 함께 원본 도메인에 대한 스캠/피싱/악성 도메인을 찾는 기능을 제공
  • 도메인 해석 지원 (IPv4 및 IPv6)
  • 스캔된 웹사이트 페이지를 나중에 스캔할 수 있도록 저장 (zip 압축 가능)
  • 프레임워크의 모든 설정은 단일 사용자 정의 설정 파일로 제어
  • 모든 스캔 세션은 잘 구조화된 CSV 파일에 저장되며, 스캔된 웹사이트에 대한 풍부한 정보와 트리거된 Yara 규칙에 대한 정보 포함
  • 기타 여러 기능...
  • 모든 HTTP(S) 통신은 프록시 인식
  • 단일 실행 파일
  • C++로 작성됨

URLHaus 스캔 및 API 통합

이는 스캔 중인 모든 페이지에 대해 악성 URL을 확인하는 기능입니다. 프레임워크는 URLHaus 서버 (설정: url_list_web)에서 악성 URL 목록을 쿼리하거나 디스크의 파일 (설정: url_list_file)에서 쿼리할 수 있으며, 후자가 지정되면 전자보다 우선합니다.

작동 방식: 모든 페이지의 콘텐츠를 url_list_web 또는 url_list_file의 모든 URL 항목에 대해 검색하여 모든 발생을 확인합니다. 또한, 일치하는 경우 check_url_api 설정 옵션이 true로 설정되어 있으면 Crawlector는 url_api 설정 옵션에 설정된 API URL로 POST 요청을 보내며, 일치하는 URL에 대한 추가 정보가 포함된 JSON 객체를 반환합니다. 이러한 정보에는 urlh_status (예: online, offline, unknown), urlh_threat (예: malware_download), urlh_tags (예: elf, Mozi), urlh_reference (예: https://urlhaus.abuse.ch/url/1116455/)가 포함됩니다. 이 정보는 check_url_api가 true로 설정된 경우에만 로그 파일 cl_mlog_<current_date><current_time><(pm|am)>.csv (아래 참조)에 포함됩니다. 그렇지 않으면 로그 파일에는 urlh_url (일치하는 악성 URL 목록) 및 urlh_hit (일치하는 각 악성 URL의 발생 횟수) 열이 포함되며, 이는 check_url이 true로 설정된 경우에만 해당됩니다.

URLHaus 기능은 설정 옵션 check_url을 false로 설정하여 완전히 비활성화할 수 있습니다.

이 기능은 확인해야 하는 방대한 악성 URL (~ 현재 약 1억 3천만 개 항목)과 URLHaus 서버에서 추가 정보를 가져오는 시간(옵션 check_url_api가 true로 설정된 경우)으로 인해 스캔 속도가 느려질 수 있습니다.

파일 및 폴더 구조

  1. \cl_sites
    • 방문하거나 크롤링할 사이트 목록이 저장되는 위치.
    • 여러 파일 및 디렉토리 지원.
  2. \crawled
    • 모든 크롤링/스파이더링된 URL이 텍스트 파일로 저장되는 위치.
  3. \certs
    • 모든 도메인/사이트 디지털 인증서가 저장되는 위치 (.der 형식).
  4. \results
    • 방문한 웹사이트가 저장되는 위치. 옵션 results_dir을 통해 설정 가능.
  5. \pg_cache
    • 스파이더 기능의 일부가 아닌 사이트에 대한 프로그램 캐시. 옵션 cache_dir, 섹션 [default] 을 통해 설정 가능.
  6. \cl_cache
    • 스파이더 기능의 일부인 사이트에 대한 크롤러 캐시. 옵션 cache_dir, 섹션 [spider] 를 통해 설정 가능.
  7. \yara_rules
    • 모든 Yara 규칙이 저장되는 위치. 이 디렉토리에 있는 모든 규칙은 엔진에 의해 로드되고, 구문 분석, 유효성 검사 및 실행 전 평가됨.
  8. cl_config.ini
    • 프레임워크의 동작에 영향을 주기 위해 조정할 수 있는 모든 구성 매개변수가 포함된 파일.
  9. cl_mlog_<current_date><current_time><(pm|am)>.csv
    • 방문한 웹사이트에 대한 풍부한 정보가 포함된 로그 파일
    • 날짜, 시간, Yara 스캔 상태, 각 일치 항목의 오프셋 및 길이와 함께 트리거된 Yara 규칙 목록, ID, URL, HTTP 상태 코드, 연결 상태, HTTP 헤더, 페이지 크기, 디스크에 저장된 페이지 경로, URLHaus 결과 관련 기타 열 포함.
    • 파일 이름은 세션별로 고유함.
  10. cl_offl_mlog_<current_date><current_time><(pm|am)>.csv
    • 오프라인으로 스캔된 파일에 대한 정보가 포함된 로그 파일.
    • 일치 항목의 오프셋 및 길이와 함께 트리거된 Yara 규칙 목록, 디스크에 저장된 페이지 경로 포함.
    • 파일 이름은 세션별로 고유함.
  11. cl_certs_<current_date><current_time><(pm|am)>.csv
    • 발견된 디지털 인증서에 대한 풍부한 정보가 포함된 로그 파일.
  12. \expanded\exp_subdomain_<pm|am>.txt
    • 발견된 서브도메인 포함 ([site] 섹션의 일부)
  13. \expanded\exp_tld_<pm|am>.txt
    • 발견된 도메인 포함 ([site] 섹션의 일부)

설정 파일 (cl_config.ini)

세션을 실행하기 전에 반드시 설정 파일 cl_config.ini에 익숙해져야 합니다. 모든 섹션과 매개변수는 설정 파일 자체에 문서화되어 있습니다.

Yara 오프라인 스캔 기능은 독립 실행형 옵션입니다. 즉, 활성화되면 Crawlector는 다른 활성화된 기능과 관계없이 이 기능만 실행합니다. 도메인/사이트 디지털 인증서 크롤링 기능도 마찬가지입니다. 어느 쪽이든 설정 파일에서 사용하지 않는 모든 기능을 비활성화하는 것이 좋습니다.

  • 설정(log_to_file 또는 log_to_cons)에 따라 Yara 규칙이 모듈 속성(예: PE, ELF, Hash 등)만 참조하는 경우, Crawlector는 일치 시 규칙 이름만 표시하고 오프셋 및 길이 데이터는 제외합니다.

참고: 경로를 사용하는 모든 옵션에는 항상 절대 경로를 제공하십시오.

사이트 형식 패턴

웹사이트를 방문/스캔하려면 URL 목록이 텍스트 파일에 저장되어야 하며, 디렉토리 "cl_sites"에 있어야 합니다.

Crawlector는 세 가지 유형의 URL을 허용합니다:

  1. 유형 1: 한 줄에 하나의 URL
    • Crawlector는 각 URL에 URL 호스트 이름에서 파생된 고유 이름을 할당합니다.
  2. 유형 2: 한 줄에 하나의 URL, 고유 이름과 함께 [a-zA-Z0-9_-]{1,128} = <url>
  3. 유형 3: 스파이더 기능을 위해 고유한 형식이 사용됩니다. 한 줄에 하나의 URL은 다음과 같습니다:

<id>[depth:<0|1>-><\d+>,total:<\d+>,sleep:<\d+>] = <url>

예를 들어,

mfmokbel[depth:1->3,total:10,sleep:0] = https://www.mfmokbel.com

이는 다음과 동일합니다: mfmokbel[d:1->3,t:10,s:0] = https://www.mfmokbel.com

여기서, <id> := [a-zA-Z0-9_-]{1,128}

depth, total 및 sleep can also be replaced with their shortened versions d, t and s, respectively.

  • depth: 스파이더는 추가 URL을 찾기 위해 두 레벨 깊이로 이동을 지원합니다 (이는 설계 결정입니다).
  • 0 값은 레벨 1 깊이를 나타내며, "->" 뒤의 값은 무시됩니다.
  • 레벨 1 깊이는 total 매개변수에 의해 제어됩니다. 따라서 스파이더는 먼저 지정된 URL에서 가능한 많은 추가 URL을 찾으려고 시도합니다.
  • "->" 뒤의 값은 total 매개변수 값에 따라 발견된 각 URL에 대해 스파이더링할 최대 URL 수를 나타냅니다.
  • 1 값은 레벨 2 깊이를 나타내며, "->" 뒤의 값은 total 매개변수에 따라 발견된 각 URL에 대해 찾을 최대 URL 수를 나타냅니다. 명확히 하자면, 위의 예에서와 같이 먼저 스파이더는 total 매개변수에 지정된 대로 10개의 URL을 찾고, 발견된 각 URL은 최대 3개의 URL까지 스파이더링됩니다. 따라서 최상의 시나리오에서 우리는 40 (10 + (10*3))개의 URL을 얻게 됩니다.
  • sleep 매개변수는 각 HTTP 요청 사이에 대기할 밀리초 단위의 정수 값을 사용합니다.

참고 1: 유형 3 URL은 설정 파일의 spider 섹션에서 설정 매개변수 live_crawler를 false로 설정하여 유형 1 URL로 전환할 수 있습니다.

참고 2: 빈 줄과 ";" , "#" 또는 "//"로 시작하는 줄은 무시됩니다.

스파이더 기능

스파이더 기능은 Crawlector에 대상 페이지에서 추가 링크를 찾는 기능을 제공합니다. 스파이더는 다음 기능을 지원합니다:

  • 스파이더 기능이 작동하려면 도메인이 유형 3이어야 합니다.
  • exclude_url 설정 옵션을 통해 스파이더링에서 일치하는 URL을 제외하기 위해 와일드카드 패턴 목록(파이프로 구분)을 지정할 수 있습니다. 예를 들어, *.zip|*.exe|*.rar|*.zip|*.7z|*.pdf|.*bat|*.db
  • include_url 설정 옵션을 통해 패턴과 일치하는 URL만 스파이더링하도록 와일드카드 패턴 목록(파이프로 구분)을 지정할 수 있습니다. 예를 들어, */checkout/*|*/products/*
  • exclude_https 설정 옵션을 통해 HTTPS URL을 제외할 수 있습니다.
  • add_ext_links 설정 옵션을 통해 기본 페이지만의 아웃바운드/외부 링크를 고려할 수 있습니다. 이 기능은 exclude_url 및 include_url 설정 옵션을 따릅니다.
  • ext_links_only 설정 옵션을 통해 기본 페이지만의 아웃바운드/외부 링크를 고려하고 다른 모든 URL은 제외할 수 있습니다. 이 기능은 exclude_url 및 include_url 설정 옵션을 따릅니다.

ID 유형

릴리스 2.0에서 ID는 ID 자체에 다음 유형 중 하나를 추가하여 명시적으로 유형이 할당됩니다:

도구 다운로드