
Crawlector es un framework de caza de amenazas diseñado para explorar sitios web en busca de objetos maliciosos.
Crawlector (el nombre Crawlector es una combinación de Crawler & *Detector) es un framework de caza de amenazas diseñado para escanear sitios web en busca de objetos maliciosos.
Nota-1: El framework se presentó por primera vez en la conferencia No Hat en Bérgamo, Italia, el 22 de octubre de 2022 (Diapositivas, Grabación de YouTube). Además, se presentó por segunda vez en la conferencia AVAR, en Singapur, el 2 de diciembre de 2022.
Nota-2: La herramienta complementaria EKFiddle2Yara (es una herramienta que toma las reglas de EKFiddle y las convierte en reglas Yara) mencionada en la charla también fue publicada en ambas conferencias.
Nota-3: La versión 2.0 (Photoid Build:180923), un lanzamiento histórico, se publicó el 18 de septiembre de 2023.
Nota-4: La versión 2.1 (Universe-647 Build:031023) se publicó el 3 de octubre de 2023. Una adición importante es la funcionalidad de Notificación de Alertas por Slack.
Nota-5: La versión 2.2 (Hallstatt Build:051123) se publicó el 5 de noviembre de 2023. Una adición importante es la funcionalidad de Control Remoto por Slack.
Nota-6: La versión 2.3 (Munich Build:241123) se publicó el 24 de noviembre de 2023. Una adición importante es la funcionalidad de Servidores de Nombres DNS.
Nota-6: La versión 2.3.1 {Nero Build:131225} se publicó el 13 de diciembre de 2025. Esta es una versión de mantenimiento.
Esto es para comprobar la presencia de URLs maliciosas en cada página que se escanea. El framework puede consultar la lista de URLs maliciosas desde el servidor de URLHaus (configuración: url_list_web), o desde un archivo en disco (configuración: url_list_file). Si se especifica esta última, tiene prioridad sobre la primera.
Funciona buscando en el contenido de cada página todas las entradas de URL en url_list_web o url_list_file, verificando todas las ocurrencias. Además, ante una coincidencia, y si la opción de configuración check_url_api está configurada como true, Crawlector enviará una solicitud POST a la URL de la API establecida en la opción de configuración url_api, que devuelve un objeto JSON con información adicional sobre la URL coincidente. Dicha información incluye urlh_status (ej., online, offline, unknown), urlh_threat (ej., malware_download), urlh_tags (ej., elf, Mozi) y urlh_reference (ej., https://urlhaus.abuse.ch/url/1116455/). Esta información se incluirá en el archivo de registro cl_mlog_<fecha_actual><hora_actual><(am|pm)>.csv (ver más abajo), solo si check_url_api está configurado como true. De lo contrario, el archivo de registro incluirá las columnas urlh_url (lista de URLs maliciosas coincidentes) y urlh_hit (número de ocurrencias por cada URL maliciosa coincidente), condicionado a que check_url esté configurado como true.
La funcionalidad de URLHaus se puede deshabilitar por completo estableciendo la opción de configuración check_url como false.
Es importante tener en cuenta que esta característica puede ralentizar el escaneo, considerando la enorme cantidad de URLs maliciosas (~130 millones de entradas al momento de escribir esto) que deben verificarse, y el tiempo que lleva obtener información adicional del servidor de URLHaus (si la opción check_url_api está configurada como true).