Skip to content
KitploitKITPLOIT
ToolsBlog
Einreichen
ToolsBlog
Einreichen

Hacking-, PenTest- und Cybersicherheits-Tools für Ihr Sicherheitsarsenal!

Kitploit ist ein Verzeichnis von Hacking-, Cybersicherheits- und Pentesting-Tools. Entdecken Sie die neuesten Projekt-Updates, um Schwachstellen zu finden, Systeme zu analysieren, Tests zu automatisieren und Ihre Sicherheit zu stärken.

··Feeds·Kontakt·Datenschutz·© 2026 Kitploit

Tool-Verzeichnis

Kategorien

Alle Kategorien anzeigen
Loading categories
ache — Fokussierter Webcrawler, der Seitenklassifikatoren und Link-Priorisierung verwendet, um domänenspezifische oder musterbasierte Webseiten effizient zu sammeln, mit Unterstützung für Elasticsearch-Indizierung und TOR-Proxy-Crawling. | Kitploit
Tools/GitHubGitHub/vida-nyu/ache
OSINT (Open-Source-Intelligence)InformationsbeschaffungMaschinelles LernenCrawler
GitHubvida-nyu/ache

ache

Fokussierter Webcrawler, der Seitenklassifikatoren und Link-Priorisierung verwendet, um domänenspezifische oder musterbasierte Webseiten effizient zu sammeln, mit Unterstützung für Elasticsearch-Indizierung und TOR-Proxy-Crawling.

Repository anzeigen
486137vor 11 MonatenVon Kitploit geprüft

Beliebteste

Alle anzeigen →

Entdecken Sie die meistgenutzten Tools unserer Community.

Alle Tools erkunden

Durchsuchen Sie unsere Tool-Sammlung

Alle Tools anzeigen →
Teilen
Webseite

Build Status Docker Build Documentation Status License

ACHE Focused Crawler

ACHE ist ein fokussierter Webcrawler. Er sammelt Webseiten, die bestimmte Kriterien erfüllen, z. B. Seiten, die zu einer bestimmten Domain gehören oder ein benutzerdefiniertes Muster enthalten. ACHE unterscheidet sich von generischen Crawlern dadurch, dass es Seitenklassifikatoren verwendet, um zwischen relevanten und irrelevanten Seiten in einer bestimmten Domain zu unterscheiden. Ein Seitenklassifikator kann von einem einfachen regulären Ausdruck (der jede Seite erfasst, die ein bestimmtes Wort enthält) bis zu einem auf maschinellem Lernen basierenden Klassifikationsmodell reichen. ACHE kann außerdem automatisch lernen, wie Links priorisiert werden, um relevante Inhalte effizient zu finden und das Abrufen irrelevanter Inhalte zu vermeiden.

ACHE unterstützt viele Funktionen, wie zum Beispiel:

  • Regelmäßiges Crawlen einer festen Liste von Websites
  • Entdeckung und Crawling neuer relevanter Websites durch automatische Link-Priorisierung
  • Konfiguration verschiedener Arten von Seitenklassifikatoren (maschinelles Lernen, Regex usw.)
  • Kontinuierliches erneutes Crawlen von Sitemaps, um neue Seiten zu entdecken
  • Indizierung gecrawlter Seiten mit Elasticsearch
  • Weboberfläche für die Echtzeitsuche nach gecrawlten Seiten
  • REST-API und webbasierte Benutzeroberfläche zur Crawler-Überwachung
  • Crawlen von versteckten Diensten mit TOR-Proxys

Lizenz

Ab Version 0.11.0 wird ACHE unter der Apache 2.0-Lizenz bereitgestellt. Frühere Versionen standen unter der GNU GPL-Lizenz.

Dokumentation

Weitere Informationen finden Sie in der Dokumentation des Projekts.

Installation

Sie können ACHE entweder aus dem Quellcode erstellen, die ausführbare Binärdatei mit conda herunterladen oder Docker verwenden, um ein Image zu erstellen und ACHE in einem Container auszuführen.

Aus dem Quellcode mit Gradle erstellen

Voraussetzung: Sie benötigen eine aktuelle Version von Java (JDK 8 oder neuer).

Um ACHE aus dem Quellcode zu erstellen, führen Sie die folgenden Befehle in Ihrem Terminal aus:

root@kitploit:~
git clone https://github.com/ViDA-NYU/ache.git
cd ache
./gradlew installDist

Dadurch wird ein Installationspaket unter ache/build/install/ erstellt. Anschließend können Sie den Befehl ache im Terminal verfügbar machen, indem Sie die ACHE-Binärdateien zur Umgebungsvariable PATH hinzufügen:

root@kitploit:~
export ACHE_HOME="{path-to-cloned-ache-repository}/ache/build/install/ache"
export PATH="$ACHE_HOME/bin:$PATH"

Ausführung mit Docker

Voraussetzung: Sie müssen eine aktuelle Version von Docker installieren. Einzelheiten zur Installation von Docker für Ihre Plattform finden Sie unter https://docs.docker.com/engine/installation/.

Wir veröffentlichen vorgefertigte Docker-Images für jede veröffentlichte Version auf Docker Hub. Sie können das neueste Image mit folgendem Befehl ausführen:

root@kitploit:~
docker run -p 8080:8080 vidanyu/ache:latest

Alternativ können Sie das Image selbst erstellen und ausführen:

root@kitploit:~
git clone https://github.com/ViDA-NYU/ache.git
cd ache
docker build -t ache .
docker run -p 8080:8080 ache

Die Dockerfile legt zwei Datenvolumes frei, sodass Sie ein Verzeichnis mit Ihren Konfigurationsdateien (unter /config) einbinden und die vom Crawler gespeicherten Daten (unter /data) nach dem Stoppen des Containers erhalten können.

Herunterladen mit Conda

Voraussetzung: Sie müssen den Conda-Paketmanager auf Ihrem System installiert haben.

Wenn Sie Conda verwenden, können Sie ache von Anaconda Cloud mit folgendem Befehl installieren:

root@kitploit:~
conda install -c vida-nyu ache

HINWEIS: Nur veröffentlichte, getaggte Versionen werden in Anaconda Cloud veröffentlicht. Die über Conda verfügbare Version ist daher möglicherweise nicht aktuell. Wenn Sie die neueste Version ausprobieren möchten, klonen Sie bitte das Repository und erstellen Sie aus dem Quellcode oder verwenden Sie die Docker-Version.

Ausführung von ACHE

Bevor Sie einen Crawl starten, müssen Sie eine Konfigurationsdatei mit dem Namen ache.yml erstellen. Wir stellen einige Konfigurationsbeispiele im Verzeichnis config des Repositorys bereit, die Ihnen den Einstieg erleichtern.

Sie benötigen außerdem eine Konfigurationsdatei für den Seitenklassifikator mit dem Namen pageclassifier.yml. Einzelheiten zur Konfiguration eines Seitenklassifikators finden Sie in der Dokumentation zu Seitenklassifikatoren.

Nachdem Sie einen Klassifikator konfiguriert haben, benötigen Sie als Letztes eine Seed-Datei, d. h. eine Textdatei mit einer URL pro Zeile. Der Crawler verwendet diese URLs, um den Crawl zu starten.

Schließlich können Sie den Crawler mit dem folgenden Befehl starten:

root@kitploit:~
ache startCrawl -o <data-output-path> -c <config-path> -s <seed-file> -m <model-path>

wobei

  • <configuration-path> der Pfad zum Konfigurationsverzeichnis ist, das ache.yml enthält.
  • <seed-file> die Seed-Datei ist, die die Seed-URLs enthält.
  • <model-path> der Pfad zum Modellverzeichnis ist, das die Datei pageclassifier.yml enthält.
  • <data-output-path> der Pfad zum Datenausgabeverzeichnis ist.

Beispiel für die Ausführung von ACHE mit dem Beispiel eines vortrainierten Seitenklassifikator-Modells und der Beispiel-Seed-Datei, die im Repository verfügbar sind:

root@kitploit:~
ache startCrawl -o output -c config/sample_config -s config/sample.seeds -m config/sample_model

Der Crawler wird ausgeführt und die Protokolle werden auf der Konsole angezeigt. Drücken Sie Ctrl+C, um ihn jederzeit zu stoppen (dies kann einige Zeit dauern). Bei langen Crawls sollten Sie ACHE mit einem Tool wie nohup im Hintergrund ausführen.

Datenformate

ACHE kann Daten in mehreren Formaten ausgeben. Die derzeit verfügbaren Datenformate sind:

  • FILES (Standard) – Rohinhalt und Metadaten werden in rolling komprimierten Dateien fester Größe gespeichert.
  • ELASTICSEARCH – Rohinhalt und Metadaten werden in einem ElasticSearch-Index indiziert.
  • KAFKA – Sendet Rohinhalt und Metadaten an ein Apache Kafka-Thema.
  • WARC – Speichert Daten im Standardformat, das vom Web Archive und Common Crawl verwendet wird.
  • FILESYSTEM_HTML – Nur der rohe Seiteninhalt wird als Klartextdateien gespeichert.
  • FILESYSTEM_JSON – Rohinhalt und Metadaten werden im JSON-Format in Dateien gespeichert.
  • FILESYSTEM_CBOR – Rohinhalt und einige Metadaten werden im CBOR-Format in Dateien gespeichert.

Weitere Informationen zur Konfiguration von Datenformaten finden Sie auf der Seite Dokumentation zu Datenformaten.

Fehlerberichte und Fragen

Wir freuen uns über Ihr Feedback. Bitte reichen Sie Vorschläge, Fragen oder Fehlerberichte über den Github Issue Tracker ein.

Wir haben auch einen Chatroom auf Gitter.

Mitwirken

Codebeiträge sind willkommen. Wir verwenden einen Codestil, der vom Google Style Guide abgeleitet ist, jedoch mit 4 Leerzeichen für Tabs. Eine Eclipse-Formatter-Konfigurationsdatei ist im Repository verfügbar.

Kontakt

  • Aécio Santos [[email protected]]
  • Kien Pham [[email protected]]
Tool herunterladen