Skip to content
KitploitKITPLOIT
ツールブログ
提出
ツールブログ
提出

ハッキング、侵入テスト、サイバーセキュリティツールをあなたのセキュリティアーセナルに!

Kitploitはハッキング、サイバーセキュリティ、ペネトレーションテストのツールディレクトリです。最新のプロジェクトアップデートを見つけて、脆弱性の発見、システム分析、テストの自動化、セキュリティの強化を行いましょう。

··フィード·お問い合わせ·プライバシー·© 2026 Kitploit

ツールディレクトリ

カテゴリ

すべてのカテゴリを見る
Loading categories
ache — フォーカス型Webクローラは、ページ分類器とリンク優先順位付けを使用して、ドメイン固有またはパターンマッチングのWebページを効率的に収集し、Elasticsearchインデックス作成とTORプロキシクローリングをサポートしています。 | Kitploit
ツール/GitHubGitHub/vida-nyu/ache
OSINT (オープンソースインテリジェンス)情報収集機械学習クローラー
GitHubvida-nyu/ache

ache

フォーカス型Webクローラは、ページ分類器とリンク優先順位付けを使用して、ドメイン固有またはパターンマッチングのWebページを効率的に収集し、Elasticsearchインデックス作成とTORプロキシクローリングをサポートしています。

リポジトリを見るウェブサイト
48613711ヶ月前Kitploit レビュー済み

人気

すべて見る →

コミュニティで最も使われているツールを見つけましょう。

すべてのツールを探索

ツールコレクションを閲覧

すべてのツールを見る →
共有

Build Status Docker Build Documentation Status License

ACHE フォーカスクローラー

ACHE はフォーカス型 Web クローラーです。特定の基準(例:特定のドメインに属するページ、ユーザー指定のパターンを含むページ)を満たす Web ページを収集します。 ACHE は、特定のドメイン内で関連ページと非関連ページを区別するために ページ分類器 を使用する点で、汎用クローラーとは異なります。ページ分類器は、単純な正規表現(例えば特定の単語を含むすべてのページに一致するもの)から、機械学習ベースの分類モデルまで様々です。 ACHE はまた、関連コンテンツを効率的に見つけながら、無関係なコンテンツの取得を回避するために、リンクの優先順位を自動的に学習することもできます。

ACHE は以下のような多くの機能をサポートしています:

  • 固定された Web サイトリストの定期的なクローリング
  • 自動リンク優先順位付けによる新しい関連 Web サイトの発見とクローリング
  • さまざまなタイプのページ分類器(機械学習、正規表現など)の設定
  • サイトマップの継続的な再クローリングによる新しいページの発見
  • Elasticsearch を使用したクロール済みページのインデックス作成
  • クロール済みページをリアルタイムで検索するための Web インターフェース
  • クローラーモニタリングのための REST API および Web ベースのユーザーインターフェース
  • TOR プロキシを使用した隠れサービスのクローリング

ライセンス

バージョン 0.11.0 以降、ACHE は Apache 2.0 ライセンスの下で提供されています。 以前のバージョンは GNU GPL ライセンスの下で提供されていました。

ドキュメント

詳細については、プロジェクトの ドキュメント を参照してください。

インストール

ソースコードから ACHE をビルドする、conda を使用して実行可能バイナリをダウンロードする、または Docker を使用してイメージをビルドしコンテナ内で ACHE を実行する、のいずれかの方法でインストールできます。

Gradle でソースからビルド

前提条件: 最新バージョンの Java(JDK 8 以降)をインストールする必要があります。

ソースから ACHE をビルドするには、ターミナルで以下のコマンドを実行します:

root@kitploit:~
git clone https://github.com/ViDA-NYU/ache.git
cd ache
./gradlew installDist

これにより、ache/build/install/ の下にインストールパッケージが生成されます。 その後、ACHE バイナリを PATH 環境変数に追加することで、ターミナルで ache コマンドを使用できるようになります。

root@kitploit:~
export ACHE_HOME="{path-to-cloned-ache-repository}/ache/build/install/ache"
export PATH="$ACHE_HOME/bin:$PATH"

Docker を使用した実行

前提条件: 最新バージョンの Docker をインストールする必要があります。インストール方法の詳細は https://docs.docker.com/engine/installation/ を参照してください。

リリースされた各バージョンのビルド済み Docker イメージを Docker Hub で公開しています。 最新イメージは以下のコマンドで実行できます。

root@kitploit:~
docker run -p 8080:8080 vidanyu/ache:latest

または、自分でイメージをビルドして実行することもできます。

root@kitploit:~
git clone https://github.com/ViDA-NYU/ache.git
cd ache
docker build -t ache .
docker run -p 8080:8080 ache

Dockerfile は 2 つのデータボリュームを公開しており、設定ファイルのディレクトリ(/config)をマウントし、コンテナ停止後もクローラーの保存データ(/data)を保持できます。

Conda でダウンロード

前提条件: システムに Conda パッケージマネージャーがインストールされている必要があります。

Conda を使用している場合、以下のコマンドで Anaconda Cloud から ache をインストールできます。

root@kitploit:~
conda install -c vida-nyu ache

注: Anaconda Cloud に公開されるのはリリースタグが付けられたバージョンのみであるため、Conda で利用可能なバージョンは最新でない可能性があります。 最新バージョンを試したい場合は、リポジトリをクローンしてソースからビルドするか、Docker バージョンを使用してください。

ACHE の実行

クロールを開始する前に、ache.yml という名前の設定ファイルを作成する必要があります。 リポジトリの config ディレクトリには、開始に役立ついくつかの設定サンプルが用意されています。

また、pageclassifier.yml という名前のページ分類器設定ファイルも必要です。 ページ分類器の設定方法の詳細については、ページ分類器のドキュメント を参照してください。

分類器を設定した後、最後に必要なのはシードファイル、つまり 1 行に 1 つの URL が含まれるプレーンテキストファイルです。クローラーはこれらの URL を使用してクロールを開始します。

最後に、以下のコマンドを使用してクローラーを起動できます。

root@kitploit:~
ache startCrawl -o <data-output-path> -c <config-path> -s <seed-file> -m <model-path>

ここで、

  • <configuration-path> は ache.yml を含む設定ディレクトリへのパスです。
  • <seed-file> はシード URL を含むシードファイルです。
  • <model-path> は pageclassifier.yml ファイルを含むモデルディレクトリへのパスです。
  • <data-output-path> はデータ出力ディレクトリへのパスです。

リポジトリにあるサンプルの 事前学習済みページ分類器モデル とサンプル シードファイル を使用した ACHE の実行例:

root@kitploit:~
ache startCrawl -o output -c config/sample_config -s config/sample.seeds -m config/sample_model

クローラーが実行され、ログがコンソールに出力されます。任意の時点で Ctrl+C を押して停止します(少し時間がかかる場合があります)。 長時間のクロールの場合は、nohup などのツールを使用して ACHE をバックグラウンドで実行する必要があります。

データ形式

ACHE は複数の形式でデータを出力できます。現在利用可能なデータ形式は以下の通りです。

  • FILES(デフォルト)- 生のコンテンツとメタデータは、固定サイズのロール圧縮ファイルに保存されます。
  • ELASTICSEARCH - 生のコンテンツとメタデータは ElasticSearch インデックスにインデックス化されます。
  • KAFKA - 生のコンテンツとメタデータを Apache Kafka トピックにプッシュします。
  • WARC - Web アーカイブおよび Common Crawl で使用される標準形式でデータを保存します。
  • FILESYSTEM_HTML - 生のページコンテンツのみがプレーンテキストファイルに保存されます。
  • FILESYSTEM_JSON - 生のコンテンツとメタデータは JSON 形式でファイルに保存されます。
  • FILESYSTEM_CBOR - 生のコンテンツといくつかのメタデータは CBOR 形式でファイルに保存されます。

データ形式の設定方法の詳細については、データ形式のドキュメント ページを参照してください。

バグ報告と質問

ユーザーからのフィードバックを歓迎します。提案、質問、バグ報告は Github のイシュートラッカー を使用して送信してください。

また、Gitter にチャットルームがあります。

貢献

コードの貢献を歓迎します。コードスタイルは Google スタイルガイド に基づいていますが、タブには 4 スペースを使用します。Eclipse フォーマッター設定ファイルが リポジトリ にあります。

連絡先

  • Aécio Santos [[email protected]]
  • Kien Pham [[email protected]]
ツールをダウンロード