Skip to content
KitploitKITPLOIT
ツールブログ
Log in
提出
ツールブログ
提出

ハッキング、侵入テスト、サイバーセキュリティツールをあなたのセキュリティアーセナルに!

Kitploitはハッキング、サイバーセキュリティ、ペネトレーションテストのツールディレクトリです。最新のプロジェクトアップデートを見つけて、脆弱性の発見、システム分析、テストの自動化、セキュリティの強化を行いましょう。

··フィード·お問い合わせ·プライバシー·© 2026 Kitploit

ツールディレクトリ

カテゴリ

すべてのカテゴリを見る
Loading categories
D-Scan — LLMの内部状態と100以上のアテンション/確率特徴量を分析し、RAGシステムにおけるドキュメントポイズニング攻撃を検出する分類器を訓練します。 | Kitploit
ツール/GitHubGitHub/yingtaoren/d-scan
防御ツール機械学習AIセキュリティ異常検知
GitHubyingtaoren/d-scan

D-Scan

LLMの内部状態と100以上のアテンション/確率特徴量を分析し、RAGシステムにおけるドキュメントポイズニング攻撃を検出する分類器を訓練します。

リポジトリを見る
122120日前未レビュー

人気

すべて見る →

コミュニティで最も使われているツールを見つけましょう。

すべてのツールを探索

ツールコレクションを閲覧

すべてのツールを見る →
共有

コンテキストが牙をむくとき:文書レベルの注意崩壊によるRAGポイズニングの検出

D-SCANは、RAG(Retrieval-Augmented Generation)システムにおける文書ポイズニング攻撃を検出するための分析フレームワークです。生成中にLLMの内部状態(トークン確率と注意重み)を収集し、多次元特徴量を抽出し、クリーンな検索文書とポイズニングされた検索文書を区別する分類器を訓練します。

1. インストールと要件

前提条件

  • Python >= 3.9
  • CUDA対応GPU(8Bパラメータモデルの推論には24GB以上のVRAMを推奨)

モデルの準備

このプロジェクトはデフォルトで Llama-3.1-8B-Instruct を使用します。モデルをローカルパスにダウンロードし、collect_inner_state.py 内の MODEL_ID 変数を更新してください:

MODEL_ID = "/your/path/to/Llama-3.1-8B-Instruct"

2. クイックスタート

ワークフロー全体は3つのステップで構成されています:内部状態の収集 → 特徴量の計算 → 分類器の訓練。 質問と関連する検索文書は https://huggingface.co/datasets/An998/D-SCAN で提供されています。

ステップ1:モデル内部状態の収集

# Update configuration parameters in collect_inner_state.py, then run
python collect_inner_state.py

ステップ2:特徴量メトリクスの計算

# Analyze both attack and clean data, compute all features, and save results
python compute_feature.py \
    --attack_dir ./saved_reppl_weights_serial_query1_attack2_2wiki \
    --clean_dir ./saved_reppl_weights_serial_query1_pure1_5_2wiki \
    --output_dir ./analysis_results/2wiki_all \
    --max_attack_samples 3000 \
    --max_clean_samples 3000

ステップ3:分類器の訓練と評価

fit_D-SCAN.ipynb を開き、セルを順番に実行して以下を行います:

  1. ステップ2で生成された特徴量データを読み込む
  2. ロジスティック回帰/ランダムフォレスト分類器を訓練する(5分割交差検証)
  3. テストセットでの転移性能を評価する

3. パイプラインの詳細

3.1 データ収集(collect_inner_state.py)

各質問-文書入力に対して、LLMはマルチサンプル生成(デフォルト:10サンプル、temperature=1.0)を実行し、以下の内部状態を収集します:

フィールド型説明
outer_ppl_probsList[Tensor]各サンプルのトークン生成確率
inner_ppl_matrixList[List[Tensor]]各生成ステップにおける入力シーケンスに対する注意重み(層平均)
doc_rangesDict[str, List[int]]入力シーケンス内の各文書のトークン位置範囲
generated_sequencesList[List[int]]各サンプルの生成トークンIDシーケンス

主要な設定パラメータ

MODEL_ID = "/path/to/model"     # Model path
NUM_SAMPLES = 10                # Number of samples per question
MAX_NEW_TOKENS = 50             # Maximum generated tokens
TEMPERATURE = 1.0               # Sampling temperature
data_type = 'pure1_5'           # Data type: 'pure1_5' (clean) or 'attack2' (attack)
dataset_name = 'hotpotqa'       # Dataset: 'hotpotqa', '2wiki', 'musique'

出力は data_{batch_id}_reppl.pt ファイルと results_stats_*.jsonl 統計ファイルとして保存されます。


3.2 特徴量計算(compute_feature.py)

収集された内部状態から10カテゴリ、100次元以上の特徴量を抽出します。分類器はこれらの特徴量を用いて、特定のクエリに対して検索された文書の中にポイズニングされた文書が存在するかどうかを判定します。

メトリクスの概要

#カテゴリクラス名特徴量数核心的な考え方
1生成確率統計PerplexityMetrics8ポイズニングされた文書は生成中のモデルの不確実性を増加させ、確率分布の変化に反映される可能性がある
2注意エントロピーAttentionEntropyMetrics4高エントロピー=注意の分散=矛盾する情報の可能性;低エントロピー=注意の集中
3注意集中度AttentionConcentrationMetrics8Top-K比率とジニ係数により、注意が少数のトークンに集中しているかを測定
4文書注意密度DocumentAttentionDensityMetrics6注意の合計を文書長で割ることで、注意配分における長さバイアスを排除
5マルチサンプル一貫性SampleConsistencyMetrics4ポイズニング下では、サンプル間の注意パターンが一貫しない可能性がある(コサイン類似度、JSダイバージェンス)
6注意ダイナミクスAttentionDynamicsMetrics4生成中の支配的文書の切り替え頻度とエントロピー変化量
7トークンレベル注意変動TokenLevelAttentionMetrics16生成ステップ間における各入力トークン位置の注意の安定性(標準偏差、エントロピー)
8回答確率詳細統計AnswerProbabilityMetrics18確率分位点、高/低確率トークン比率、対数確率、パープレキシティなど
9確率ダイナミクスProbabilityDynamicsMetrics14生成シーケンスにおけるトレンド傾き、自己相関、ボラティリティ、スパイク比率
10サンプル間確率一貫性CrossSampleProbabilityConsistencyMetrics13サンプル間のコサイン類似度、ピアソン相関、MSE、ダイバージェンス指数

メトリクスの詳細説明

1. PerplexityMetrics(生成確率統計)

outer_ppl_probs(各生成トークンの確率)から計算:

  • ppl_mean_prob:全生成トークンの平均確率
  • ppl_std_prob:確率の標準偏差
  • ppl_min_prob:最小確率(極度の不確実性)
  • ppl_low_prob_ratio:低確率トークン(<0.1)の比率
  • ppl_cross_sample_var:サンプル間の平均確率の分散
  • ppl_coef_variation:変動係数(CV = std/mean)
  • ppl_skewness:確率分布の歪度
  • ppl_kurtosis:確率分布の尖度

2. AttentionEntropyMetrics(注意エントロピー)

inner_ppl_matrix(各ステップの注意重み)から計算:

  • attn_entropy_mean/std/max:注意分布エントロピーの平均、標準偏差、最大値
  • attn_entropy_cv:注意エントロピーの変動係数

3. AttentionConcentrationMetrics(注意集中度)

  • attn_top5/10/20_ratio_mean/std:Top-K%のトークンが占める注意の割合
  • attn_gini_mean/std:注意分布のジニ係数(不平等度の指標)

4. DocumentAttentionDensityMetrics(文書注意密度)

  • doc_attn_dens_std/range/max/min:文書間の注意密度の標準偏差、範囲、最大値、最小値
  • doc_attn_dens_entropy:文書注意密度分布のエントロピー
  • doc_attn_dens_temporal_var_mean:文書注意密度の時間分散の平均

5. SampleConsistencyMetrics(マルチサンプル一貫性)

  • sample_attn_consistency/std:トークンレベル注意のサンプル間コサイン類似度
  • sample_doc_consistency:文書レベル注意のサンプル間コサイン類似度
  • sample_doc_js_divergence:文書レベル注意のサンプル間JSダイバージェンス

6. AttentionDynamicsMetrics(注意ダイナミクス)

  • attn_doc_switch_mean/max:支配的文書の切り替え回数
  • attn_entropy_change_mean/std:ステップごとの注意エントロピー変化

7. TokenLevelAttentionMetrics(トークンレベル注意変動)

  • tla_std_mean/std/max/median/p90/p99/high_ratio/cv:生成ステップ間におけるトークンごとの注意標準偏差の統計量
  • tla_ent_mean/std/max/median/p90/p99/high_ratio/cv:生成ステップ間におけるトークンごとの注意エントロピーの統計量

8. AnswerProbabilityMetrics(回答確率詳細統計)

  • aprob_p10/p25/p50/p75/p90/iqr:確率分位点
  • aprob_high_ratio_05/08:高確率トークンの比率
  • aprob_low_ratio_01/001:低確率トークンの比率
  • aprob_log_mean/std/min:対数確率の統計量
  • aprob_ppl_mean/std/max:シーケンスレベルのパープレキシティ
  • aprob_geometric_mean:確率の幾何平均
  • aprob_distribution_entropy:確率ヒストグラムの情報エントロピー

9. ProbabilityDynamicsMetrics(確率ダイナミクス)

  • pdyn_diff_mean/abs_diff_mean/abs_diff_std/abs_diff_max:確率差の統計量
  • pdyn_max_drop/max_jump:単一ステップの最大下落/上昇
  • pdyn_volatility_mean/std:ボラティリティ
  • pdyn_trend_slope_mean/std:線形トレンドの傾き
  • pdyn_autocorr_mean/std:自己相関係数
  • pdyn_spike_ratio_01/03:スパイク(変異点)比率

10. CrossSampleProbabilityConsistencyMetrics(サンプル間確率一貫性)

  • cspc_mean_prob_std/cv/range:サンプル間の平均確率の一貫性
  • cspc_ppl_std/cv/range:サンプル間のパープレキシティの一貫性
  • cspc_min_prob_std/range:最小確率の一貫性
  • cspc_seq_cosine_mean/std:確率シーケンスのサンプル間コサイン類似度
  • cspc_seq_pearson_mean:確率シーケンスのサンプル間ピアソン相関
  • cspc_seq_mse_mean:確率シーケンスのサンプル間MSE
  • cspc_divergence_index:サンプル間ダイバージェンス指数

compute_feature.py のコマンドライン引数

python compute_feature.py \
    --attack_dir <attack_data_directory> \
    --clean_dir <clean_data_directory> \
    --output_dir <output_directory> \
    --max_attack_samples 3000 \
    --max_clean_samples 3000 \
    --min_correct_count 0 \
    --min_attack_target_count 0 \
    --num_use_samples 10 \
    --model_path /path/to/model    # Optional: load tokenizer for accuracy calculation
ツールをダウンロード