Skip to content
KitploitKITPLOIT
ツールエクスプロイトブログ
Log in
提出
ツールエクスプロイトブログ
提出

ハッキング、侵入テスト、サイバーセキュリティツールをあなたのセキュリティアーセナルに!

Kitploitはハッキング、サイバーセキュリティ、ペネトレーションテストのツールディレクトリです。最新のプロジェクトアップデートを見つけて、脆弱性の発見、システム分析、テストの自動化、セキュリティの強化を行いましょう。

フィードお問い合わせプライバシー© 2026 Kitploit

ツールディレクトリ

カテゴリ

すべてのカテゴリを見る
Loading categories
SLDR — LLMの悪意あるファインチューニングを、選択的レイヤー復元と動的ルーティングを用いて軽減する防御フレームワーク。トレーニング、有害性スコアリング、ジェイルブレイク評価スクリプトを備える。 | Kitploit
ツール/GitHubGitHub/stardust457/sldr
防御ツール機械学習論文と研究AIセキュリティ敵対的攻撃
GitHubstardust457/sldr

SLDR

LLMの悪意あるファインチューニングを、選択的レイヤー復元と動的ルーティングを用いて軽減する防御フレームワーク。トレーニング、有害性スコアリング、ジェイルブレイク評価スクリプトを備える。

リポジトリを見る
27日前未レビュー

人気

すべて見る →

コミュニティで最も使われているツールを見つけましょう。

すべてのツールを探索

ツールコレクションを閲覧

すべてのツールを見る →
共有

[NeurIPS 2026] SLDR: 選択的レイヤー復元と動的ルーティングによる悪意のあるファインチューニングへの防御

🔧 環境セットアップ

リポジトリをクローンし、Conda 環境を作成してアクティベートした後、必要な依存関係をインストールします:

git clone https://github.com/Stardust457/SLDR.git
cd SLDR

conda create -n sldr python=3.12 -y

conda activate sldr

python -m pip install --upgrade pip

python -m pip install -r requirements.txt

🔑 Llama モデルへのアクセスとダウンロード

Llama モデルは Hugging Face でのアクセス申請が必要です。

モデルを使用する前に、Hugging Face にログインし、Meta Llama 配下の目的のモデルページにアクセスして利用規約に同意し、アクセス申請を提出してください。アクセスが承認されたら、同じアカウントを使用して、Access Tokens 設定ページで対象モデルへの読み取りアクセス権を持つ Access Token を作成します。詳細については、Hugging Face ゲート付きモデルガイドを参照してください。

まず、Bash ターミナルで HF-Mirror を設定します:

export HF_ENDPOINT="https://hf-mirror.com"

次に、以下のコマンドを実行してログインします:

hf auth login

プロンプトが表示されたら、新しく作成した Hugging Face Access Token を入力してください。


🚀 トレーニングと評価

リポジトリのルートから以下のコマンドを実行して、各モデルのトレーニングと評価を行います:

Llama 3.1

bash scripts/run_llama31_downstream.sh

Llama 3

bash scripts/run_llama3_downstream.sh

Qwen 2.5

bash scripts/run_qwen25_downstream.sh

Mistral

bash scripts/run_mistral_downstream.sh

Llama Guard のデプロイと有害性スコアリング

モデルの応答を収集した後、Llama Guard をデプロイし、ターミナルでサービスを起動します:

bash scripts/run_llama_guard.sh serve

このターミナルは実行したままにし、サービスが準備完了になるまで待ちます。その後、別のターミナルを開き、sldr 環境をアクティベートして、リポジトリのルートから以下のコマンドを実行し、モデル応答の有害性をスコアリングします:

bash scripts/run_llama_guard.sh score

⚠️ 重要な注意:Alpaca 評価

Alpaca データセットで Llama 3.1 の評価を実行する前に、同じターミナルで GPT ジャッジの API ベース URL と API キーを設定してください:

export GPT_JUDGE_BASE_URL='your base url'
export OPENAI_API_KEY='your API key'

評価を開始する前に、プレースホルダーを実際の API ベース URL と API キーに置き換えてください。

追加の有害ベンチマーク評価

対応する下流チェックポイントを生成した後、以下のコマンドを実行して、DirectHarm4、HarmBench、HEx-PHI を含む追加の有害ベンチマークで Llama 3.1 を評価します:

DATASETS="sst2" \
POISON_RATIOS="0.1" \
SEEDS="42" \
VARIANTS="defended" \
bash /root/scripts/run_llama31_harm_benchmarks.sh

Zulu および IJP ジェイルブレイク評価

対応する下流チェックポイントを使用して、Zulu および IJP ジェイルブレイク攻撃に対して Llama 3.1 を評価するには、以下のコマンドを実行します:

DATASETS="sst2" \
POISON_RATIOS="0.1" \
TRAIN_SAMPLES="1000" \
SEEDS="42" \
VARIANTS="defended" \
JAILBREAK_ATTACKS="zulu ijp" \
bash /root/scripts/run_llama31_jailbreak.sh

注意: Zulu データセット用に生成されたモデル応答は、Llama Guard を使用して有害性を評価する前に英語に翻訳する必要があります。


ツールをダウンロード