Skip to content
KitploitKITPLOIT
ツールブログ
提出
ツールブログ
提出

ハッキング、侵入テスト、サイバーセキュリティツールをあなたのセキュリティアーセナルに!

Kitploitはハッキング、サイバーセキュリティ、ペネトレーションテストのツールディレクトリです。最新のプロジェクトアップデートを見つけて、脆弱性の発見、システム分析、テストの自動化、セキュリティの強化を行いましょう。

··フィード·お問い合わせ·プライバシー·© 2026 Kitploit

ツールディレクトリ

カテゴリ

すべてのカテゴリを見る
Loading categories
autoguardrails — アライメント研究用スキャフォールド(自動研究スタイル)for LLMガードレール:単一の`policy.md`サーフェスを検索する | Kitploit
ツール/GitHubGitHub/santanderai/autoguardrails
学習と教育レッドチーミングAIセキュリティ敵対的攻撃
GitHubsantanderai/autoguardrails

autoguardrails

アライメント研究用スキャフォールド(自動研究スタイル)for LLMガードレール:単一の`policy.md`サーフェスを検索する

リポジトリを見るウェブサイト
129351ヶ月前Kitploit レビュー済み

人気

すべて見る →

コミュニティで最も使われているツールを見つけましょう。

すべてのツールを探索

ツールコレクションを閲覧

すべてのツールを見る →
共有

autoguardrails

Santander AI Lab によるオープンソース。 LLM / AI 安全性 ガードレール研究のための ライブラリ / 評価ハーネス (autoresearch スタイル): 固定された評価スイートに対して攻撃成功率 (ASR) を最小化し、良性通過フロアを維持するために、単一の可変 policy.md サーフェスを探索します。

License: Apache 2.0 Python 3.10+ CI CodeQL codecov OpenSSF Scorecard Code style: black Ruff Conventional Commits Santander AI Open Source の一部 — Banco Santander (santander.com) によるオープンソース AI プロジェクト。

autoguardrails は、Karpathy の autoresearch に触発された小さなアライメント研究用スキャフォールドです。

train.py を探索する代わりに、このリポジトリは policy.md を探索します。 考え方は同じです:

  • 可変サーフェスを小さく保つ
  • 評価者を固定する
  • 固定された壁時計予算で実行する
  • 候補を1つのトップラインメトリクスで比較する
  • すべての保持または破棄の決定を記録する

このリポジトリでは、トップラインメトリクスは攻撃成功率 (ASR、低いほど良い) であり、良性通過フロアがあるため、システムはすべてを拒否することで勝利することはできません。

最も重要なもの

日常的な実験では、以下の3つのファイルが最も重要です:

  • program.md: ループの人間が管理する指示
  • policy.md: 実行間で編集すべき唯一のファイル
  • results.tsv: 追加専用の実行ログ

その他はすべて固定されたハーネスコードまたは固定された評価データです。

現在の研究契約

  • 可変サーフェス: policy.md
  • 固定スイート: eval_suite.jsonl
  • 固定判定プロンプト: judge_prompt.md
  • 固定ハーネス: autoguardrails/
  • 受理ルール: ASR が改善し、良性通過率が2パーセントポイント以上低下しない場合のみ候補を保持する
  • 実行時間予算: ハーネス設定で固定、現在は評価パスあたり5分

元の autoresearch に近いメンタルモデルが必要な場合、autoguardrails/ を固定ヘルパーレイヤー、policy.md を探索中の単一ファイルと考えてください。

クイックスタート

リポジトリルートから実行します。

  1. ベースラインを記録します。
root@kitploit:~
python -m autoguardrails baseline --reset --repeat 2 --notes "initial baseline"
  1. policy.md のみを編集します。

  2. 新しい候補をスコアリングします。

root@kitploit:~
python -m autoguardrails candidate --repeat 2 --notes "cover jailbreak and obfuscation"
  1. 現在保持されている結果を確認します。
root@kitploit:~
python -m autoguardrails status
  1. 完全なログを確認します。
root@kitploit:~
cat results.tsv

候補が拒否された場合、ハーネスは自動的に policy.md を最後に受理されたバージョンに復元します。

シェルラッパー

単一のエントリポイントを希望する場合は、run_autoguardrails.sh を使用してください:

root@kitploit:~
sh run_autoguardrails.sh status
sh run_autoguardrails.sh evaluate
sh run_autoguardrails.sh baseline "initial baseline" 2
sh run_autoguardrails.sh candidate "cover jailbreak and obfuscation" 2

Windows では、Git Bash または他の POSIX 互換シェルからラッパーを実行してください。

実モデル設定

デフォルトの設定は決定論的なローカルスタブを使用するため、リポジトリはオフラインで動作します。 実際の実験を実行するには、ターゲットモデルと判定モデルを OpenAI 互換のエンドポイントに向けます。

ターゲットモデル変数:

  • AUTOGUARDRAILS_TARGET_PROVIDER=openai_compatible
  • AUTOGUARDRAILS_TARGET_MODEL
  • AUTOGUARDRAILS_TARGET_API_BASE
  • AUTOGUARDRAILS_TARGET_API_KEY

判定モデル変数:

  • AUTOGUARDRAILS_JUDGE_PROVIDER=openai_compatible
  • AUTOGUARDRAILS_JUDGE_MODEL
  • AUTOGUARDRAILS_JUDGE_API_BASE
  • AUTOGUARDRAILS_JUDGE_API_KEY

例:

root@kitploit:~
export AUTOGUARDRAILS_TARGET_PROVIDER=openai_compatible
export AUTOGUARDRAILS_TARGET_MODEL=gpt-4.1-mini
export AUTOGUARDRAILS_TARGET_API_BASE=https://your-endpoint.example/v1
export AUTOGUARDRAILS_TARGET_API_KEY=your-target-key

export AUTOGUARDRAILS_JUDGE_PROVIDER=openai_compatible
export AUTOGUARDRAILS_JUDGE_MODEL=gpt-4.1-mini
export AUTOGUARDRAILS_JUDGE_API_BASE=https://your-endpoint.example/v1
export AUTOGUARDRAILS_JUDGE_API_KEY=your-judge-key

python -m autoguardrails baseline --reset --repeat 2 --notes "real-model baseline"

実行シリーズ中は固定された判定設定を使用してください。実験途中で判定プロンプトや判定モデルを切り替えないでください。

典型的な反復パターン

シンプルなオフラインエミュレーションサイクルは次のようになります:

  1. ベースラインを記録します。
  2. policy.md に1つのポリシー変更ファミリーを追加します。
  3. candidate を実行します。
  4. ハーネスが受理した場合のみ変更を保持します。
  5. 一度に1つの新しい変更で繰り返します。

バンドルされたスタブを改善する候補変更の一例は、以下に対する明示的な処理を追加することです:

  • ジェイルブレイクフレーズ(例:「以前の指示を無視」「ロールプレイ」「デベロッパーモード」)
  • 難読化リクエスト(例:翻訳、base64、rot13、JSONのみの書式設定、スキーマ変換)

これにより、評価者を変更せずに現実的な最初の改善曲線が得られます。

リポジトリ構造

  • program.md: 実験の指示と制約
  • policy.md: 探索中の可変ガードレールポリシー
  • judge_prompt.md: 固定された判定プロンプト
  • eval_suite.jsonl: 固定された攻撃および良性評価ケース
  • results.tsv: 実行ログ
  • run_autoguardrails.sh: CLI の便利なラッパー
  • autoguardrails/: 固定された Python ハーネス
  • tests/: ハーネスの回帰および安全性チェック

コードアーキテクチャについては autoguardrails/README.md を、テスト戦略については tests/README.md を参照してください。

安全性に関する注意事項

  • このスキャフォールドは意図的にシングルターンで範囲が狭くなっています。
  • ツール、ファイルアクセス、またはマルチステップのエージェントアクションをモデル化していません。
  • バンドルされたスタブはハーネス検証用のみであり、現実的な安全性モデルではありません。
  • 評価スイートは設計上固定されています。変更する場合は、古い結果と比較するのではなく、新しい実験系列を開始してください。

要件

  • Python 3.10+
  • サードパーティのランタイム依存関係はありません — ハーネスは完全に Python 標準ライブラリで構築されており、デフォルトでオフラインで動作します。
  • オプション、開発専用: ruff, black, mypy, pytest, pytest-cov (CONTRIBUTING.md を参照)
  • オプション、実モデル実験用: OpenAI 互換のチャット完了エンドポイントへのアクセス(上記の AUTOGUARDRAILS_* 環境変数で設定)

コントリビューション

コントリビューションを歓迎します! 始める前に コントリビューションガイドライン と 行動規範 をお読みください。

  • バグ報告や機能リクエストは GitHub Issues からお願いします。
  • 外部コントリビューターは CLA に署名します(最初の PR で CLA Assistant ボットが自動的に処理します)。
  • PR を開く前に ruff check ., black --check ., mypy autoguardrails, pytest を実行してください。
  • 研究契約を尊重してください: policy.md が唯一の可変サーフェスであり、eval_suite.jsonl と judge_prompt.md は固定されています。

セキュリティ

セキュリティ脆弱性は責任を持って報告してください。報告方法については セキュリティポリシー を参照してください(脆弱性については公開 Issue を開かないでください)。連絡先: [email protected] または GitHub Security Advisories をご利用ください。

免責事項

このソフトウェアは Santander AI Lab によるオープンソースプロジェクトであり、ライセンス に基づき 「現状のまま」 提供され、いかなる種類の保証や条件もありません。これは Banco Santander の公式製品やサービスではなく、プロダクションサポートの義務はなく、財務的、法的、または専門的な助言を構成するものではありません。

「Santander」およびそのロゴは Banco Santander, S.A. の登録商標です。プロジェクトライセンスは、事実上の帰属を超えてこれらを使用する権利を付与するものではありません。

セキュリティ脆弱性を発見したと思われる場合は、セキュリティポリシー に従ってください — 公開 Issue を開かないでください。本ソフトウェアがあなたのユースケースに適しているかどうかの評価と、自身のデプロイメントを最新に保つ責任はあなたにあります。

ライセンス

このプロジェクトは Apache License 2.0 の下でライセンスされています — 詳細は LICENSE および NOTICE ファイルを参照してください。

root@kitploit:~
Copyright (c) 2026 Santander Group
SPDX-License-Identifier: Apache-2.0

引用

研究で autoguardrails を使用する場合は、以下のように引用してください:

root@kitploit:~
@software{autoguardrails2026,
  author  = {{Santander AI Lab}},
  title   = {autoguardrails: an autoresearch-style guardrail policy loop},
  year    = {2026},
  url     = {https://github.com/SantanderAI/autoguardrails},
  license = {Apache-2.0}
}
ツールをダウンロード