#1MLベースのセキュリティツール、敵対的機械学習、AI駆動のサイバー防御。
Kitploit おすすめ

ツールを使用するLLMエージェントパイプラインにおいて、プロンプトインジェクション防御がどこで発火するかを測定するベンチマークハーネス。公開、永続化、中継、実行の各段階にわたってカナリートークンを追跡する。

AI、LLM、ロボティクス、データサイエンス、機械学習、深層学習(ただしこれらに限定されない)におけるPythonのRCE経路と深いデシリアライゼーションチェーンを発見するための、エージェント型LLM駆動の関係マッピングを備えたASTベースの静的コードアナライザー。

RLベースのプロンプトインジェクションレッドチーミング向けのオープンフレームワーク。共有トレーナー、カリキュラム学習、およびAgentDojo、InjecAgent、PIArenaなどのベンチマークを備えています。

進化的LLMジェイルブレイクおよびガードレールフレームワーク。遺伝的変異、マルコフ選択、オンライン敵対的トレーニングにより、再利用可能な戦略プールを成長させ、安全性評価を行う。

LLMベースのエージェントに対するエージェント型ジェイルブレイクフレームワーク。スキームベースのタスク分解、マルチターンの偽装戦略、適応的な自己進化を用いて、新たに生じるセキュリティリスクを探る。

プロンプトインジェクション攻撃に対する防御のためのオープンウェイトLLMとトレーニング/評価コード。エージェント型ツール呼び出しと指示追従のセキュリティに関するベンチマーク付き。

深層学習のレイテンシ、エネルギー・レイテンシ、およびタイミング(可用性)攻撃と防御のキュレーションされたインデックス — ACM Computing Surveys 投稿のコンパニオン。

LLMエージェントがマルチモーダルスキル画像に隠された悪意のある指示に抵抗できるかをテストするベンチマークおよび評価ハーネス。5つのリスクカテゴリにわたる108件のケースとASR/TSRスコアリングを備える。

敵対的画像摂動ツール。SAMセグメンテーションとCLIPモデルを使用して、セキュリティ研究のためにAIベースの詐欺画像分類器を回避する。


DNS Proxy that is simple and fast with not so simple features. Focused on routed DNS forwarding, filtering and parental control.

バイナリ、ソース、スクリプト向けの0-dayマルウェア検出(イマイチじゃないやつ)

AIアラインメントの失敗を検出するためのベンチマークスイートとコード。10種類の失敗タイプにわたる44のベンチマークと、7,193件のラベル付きインスタンスで評価されたゼロショットRLCD検出器を含む。

音声言語モデルを凍結したまま、推論時に音声ジェイルブレイクをブロックするための中間層リスクゲートと後段層セーフティアダプタを追加する防御フレームワーク。

スパイキングニューラルネットワークに対する時間的トリガーバックドア攻撃であるT-Backdoorを実装した研究コード。空間的摂動を用いず、rate、latency、jitterトリガーを利用する。

深層学習システム向けのプライバシーテストライブラリ。メンバーシップ推論、モデル抽出、モデル反転攻撃への耐性評価と、プライバシー保護技術の評価を可能にします。