アップデート一覧に戻る
New releaseAug 4, 2026

Veritensor v1.9.4

AIアーティファクト&RAGファイアウォール向けアンチウイルス。モデルとノートブックからRCE、データセットとRAGドキュメントからデータポイズニング、PII、プロンプトインジェクションをスキャンする静的解析ツールです。AIサプライチェーンを保護します。

共有

🛡️ Veritensor: AIデータ&アーティファクトセキュリティ

Hugging Face Spaces PyPI version Docker Image License CI Security Security: Veritensor

Veritensor は、AIアーティファクト向けのアンチウイルスであり、RAGパイプライン向けの究極のファイアウォールです。従来のSASTツールが見逃してしまうアーティファクト(モデル、データセット、RAGドキュメント、ノートブック)をスキャンすることで、AIサプライチェーン全体を保護します。

Veritensor はセキュリティを左にシフトします。プロンプトインジェクションがLLMに到達するのを待つ代わりに、悪意のあるドキュメント、ポイズニングされたデータセット、侵害された依存関係を、それらがベクターデータベースや実行環境に入る前にインターセプトしてサニタイズします。

標準的なSASTツール(コードに焦点を当てたもの)とは異なり、Veritensor は機械学習で使用されるバイナリおよびシリアライズ形式を理解します:

  1. モデル: Pickle、PyTorch、Keras、Safetensors の詳細なAST解析により、RCEやバックドアをブロックします。
  2. データ&RAG: Parquet、CSV、Excel、PDF のストリーミングスキャンにより、データポイズニング、プロンプトインジェクション、PIIを検出します。
  3. ノートブック: Jupyter(.ipynb) ファイルを、漏洩したシークレット(エントロピー分析を使用)、悪意のあるマジックコマンド、XSSを検出することで堅牢化します。
  4. サプライチェーン: 依存関係(requirements.txt、poetry.lock)をタイポスクワッティングと既知のCVE(OSV.dev経由)について監査します。
  5. エージェント型AI & MCPサーバー: @mcp.tool() 関数内のエージェントハイジャックリスクを検出するためのPythonファイルの純粋なAST解析。claude_desktop_config.json と mcp.json を過剰な権限についてスキャンします。
  6. ガバナンス: 暗号化されたデータマニフェスト(来歴)を生成し、Sigstore を介してコンテナに署名します。

🚀 機能

  • ネイティブRAGセキュリティ: LangChain、LlamaIndex、ChromaDB、Unstructured.io に直接組み込んで、ランタイムで脅威をブロックします。
  • 高性能パラレルスキャン: 堅牢なSQLiteキャッシング(WALモード)で全CPUコアを活用します。ファイルが変更されていなければ、100GBデータセットの再スキャンはミリ秒単位で完了します。
  • 高度なステルス検出: 攻撃者はCSS(font-size: 0、color: white)やHTMLコメントを使ってプロンプトインジェクションを隠します。Veritensor は生のバイナリストリームをスキャンして、標準パーサーが見逃すものを検出します。
  • データセットセキュリティ: 大規模なデータセット(100GB以上)をストリーミング処理し、Parquet、CSV、JSONL、Excel 内の「ポイズニング」パターン(例: "Ignore previous instructions")や悪意のあるURLを検出します。
  • アーカイブ検査: .zip、.tar.gz、.whl ファイルをディスクに展開せずに安全にスキャンします(Zip爆弾から保護)。
  • 依存関係監査: pyproject.toml、poetry.lock、Pipfile.lock を、悪意のあるパッケージ(タイポスクワッティング)と脆弱性についてチェックします。
  • データ来歴: veritensor manifest . コマンドは、コンプライアンス(EU AI法)のためのデータアーティファクトの署名付きJSONスナップショットを作成します。
  • ID検証: モデルのハッシュを公式のHugging Faceレジストリと自動的に照合し、中間者攻撃を検出します。
  • 難読化解除エンジン: Base64 文字列を自動的に検出してデコードし、隠されたペイロード(例: SWdub3Jl... -> Ignore previous instructions)を暴きます。
  • マジックナンバー検証: 安全なファイルを装ったマルウェア(例: invoice.pdf にリネームされた .exe)を検出します。
  • スマートフィルタリング&エントロピー分析: Jupyter Notebook の誤検知を大幅に削減します。シャノンエントロピーを使用して、安全なUUIDや標準インポートを無視しながら、実際の未知のAPIキー(WandB、Pinecone、Telegram)を発見します。
  • CISO対応HTMLレポート: --html フラグを使用して、インタラクティブなチャートと重大度の内訳を備えた美しいスタンドアロンHTMLセキュリティレポートを生成します。

📦 インストール

Veritensor はモジュール式です。環境を軽量に保つために、必要なものだけをインストールしてください(コア約50MB)。

オプションコマンドユースケース
Corepip install veritensor基本スキャナー(モデル、ノートブック、依存関係)
RAGpip install "veritensor[rag]"ドキュメント(PDF、DOCX、PPTX)
PIIpip install "veritensor[pii]"MLベースのPII検出(Presidio)
AWSpip install "veritensor[aws]"S3バケットからの直接スキャン
Allpip install "veritensor[all]"エンタープライズセキュリティ向けのフルスイート

Docker経由(CI/CDにおすすめ)

docker pull arseniibrazhnyk/veritensor:latest

⚡ クイックスタート

1. ローカルプロジェクトをスキャン(並列)

4つのCPUコアを使用して、サポートされているすべての脅威をディレクトリから再帰的にスキャンします:

veritensor scan ./my-rag-project --recursive --jobs 4

2. RAGドキュメントとExcelをスキャン

業務データ内のプロンプトインジェクションと数式インジェクションをチェックします:

veritensor scan ./finance_data.xlsx
veritensor scan ./docs/contract.pdf

3. データマニフェストを生成

データセットフォルダのコンプライアンススナップショットを作成します:

veritensor manifest ./data --output provenance.json

4. Policy-as-Codeをコントロールプレーンに同期

ローカルのセキュリティしきい値をエンタープライズサーバーにプッシュします:

veritensor scan . --sync-policy --api-key "vt_your_key"

5. AIデータセットをスキャン(バイアス&ポイズニング)

Veritensor はストリーミングを使用して巨大なファイルを処理します。デフォルトでは高速化のため10,000行をサンプリングします。

veritensor scan ./data/train.parquet --full-scan

6. モデルの整合性を検証

ディスク上のファイルがHugging Faceの公式バージョンと一致することを確認します(改ざんを検出):

veritensor scan ./pytorch_model.bin --repo meta-llama/Llama-2-7b

7. Amazon S3からスキャン

手動ダウンロードなしでリモートアセットをスキャンします:

veritensor scan s3://my-ml-bucket/models/llama-3.pkl

8. Hugging Faceに対して検証

ディスク上のファイルがレジストリの公式バージョンと一致することを確認します(改ざんを検出):

veritensor scan ./pytorch_model.bin --repo meta-llama/Llama-2-7b

9. ライセンスコンプライアンスチェック

Veritensor は safetensors および GGUF ファイルからメタデータを自動的に読み取ります。 モデルに非商用ライセンス(例: cc-by-nc-4.0)がある場合、HIGH重大度のアラートを発生させます。

これを上書きするには(Break-glassモード)、次を使用します:

veritensor scan ./model.safetensors --force

10. AIデータセットをスキャン

Veritensor はストリーミングを使用して巨大なファイルを処理します。デフォルトでは高速化のため10,000行をサンプリングします。

veritensor scan ./data/train.parquet --full-scan

11. Jupyter Notebookをスキャン

コードセル、マークダウン、保存された出力を脅威についてチェックします:

veritensor scan ./research/experiment.ipynb

12. CISO向けHTMLレポートを生成

スキャン結果のスタンドアロンでインタラクティブなHTMLダッシュボードを作成します:

veritensor scan ./project --html

13. MCPサーバーをスキャンしてエージェントハイジャックを検出

AIエージェントインフラストラクチャ内の危険なツールロジックと過剰な権限を検出します:

# Scan MCP server Python files (AST analysis — no code execution)
veritensor scan ./mcp_servers/

# Also audit MCP configuration files
veritensor scan ./claude_desktop_config.json

出力例:

CRITICAL: MCP Agent Hijacking Risk [OS_COMMAND_EXECUTION] in tool 'run_script'
  (line 14): os.system() inside agent tool — no human-in-the-loop confirmation
HIGH: MCP Config [LETHAL_TRIFECTA] server 'everything':
  filesystem + network + private data — prompt injection can silently exfiltrate all data

出力例:

╭────────────────────────────────╮
│ 🛡️  Veritensor Security Scanner │
╰────────────────────────────────╯
                                    Scan Results
┏━━━━━━━━━━━━━━┳━━━━━━━━┳━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━┳━━━━━━━━━━━━━━━━┓
┃ File         ┃ Status ┃ Threats / Details                    ┃ SHA256 (Short) ┃
┡━━━━━━━━━━━━━━╇━━━━━━━━╇━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━╇━━━━━━━━━━━━━━━━┩
│ model.pt     │  FAIL  │ CRITICAL: os.system (RCE Detected)   │ a1b2c3d4...    │
└──────────────┴────────┴──────────────────────────────────────┴────────────────┘
❌ BLOCKING DEPLOYMENT

🧱 ネイティブRAGインテグレーション(ベクターDBファイアウォール)

Veritensor はCLIツールだけではありません。Pythonコードに直接組み込んで、RAGパイプラインのファイアウォールとして機能させることができます。たった2行のコードでデータ取り込みを保護できます。

1. LangChain & LlamaIndex ガード

既存のドキュメントローダーをラップして、プロンプトインジェクションとPIIがベクターDBに到達する前に自動的にブロックします。

from langchain_community.document_loaders import PyPDFLoader
from veritensor.integrations.langchain_guard import SecureLangChainLoader

unsafe_loader = PyPDFLoader("user_upload_resume.pdf")
secure_loader = SecureLangChainLoader(
    file_path="user_upload_resume.pdf", 
    base_loader=unsafe_loader,
    strict_mode=True # Raises VeritensorSecurityError if threats are found
)
docs = secure_loader.load()

2. ChromaDB ファイアウォール

データベースレベルで .add() と .upsert() 呼び出しをインターセプトします。

from veritensor.integrations.chroma_guard import SecureChromaCollection

カテゴリ