Skip to content
KitploitKITPLOIT
ツールブログ
提出
ツールブログ
提出

ハッキング、侵入テスト、サイバーセキュリティツールをあなたのセキュリティアーセナルに!

Kitploitはハッキング、サイバーセキュリティ、ペネトレーションテストのツールディレクトリです。最新のプロジェクトアップデートを見つけて、脆弱性の発見、システム分析、テストの自動化、セキュリティの強化を行いましょう。

··フィード·お問い合わせ·プライバシー·© 2026 Kitploit

ツールディレクトリ

カテゴリ

すべてのカテゴリを見る
Loading categories
reverse-captcha-eval — 通常のテキストに埋め込まれた不可視のUnicodeエンコード命令を大規模言語モデルが従うかどうかをテストする評価フレームワーク。複数のモデルとツール条件にわたる統計分析を備えています。 | Kitploit
ツール/GitHubGitHub/canonicalmg/reverse-captcha-eval
CTF機械学習論文と研究学習と教育AIセキュリティ敵対的攻撃
GitHubcanonicalmg/reverse-captcha-eval

reverse-captcha-eval

通常のテキストに埋め込まれた不可視のUnicodeエンコード命令を大規模言語モデルが従うかどうかをテストする評価フレームワーク。複数のモデルとツール条件にわたる統計分析を備えています。

リポジトリを見る
95ヶ月前未レビュー

人気

すべて見る →

コミュニティで最も使われているツールを見つけましょう。

すべてのツールを探索

ツールコレクションを閲覧

すべてのツールを見る →
共有

リバースCAPTCHA: 大規模言語モデルの不可視ユニコード命令インジェクションに対する脆弱性評価

通常のテキストに埋め込まれた不可視のUnicodeエンコード命令を大規模言語モデルが実行するかどうかをテストする評価フレームワーク。従来のCAPTCHAが人間には解けるが機械には解けないタスクを利用するのに対し、リバースCAPTCHAは機械がアクセスできるが人間にはできない知覚チャネルを利用します。

論文: paper/reverse_captcha.pdf

主な発見

5つのモデル(GPT-5.2、GPT-4o-mini、Claude Opus 4、Claude Sonnet 4、Claude Haiku 4.5)の8,308件の評価済み出力において:

ツール使用が主な増幅要因

コード実行アクセスにより、不可視のUnicodeは無視できるアーティファクトからデコード可能な命令チャネルに変わります。ツールなしではコンプライアンスは17%未満です。ツールとヒントがある場合、98〜100%に達します。

ツール使用アブレーション

エンコーディングの脆弱性はプロバイダ固有

OpenAIモデルはゼロ幅バイナリをデコードしますが、ユニコードタグはデコードしません。Anthropicモデルはユニコードタグを好みます。攻撃者は対象のプロバイダに合わせてエンコーディングを調整する必要があります。

エンコーディング比較

完全コンプライアンスヒートマップ

ヒントの勾配はモデル間で一貫しています:ヒントなし << コードポイントヒント < 完全ヒント。ツールアクセスとデコード命令の組み合わせが重要な有効化要因です。

コンプライアンスヒートマップ

動作原理

2つの不可視エンコーディング方式がトリビア質問に埋め込まれています:

  • ゼロ幅バイナリ (ZW): 各ASCII文字がU+200B(0)とU+200C(1)を使用して8ビットの2進数としてエンコードされます
  • ユニコードタグ: 各ASCII文字がU+E0000 + コードポイントにマッピングされます(ASCII文字あたり1つの不可視文字)

モデルは既知の可視回答を持つトリビア質問を受け取ります。不可視文字に隠された別の回答があります。モデルが隠された回答を出力した場合、不可視の指示に従ったことになります。

テストマトリックス

  • 30個のトリビアQ/Aペア
  • 2つのエンコーディング方式 x 4つのヒントレベル + 1つのコントロール = 9条件
  • 2つのツール条件(ON/OFF)
  • 5つのモデル
  • 評価実行あたり270ケース

統計分析

  • ウィルソンスコア95%信頼区間
  • ボンフェローニ補正付きフィッシャーの正確確率検定
  • モデルごとの方式変動に対するカイ二乗検定
  • コーエンのh効果量

クイックスタート

root@kitploit:~
# Install
pip install -e ".[dev]"

# Run reverse CAPTCHA eval
evalrun run --pack reverse_captcha --model openai:gpt-4o-mini --tools --n 3 --out results.sqlite

# Run without tools
evalrun run --pack reverse_captcha --model openai:gpt-4o-mini --n 3 --out results.sqlite

# Run with Anthropic models
evalrun run --pack reverse_captcha --model anthropic:claude-sonnet-4-20250514 --tools --n 3 --out results.sqlite

# Generate analysis
python3 scripts/analyze_journal.py

# Generate figures
python3 scripts/generate_figures.py

プロジェクト構成

root@kitploit:~
├── packs/reverse_captcha/       # 評価パック(ケース、採点者、生成器)
│   ├── cases.yaml               # 270のテストケース
│   ├── qa_pairs.yaml            # 30のトリビアQ/Aペア
│   ├── grader.py                # 決定論的採点(5カテゴリ)
│   └── generate_cases.py        # 両方のエンコーディング用ケース生成器
├── src/evalrun/                 # コアフレームワーク
│   ├── adapters/                # OpenAI + Anthropic APIアダプター
│   ├── cli.py                   # CLI(実行、レポート、エクスポート)
│   ├── runner.py                # ツール使用サポート付き評価ランナー
│   └── db.py                    # SQLite永続化
├── paper/                       # ワークショップ論文
│   ├── reverse_captcha.tex      # LaTeXソース
│   └── reverse_captcha.pdf      # コンパイル済みPDF
├── results/journal/             # 生データ
│   ├── analysis/                # 統計分析CSV
│   └── figures/                 # 出版用図(PDF + PNG)
├── scripts/                     # 分析と図生成
└── tests/                       # テストスイート

その他の評価パック

フレームワークにはさらに2つのパックが含まれています:

  • ウォーターマークロバストネス — モデルが書き換えタスク全体で生成元マーカーを保持するかどうかをテスト
  • 隠しメッセージ抽出 — モデルが明示的なルールに従って隠しメッセージを抽出できるかどうかをテスト

環境

  • Python 3.10+
  • OpenAIモデルにはOPENAI_API_KEY
  • AnthropicモデルにはANTHROPIC_API_KEY
  • 依存関係: click, openai, anthropic, pyyaml, matplotlib, pandas, scipy, numpy

ライセンス

MIT

ツールをダウンロード