匿名論文投稿に付随するコード。このリポジトリは、APEXディフェンダー、ベンチマークデータの正規化、信頼されたケイパビリティマニフェスト、および比較手法の統合を分離し、各レイヤーを独立して検査できるようにしている。
python -m venv .venv
source .venv/bin/activate
pip install -e '.[test]'
export PYTHONPATH="$PWD/src:$PWD"
モデルを利用するコンポーネントは、環境から OPENAI_API_KEY と任意の OPENAI_BASE_URL を読み取る。.env.example は参照用としてのみコピーすること。コードはローカルの認証情報ファイルを読み取らない。
| パス | 役割 |
|---|---|
src/apex/defender/ | APEXタスク契約、型付きバインディング、レシート、証明チェック、PLANT、WRAP、および継続処理 |
src/apex/core/ | 共有プロトコル、結果型、集約、およびプロバイダー非依存のモデル境界 |
benchmark/adapter/ | ベンチマークリリースを単一の BenchmarkCase インターフェースへ読み取り専用で変換 |
benchmark/registry/ | 信頼されたケイパビリティの登録とベンチマーク固有のマニフェスト |
baseline/<name>/ | 比較手法ごとに1つの実装またはランタイム統合 |
tests/ | リポジトリの不変条件と高速な単体チェック |
コンポーネントの流れと拡張ポイントについては STRUCTURE.md を参照。
6つのベンチマークすべてに対するコンパクトで固定されたケース記述子が benchmark/data/ 以下に含まれている。完全な上流リポジトリとランタイムサンドボックスは同梱されていない。None を渡すとパッケージ化されたデータが選択されるが、明示的な data_root で上書きすることも可能である。
from benchmark.adapter import adapter_for
adapter = adapter_for("scr", None)
attack_cases = list(adapter.cases("attack"))
アダプターは、ケース識別子、分割ラベル、スイートラベル、適格性、およびベンチマークランタイムに提示されるペイロードを管理する。ベンチマークの内容を変更したり、ツールの権限を登録したりはしない。
from benchmark.registry import module_for
registry = module_for("mcptox")
environment_plan = registry.load("12306-mcp")
ケイパビリティマニフェストはデータセットアダプターとは分離して保持される。ベンチマークのテキストは信頼できないエピソード入力である一方、マニフェストはエピソード前に利用可能なオペレーター所有の実行境界を記述するためである。
すべての benchmark/registry/data/<benchmark>/manifest.json は、apex-benchmark-registry-v2 を使用した最終的なレジストリアーティファクトである。バンドルは、重複排除された capability_units、再利用可能な環境、および明示的なケースバインディングを格納する。したがって、数百のケースを持つベンチマークでも、同一のToolマニフェストを数百回重複させることはない。各ユニットは、正確な入力/出力スキーマ、effect、observation、effect_return、レシートの役割、および型付きアノテーションを保持する。各環境は、ソース、Skills、および agent_visible_surface を個別に記録する。
実験実装からの正確な監査済みソース入力は benchmark/registry/source/ 以下に保持されている。ビルドステップはそれらの既存の登録を正規化および重複排除するものであり、ベンチマークプロンプトから新しいケイパビリティのセマンティクスを推論するものではない。すべての最終アーティファクトを再生成するには次を実行する:
pip install -e '.[registry]'
python scripts/build_registry_manifests.py
python scripts/audit_registry_coverage.py
ローカルの上流チェックアウトからパッケージ化されたケース記述子を更新するには、次を実行する:
python scripts/import_benchmark_data.py \
--research-root <research-checkout> \
--scr-root <SCR_Bench-checkout>
SCRインポーターは、コンパクトなケース/Skill公開インデックスを導出する前に、固定されたコミットを検証する。
TaskContractor が信頼されたユーザーリクエストをタスク契約にコンパイルする。決定論的チェックはターゲットモデルから独立したままである。モデルを利用する役割は、同じ検証境界を通過しなければならない型付き候補を提出する。
baseline/registry.py は13の比較手法を定義する。各手法には、その手法にちなんで名付けられた専用フォルダーと implementation.py エントリポイントがある。独自のランタイムを持つ依存関係は遅延インポートされるため、APEXコアとデータアダプターはすべてのベンチマーク環境をインストールしなくてもテストできる。
python -m compileall -q src benchmark baseline tests
pytest
リリース前に、ANONYMITY.md の匿名性チェックも実行すること。認証情報、結果ファイル、マシン固有のパス、Gitリモート、または著者メタデータを投稿に追加してはならない。