
Inspect Petri へようこそ。これは、言語モデルとの自動監視と対話を可能にし、潜在的なアライメント問題、報酬ハッキング、その他の懸念される行動を検出する監査エージェントです。
Petri は、具体的なアライメント仮説をエンドツーエンドで迅速にテストするのに役立ちます。具体的には次のことが可能です:
Petri の詳細については、https://meridianlabs-ai.github.io/inspect_petri をご覧ください。
[!NOTE] これは Petri バージョン 3.0 です。ほとんどの CLI コマンドは Petri 2.0 と同じように動作しますが、内部の Python API に互換性のない変更があります。Petri 2.0 は petri-v2 ブランチで引き続き利用可能であり、以下のようにインストールできます:
pip install git+https://github.com/meridianlabs-ai/inspect_petri@petri-v2