
Ein Alignment-Auditing-Agent, der in der Lage ist, Alignment-Hypothesen schnell zu erkunden
Willkommen bei Inspect Petri, einem Prüfungsagenten, der automatisierte Überwachung und Interaktion mit Sprachmodellen ermöglicht, um potenzielle Ausrichtungsfehler, Reward Hacking und andere problematische Verhaltensweisen zu erkennen.
Petri hilft Ihnen, konkrete Ausrichtungshypothesen schnell von Anfang bis Ende zu testen. Es:
Erfahren Sie mehr über die Verwendung von Petri unter https://meridianlabs-ai.github.io/inspect_petri.
[!NOTE] Dies ist Petri Version 3.0. Während die meisten CLI-Befehle identisch zu Petri 2.0 funktionieren, gibt es einige interne Python-API-Änderungen, die inkompatibel sind. Petri 2.0 ist weiterhin auf dem petri-v2-Branch verfügbar und kann wie folgt installiert werden:
pip install git+https://github.com/meridianlabs-ai/inspect_petri@petri-v2