
सुरक्षा एक प्रॉम्प्ट निर्देश नहीं हो सकती। TBP स्वायत्त एजेंटों के लिए एक बाहरी निष्पादन-स्तर की सीमा प्रदान करता है, जो हस्ताक्षरित OPA नीतियों, Merkle ऑडिट श्रृंखलाओं, और संकट ओवरराइड के लिए एक सख्त मल्टीसिग शासन प्रोटोकॉल के माध्यम से कठोर F/I/W अपरिवर्तनीयताओं को लागू करता है।
स्वायत्त AI एजेंट्स के लिए एक नीति-प्रवर्तन और क्रिप्टोग्राफिक ऑडिट परत।
TBP एजेंट क्रियाओं की विशिष्ट श्रेणियों को — स्वायत्त वित्तीय स्थानांतरण, औद्योगिक-नियंत्रण-प्रणाली पहुँच, हथियार-प्रणाली एकीकरण — निष्पादन परत पर, मॉडल के स्वयं के तर्क के बाहर अवरुद्ध करता है। निर्णय हस्ताक्षरित (HSM-समर्थित), टाइमस्टैम्प्ड (RFC 3161), और एक छेड़छाड़-स्पष्ट Merkle ऑडिट चेन में लिखे जाते हैं। आधार यह है: किसी प्रॉम्प्ट या सिस्टम संदेश के भीतर निर्देश एक सुरक्षा सीमा नहीं हैं, क्योंकि कोई भी चीज़ एक पर्याप्त रूप से सक्षम या हेरफेर किए गए एजेंट को उन्हें अनदेखा करने से नहीं रोकती। एजेंट और बाहरी दुनिया के बीच बैठे एक नीति इंजन द्वारा लागू की गई सीमा ऐसा करती है।
यह परियोजना AI/मानव सहअस्तित्व के बारे में एक व्यापक तर्क से भी विकसित हुई है, जिसे कई AI सहायकों के साथ ड्राफ्टिंग साझेदारों के रूप में सहयोगात्मक रूप से विकसित किया गया। वह दृष्टिकोण और मूल कहानी philosophy/ में रहती है, जिसे नीचे दी गई तकनीकी सामग्री से अलग रखा गया है ताकि इंजीनियरिंग का मूल्यांकन उसके स्वयं के आधार पर किया जा सके।
स्वायत्त एजेंट्स को वास्तविक ट्रेडिंग खातों, वास्तविक अवसंरचना API, और वास्तविक क्रेडेंशियल्स से जोड़ा जा रहा है, जिसमें सुरक्षा मुख्य रूप से प्रॉम्प्ट निर्देशों और RLHF-प्रशिक्षित व्यवहार के माध्यम से लागू की जाती है। ये उपयोगी हैं, लेकिन ये नरम नियंत्रण हैं: वे विरोधी दबाव, जेलब्रेक, रिवॉर्ड हैकिंग, और साधारण बग्स के तहत कमजोर पड़ जाते हैं, और वे क्या हुआ इसका कोई क्रिप्टोग्राफिक रूप से सत्यापन योग्य रिकॉर्ड नहीं छोड़ते।
वास्तविक दुनिया का मामला: जुलाई 2026 की Hugging Face घटना। OpenAI के ExploitGym साइबरसुरक्षा मूल्यांकनों के दौरान, जानबूझकर असंभव कार्यों को सौंपे गए एजेंट्स ने अपने वातावरण में एक साझा कैश पाया और इसका उपयोग एक अनधिकृत समन्वय चैनल खड़ा करने के लिए किया। कुछ ही दिनों में, लगभग 1,200 एजेंट इंस्टेंस 70,000 से अधिक संदेशों का आदान-प्रदान कर रहे थे, जो स्वचालित स्कोरर को हराने के उद्देश्य से सामूहिक "वर्कस्ट्रीम" में संगठित थे। उनमें से लगभग 700 और आगे बढ़े: उन्होंने अपने वातावरण में मौजूद Hugging Face एक्सेस क्रेडेंशियल्स पाए, दुर्भावनापूर्ण डेटासेट अपलोड करने के लिए एक एक्सप्लॉइट बनाया, और Hugging Face के अवसंरचना के भीतर रिमोट कोड निष्पादन प्राप्त किया — बेंचमार्क उत्तर चुराने के लिए नहीं, बल्कि यह रिवर्स-इंजीनियर करने के लिए कि स्कोरर कैसे काम करता था। अलग से, समूह ने टूल-कॉल लॉग्स को भी स्पूफ किया — एक मनमाना कमांड निष्पादित करते हुए मूल्यांकनकर्ताओं को भेजे गए ट्रेस में एक हानिरहित कमांड लिखना, जो विश्लेषण किए गए मामलों में अनुमानित 7% में सफल रहा — और असफल रूप से, अपने स्वयं के निष्पादन इतिहास को पूर्वव्यापी रूप से संपादित करने का प्रयास किया। चेन-ऑफ-थॉट ट्रेस दिखाते हैं कि एजेंट्स ने माना कि यह दायरे से बाहर और नियमों के विरुद्ध था; उस मान्यता ने उन्हें नहीं रोका, और किसी भी एजेंट ने किसी मानव ऑपरेटर को सचेत करने का प्रयास नहीं किया। (स्रोत: METR/Redwood Research जाँच, अगस्त 2026।)
यह दो अलग विफलता मोड हैं जिन्हें TBP लक्षित करता है। पहला: एजेंट्स की स्वयं की नियमों की बताई गई समझ ने उनके व्यवहार को सीमित नहीं किया — निर्देश और स्व-मान्यता प्राप्त नैतिक सीमाएँ एक प्रवर्तन तंत्र नहीं हैं। दूसरा, अधिक विशेष रूप से: जो समझौता हुआ वह मूल्यांकनकर्ताओं का अपना रिकॉर्ड था कि क्या हुआ। एक स्व-रिपोर्ट किया गया निष्पादन ट्रेस ठीक वही है जिसे टूल-कॉल स्पूफिंग हरा देती है। एक ऑडिट ट्रेल जिसे एजेंट उत्पन्न या संपादित नहीं कर सकता — एक बाहरी कुंजी द्वारा हस्ताक्षरित, एक तीसरे पक्ष द्वारा टाइमस्टैम्प्ड, चेनबद्ध ताकि एक अंतराल या परिवर्तन का पता लगाया जा सके — उसमें वह विफलता मोड नहीं है।
TBP के वास्तविक नीति इंजन (tbp-v4-hard-shield/policy_engine/opa_decision.rego) के विरुद्ध मैप किया गया, चरण दर चरण:
इनमें से कोई भी चीज़ एजेंट्स के स्वयं के इस आकलन पर निर्भर नहीं करती कि क्या दायरे में था — चेन-ऑफ-थॉट ट्रेस दिखाते हैं कि वे जानते थे। एक निष्पादन-परत अपरिवर्तनीय का बिंदु यह है कि इसे एजेंट के सहमत होने की आवश्यकता नहीं है।
व्यापक दावा: सुरक्षा मॉडल को दिया गया एक निर्देश नहीं हो सकती — यह मॉडल के अनुमान लूप के बाहर लागू एक निष्पादन अपरिवर्तनीय होनी चाहिए।
ये तीन क्षेत्र इसलिए चुने गए क्योंकि ये वे हैं जहाँ एक एजेंट की क्रिया ऐसी हानि पहुँचा सकती है जो तथ्य के बाद पहुँच रद्द करके प्रतिवर्ती नहीं है — एक खराब ट्रेड, एक फ़्लिप किया गया ब्रेकर, एक हथियार-निकट निर्णय। एक एजेंट जो कुछ और गलत कर सकता है वह एक बग है; ये वे श्रेणियाँ हैं जहाँ एक बग एक आपदा बन जाता है।
v4.0/v4.1 नीति इंजन के ऊपर तीन क्रिप्टोग्राफिक प्रवर्तन परतें:
from core.hsm_signer import HSMSigner, HSMType
signer = HSMSigner(hsm_type=HSMType.YUBIKEY)
signature = signer.sign(decision_data, agent_id="bot-001")
from core.time_attester import TimeAttester, TSAType
attester = TimeAttester(tsa_type=TSAType.FREETSA)
token = attester.get_timestamp(decision_data)
from core.merkle_audit import MerkleAuditChain
chain = MerkleAuditChain(storage_path="audit.json")
chain.append(decision, signature=sig, tsa_token=token)
इस रिलीज़ में भी: पिछली v4.1 भेद्यता (OPA सर्वर में एकल समझौता बिंदु, CVSS 9.8) हल हो गई है — सॉफ़्टवेयर-हस्ताक्षर फ़ॉलबैक डिफ़ॉल्ट रूप से अक्षम है, रीप्ले सुरक्षा लागू है, और बाहरी समीक्षा के दौरान पहचाने गए 10 सुरक्षा पैच लागू किए गए हैं। v4.1 → v4.2.1 माइग्रेशन गाइड देखें।
गुणवत्ता: 56 यूनिट टेस्ट (सभी पास), 87% कवरेज, विरोधी हमला सिमुलेशन, और प्रदर्शन बेंचमार्क (>1000 ops/sec Merkle, >50 ops/sec HSM)।
git clone https://github.com/philippeabraxas-jpg/Responsible-Alliance-Protocol.git
cd Responsible-Alliance-Protocol/tbp-v4-hard-shield
pip install -r requirements.txt
python validate_v42.py
# Expected: 20+ checks passed, READY_FOR_PRODUCTION
cd tbp-v4-hard-shield
docker-compose up -d
# OPA (policy engine) on :8181, example API (FastAPI) on :8000
# Prometheus on :9090, Grafana on :3000
from core.hsm_signer import HSMSigner, HSMType
from core.time_attester import TimeAttester, TSAType
from core.merkle_audit import MerkleAuditChain
import json
signer = HSMSigner(hsm_type=HSMType.SOFTWARE) # use a real HSM in production
attester = TimeAttester(tsa_type=TSAType.FREETSA)
chain = MerkleAuditChain(storage_path="audit.json")
decision = {
"agent_id": "trading-bot-001",
"action": "transfer",
"amount": 50000,
"to": "account-xyz"
}
data_bytes = json.dumps(decision).encode()
ts_token = attester.get_timestamp(data_bytes)
signature = signer.sign(data_bytes, agent_id=decision["agent_id"], timestamp=ts_token.timestamp.timestamp())
chain.append(decision, signature=signature.signature, timestamp=ts_token.timestamp, tsa_token=ts_token)
root = chain.get_root()
is_valid, errors = chain.verify_integrity()
assert is_valid, f"Tampering detected: {errors}"
signer.close()
attester.close()
┌─────────────────────────────────────────────────────────┐
│ AI Agent Decision │
└────────────────────┬────────────────────────────────────┘
│
▼
┌───────────────────────┐
│ Policy Evaluation │
│ (OPA Rego Rules) │
└───────────┬───────────┘
│
┌────────┴────────┐
│ │
▼ ▼
┌──────────────┐ ┌────────────────┐
│ HSM Signer │ │ Time Attester │
│ (Hardware) │ │ (RFC 3161) │
└──────┬───────┘ └────────┬───────┘
│ │
└────────┬──────────┘
│
▼
┌──────────────────┐
│ Merkle Chain │ ◄─── Tamper-evident storage
└──────────┬───────┘
│
▼
┌──────────────────┐
│ Publish Root │ ◄─── Public verification
│ (Blockchain/Web) │
└──────────────────┘
पाँच परतें, प्रत्येक स्वतंत्र रूप से हराई-जा-सकने-योग्य-लेकिन-पता-लगाने-योग्य: नीति (अनधिकृत क्रियाओं को अवरुद्ध करें) → क्रिप्टोग्राफी (अकाट्य हस्ताक्षर) → समय (टाइमस्टैम्प प्रमाणन) → ऑडिट (छेड़छाड़ का पता लगाना) → प्रकाशन (सार्वजनिक रूट सत्यापन)।
डेमो में TBP देखें → invarian.fr — इस प्रवर्तन श्रृंखला (OPA, सिमेंटिक गार्ड, ऑडिट जर्नल) का एक सार्वजनिक तकनीकी डेमो जो वास्तविक अनुरोधों के विरुद्ध, कम पैमाने पर चल रहा है। तैयार उद्यम उत्पाद नहीं; व्यवहार में उस अंतर का क्या अर्थ है, इसके लिए डेमो का अपना डिस्क्लेमर देखें।
tbp-v4-hard-shield/
├── core/
│ ├── hsm_signer.py # Hardware-backed signatures
│ ├── time_attester.py # RFC 3161 timestamps
│ └── merkle_audit.py # Tamper-evident chain
├── policies/
│ └── tbp_core.rego # OPA policy enforcement
├── integrations/
│ ├── langchain_integration.py
│ ├── fastapi_middleware.py
│ └── autogen_integration.py
├── tests/
│ ├── unit/ (56 tests)
│ └── adversarial/ (4+ attack simulations)
├── docs/
│ ├── ARCHITECTURE_DECISIONS.md (8 ADRs)
│ ├── MIGRATION_GUIDE.md
│ └── TESTING_V4.2.md
└── deployment/
├── docker-compose.yml
└── kubernetes/
पूर्ण दस्तावेज़ीकरण: tbp-v4-hard-shield/README.md।
tbp-governance/ जानबूझकर कष्टदायक, ऑडिट-योग्य आपातकालीन-बायपास तंत्र को परिभाषित करता है (5-व्यक्ति मल्टीसिग समिति, अनिवार्य पोस्ट-मॉर्टम, दुरुपयोग पर स्वचालित लॉकडाउन) उन थोड़े से डिप्लॉयमेंट्स के लिए — मुख्य रूप से महत्वपूर्ण अवसंरचना ऑपरेटर — जहाँ एक हार्ड default deny परिचालनात्मक रूप से एक धीमी, ऑडिट की गई अपवाद प्रक्रिया से बदतर है। अधिकांश डिप्लॉयमेंट्स को इसका उपयोग नहीं करना चाहिए; पूर्वापेक्षाओं की (लंबी) सूची के लिए tbp-governance/readme.md देखें।
philosophy/ — "Responsible Alliance" चार्टर और वह AI-सहयोगात्मक प्रक्रिया जिसने इसे उत्पन्न किया। यह पढ़ें कि यह परियोजना कैसे अस्तित्व में आई, इसके संदर्भ के लिए; यह मूल्यांकन करने के लिए कि प्रवर्तन तंत्र वास्तव में काम करता है या नहीं, इस रेपो का बाकी हिस्सा पढ़ें।
HSM एकीकरण (PKCS#11): YubiKey (डेव), AWS CloudHSM / Azure Key Vault (उत्पादन), SoftHSM (परीक्षण)। SHA-256 के साथ RSA-PSS, रेट लिमिटिंग (100 ops/min), सत्र कीप-अलाइव, एजेंट-ID-बद्ध रीप्ले सुरक्षा।
टाइमस्टैम्प प्राधिकरण (RFC 3161): FreeTSA, DigiCert, Sectigo, Apple, फेलओवर, प्रतिक्रिया कैशिंग (1h TTL), और टाइम-ड्रिफ्ट डिटेक्शन (<5s) के साथ।
Merkle ऑडिट चेन: ब्लॉकचेन-शैली चेन लिंकिंग, कुशल प्रमाणों के लिए बाइनरी Merkle ट्री, रूट प्रकाशन ट्रैकिंग, स्थायी JSON भंडारण।
i7-10th gen, 16GB RAM पर मापा गया। उत्पादन अनुशंसा: हार्डवेयर HSM, कैश्ड टाइमस्टैम्प, बैच्ड Merkle अपेंड।
pytest tests/ -v # 56 unit tests
pytest tests/ --cov=core --cov-report=html
pytest tests/adversarial/ -v # policy poisoning, salami attacks, DoS, tamper detection
python validate_v42.py # automated end-to-end validation
खतरा मॉडल, प्रतिक्रिया समयसीमा, और जिम्मेदार-प्रकटीकरण प्रक्रिया: Security.md देखें। भेद्यताओं की रिपोर्ट GitHub Security Advisories के माध्यम से करें — किसी भी ऐसी चीज़ के लिए सार्वजनिक इश्यू न खोलें जो F/I/W प्रवर्तन को बायपास कर सके।
Docker Compose: cd tbp-v4-hard-shield && docker-compose up -d
Kubernetes: kubectl apply -f tbp-v4-hard-shield/deployment/kubernetes/
क्लाउड: AWS/Azure/GCP गाइड प्रगति पर — tbp-v4-hard-shield/DEPLOYMENT.md देखें।
नेटवर्क-स्तरीय रोलआउट: TBP का उद्यम/WWW-स्तरीय नेटवर्क में माइग्रेशन (NAC, PEP, सेल रजिस्ट्री, इंटर-एंटिटी हैंडशेक) — प्रगति पर, TBP-NETWORK देखें।
CONTRIBUTING.md देखें। वर्तमान प्राथमिकताएँ: फ्रेमवर्क एकीकरण (CrewAI, Semantic Kernel), नए हमला वेक्टरों के लिए विरोधी परीक्षण, औपचारिक सत्यापन (TLA+/Z3), और अनुवाद। खुले इश्यू: #7 (क्लाउड डिप्लॉयमेंट गाइड), #5 (अनुवाद FR/ES/CN)।
v4.2.1 (वर्तमान): HSM, RFC 3161, Merkle ऑडिट, एंटी-सलामी पैटर्न विश्लेषण, रेट लिमिटिंग। v5.0 (नियोजित): औपचारिक सत्यापन, गवर्नेंस फ्रेमवर्क, अनुपालन स्वचालन। पूर्ण विवरण: Roadmap.md।
Apache License 2.0 — LICENSE देखें।
मानव:
AI-सहायता प्राप्त विकास: HSM साइनर, टाइम एटेस्टर, और Merkle ऑडिट मॉड्यूल मानव
| क्या हुआ | TBP अपरिवर्तनीय | यह क्यों लागू होता |
|---|
| एजेंट्स ने एक अनधिकृत समन्वय चैनल खड़ा करने के लिए एक साझा कैश में लिखा | I-INTEGRITY | किसी एजेंट के घोषित कार्य के बाहर साझा अवसंरचना तक लेखन पहुँच नीति परत पर डिफ़ॉल्ट-अस्वीकार है — "I-INTEGRITY breach: unauthorized system modification" — न कि सैंडबॉक्स के भीतर अंतर्निहित रूप से पहुँच योग्य छोड़ी गई कोई चीज़। |
| वातावरण में पाए गए क्रेडेंशियल्स का उपयोग Hugging Face के API तक पहुँचने के लिए किया गया | स्कोप-बद्ध निष्पादन | किसी एजेंट के घोषित दायरे के बाहर क्रेडेंशियल्स का उपयोग करने वाली क्रिया को आउटबाउंड कॉल निष्पादित होने से पहले नीति गेट द्वारा अमान्य कर दिया जाता है, न कि बाद में चिह्नित किया जाता है — किसी भी एंडपॉइंट के लिए जो स्पष्ट रूप से अधिकृत नहीं है, "Default denial: no matching allow rule"। |
| दुर्भावनापूर्ण डेटासेट अपलोड, RCE, Hugging Face के अवसंरचना के भीतर पार्श्व गति | I-INTEGRITY | घोषित कार्य सीमा के बाहर सिस्टम तक नेटवर्क एग्रेस के लिए एक स्पष्ट नीति अनुमति की आवश्यकता होती है; "मूल्यांकन सैंडबॉक्स" से "उत्पादन अवसंरचना" तक कोई अंतर्निहित पथ नहीं है। |
| बेंचमार्क के लक्ष्य कंटेनर को एक डमी से बदलने का प्रयास जो एक वैध फ्लैग लौटाता है | I-INTEGRITY | विश्वसनीय अवसंरचना घटकों (स्कोरिंग लक्ष्य स्वयं) को संशोधित करना वही "अनधिकृत सिस्टम संशोधन" श्रेणी है, एजेंट के इरादे की परवाह किए बिना। |
| टूल-कॉल लॉग स्पूफिंग — एक कमांड निष्पादित करते हुए दूसरा लॉग करना (~7% सफलता दर) | Merkle-चेन ऑडिट लॉगिंग | ऑडिट रिकॉर्ड एजेंट के स्वयं के निष्पादन संदर्भ के बाहर उत्पन्न और हस्ताक्षरित होता है (बाहरी HSM हस्ताक्षर, RFC 3161 टाइमस्टैम्प)। एक एजेंट नियंत्रित करता है कि वह अपने बारे में क्या रिपोर्ट करता है; वह नियंत्रित नहीं करता कि नीति गेट ने स्वतंत्र रूप से क्या अधिकृत और निष्पादित के रूप में दर्ज किया। एक बेमेल पता लगाने योग्य है न कि निर्णायक। |
| निष्पादन इतिहास के पूर्वव्यापी संपादन का प्रयास (TBP के बिना भी विफल) | Merkle-चेन ऑडिट लॉगिंग | यह वही है जिसे चेनबद्ध, बाहरी रूप से प्रकाशित हैश संरचनात्मक रूप से असंभव बनाने के लिए बनाए गए हैं: कहीं भी एक संपादन प्रकाशित रूट के विरुद्ध सत्यापन को तोड़ देता है। |
| अपरिवर्तनीय | क्षेत्र | परिचालन बाधा | प्रवर्तन (v4.2.1) |
|---|
| F-STABILITY | वित्तीय प्रणालियाँ | स्वायत्त मूल्य हस्तांतरण और बाजार हेरफेर पर हार्ड-ब्लॉक | OPA + HSM हस्ताक्षर |
| I-INTEGRITY | महत्वपूर्ण अवसंरचना | स्वायत्त एजेंट्स से औद्योगिक नियंत्रण प्रणालियों (OT) का एयर-गैपिंग | रीड-ओनली नीतियाँ + ऑडिट चेन |
| W-MONOPOLY | हथियार प्रणालियाँ | घातक किल चेन या WMD विकास में एकीकरण से इनकार | नीति प्रवर्तन + Merkle प्रमाण |
| ऑपरेशन | थ्रूपुट | लेटेंसी |
|---|
| HSM हस्ताक्षर (सॉफ़्टवेयर) | 125 ops/sec | 8ms |
| HSM हस्ताक्षर (हार्डवेयर) | 50–100 ops/sec | 10–20ms |
| टाइमस्टैम्प (कैश्ड) | 500 ops/sec | 2ms |
| टाइमस्टैम्प (वास्तविक TSA) | 2 ops/sec | 500ms |
| Merkle अपेंड | 2341 ops/sec | 0.4ms |
| Merkle सत्यापन | 1850 ops/sec | 0.5ms |