
AI एजेंट, स्वायत्त प्रणालियों और सामान्य Linux वर्कलोड के लिए कर्नेल-प्रवर्तित प्राधिकार और रनटाइम सुरक्षा।
टीएलडीआर: मैंने अविश्वसनीय एजेंटों, स्क्रिप्ट्स और समझौता किए गए यूजरलैंड प्रक्रियाओं के लिए कर्नेल-स्तरीय एक दीवार बनाई है। बात यह है कि अधिकृत प्रभावों के पूरे वर्गों को एक बताए गए खतरे के मॉडल के तहत विफल कर दिया जाए, खासकर उन्हें जो अधिकार या भरोसा प्राप्त करके काम करते हैं जो उन्हें कभी वास्तव में नहीं दिया गया था। यह एजेंटिक क्षमता के सुरक्षित विस्तार के बारे में है, प्रतिबंध के बारे में नहीं। यदि कोई कार्रवाई भरोसेमंद पथ के माध्यम से स्पष्ट रूप से हस्ताक्षरित नहीं की गई है, तो वह चलती नहीं है, चाहे कोई भी पूछ रहा हो या कारण कितना भी ठोस क्यों न लगे।
कर्नहेल्म एक कर्नेल-स्तरीय प्रवर्तन परत है जो किसी भी चीज़ के बीच बैठता है जिस पर मैं पूरी तरह से भरोसा नहीं करता (एक AI एजेंट, एक स्क्रिप्ट, एक प्रक्रिया जो समझौता किया गया है और अभी तक किसी ने ध्यान नहीं दिया है) और किसी भी विशेषाधिकार प्राप्त प्रभाव के बीच जो वह चीज़ वास्तव में लेने की कोशिश कर रही है। वर्तमान प्रूफ लेन फ़ाइल-ऑब्जेक्ट और निष्पादन सीमाओं पर उस आकार को प्रदर्शित करता है। व्यापक डिज़ाइन वही दीवार है जो नेटवर्क कनेक्शन, प्रक्रिया निरीक्षण, उपकरणों और अन्य विशेषाधिकार प्राप्त प्रभावों जैसी सतहों तक विस्तारित है।
यही वह हिस्सा है जो इसे बाकी सब से अलग बनाता है। अब तक बनाई गई लगभग सभी सुरक्षा किसी न किसी संस्करण में पूछती है कि तुम कौन हो। क्या तुम्हें पासवर्ड पता है? क्या तुम प्रशासक हो? क्या यह चाबी सही चाबी है? कर्नहेल्म यह नहीं पूछता कि कौन। यह पूछता है क्यों। क्या यह कार्रवाई वास्तव में कुछ ऐसा है जो होने वाला था, जिसे एकमात्र पथ द्वारा हस्ताक्षरित किया गया था जिसे किसी भी चीज़ पर हस्ताक्षर करने की अनुमति है, इससे पहले कि इसे सिस्टम को बिल्कुल छूने की अनुमति दी जाए? पासवर्ड जानना सिर्फ यह साबित करता है कि आप पासवर्ड जानते हैं। यह इस बारे में कुछ नहीं कहता कि अभी जो हो रहा है वह होना चाहिए या नहीं। इसलिए बिना क्रिप्टोग्राफिक रूप से हस्ताक्षरित परमिट के कुछ भी नहीं गुजरता है जो एक पूरी तरह से अलग पथ से आता है जिस पर अनुरोध करने वाले पक्ष का शून्य नियंत्रण है, जिसका अर्थ है कि दूसरी तरफ तर्क कितना भी अच्छा क्यों न लग रहा हो, इससे कोई फर्क नहीं पड़ता। अविश्वसनीय पक्ष को पहले स्थान पर कभी वोट नहीं मिलता।
और सिर्फ इसलिए कि यह वेपरवेयर न लगे: यह एक अस्थायी पेटेंट है, जो फरवरी 2026 में दायर किया गया था, और यह पहले से ही बनाया और मापा जा चुका है, जिसमें प्रवर्तन निर्णय एकल-अंक माइक्रोसेकंड में आते हैं, इतना छोटा कि आप वास्तव में जो कुछ भी चलाएंगे, उसके लिए इसका मायने रखना बहुत ही असंभव है।
मैंने इसे इसलिए बनाया क्योंकि मैं यह दिखावा करते-करते थक गया हूँ कि "मॉडल शायद ऐसा नहीं करेगा" एक वास्तविक सुरक्षा मॉडल के रूप में गिना जाता है। वह कोई बचाव नहीं है, वह एक उम्मीद है, और मैंने पूरे उद्योग को उस उम्मीद को तेजी से विस्तृत भाषा में तैयार करते और यह कहते देखा कि यह समाप्त हो गया है।
इसलिए किसी भी चीज़ को व्यवहार करने की कोशिश करने के बजाय, मैं कुछ और बुनियादी के पीछे गया: दुर्व्यवहार को एक यांत्रिक अधिकार सीमा से टकराने देना, इससे पहले कि वह कुछ विशेषाधिकार प्राप्त कर सके, चाहे वह कुछ भी दुर्व्यवहार कर रहा हो, और चाहे अंदर आने पर उसका तर्क कितना भी ठोस क्यों न रहा हो।
और यहाँ वह हिस्सा है जो वास्तव में मायने रखता है, वह हिस्सा जो अधिकांश सुरक्षा फ्रेमिंग उल्टा हो जाती है। यह इस बारे में नहीं है कि कोई एजेंट क्या कर सकता है, इसे प्रतिबंधित करना। यह इसके विपरीत है। अभी, लोग एक एजेंट को सुरक्षित महसूस करने का एकमात्र तरीका उसे बॉक्स में रखना, उपकरण छीन लेना, उसे छोटी पट्टे पर रखना, लगातार देखना है। वे एजेंट को सीमित करते हैं क्योंकि वे उसके नीचे की मंजिल पर भरोसा नहीं कर सकते। कर्नहेल्म मंजिल को ठोस बनाता है, और एक बार मंजिल ठोस हो जाने पर आप एजेंट को बहुत अधिक करने दे सकते हैं, कम नहीं। आप उसे वास्तविक उपकरण और वास्तविक पहुँच दे सकते हैं, क्योंकि सबसे बुरी स्थिति विनाशकारी होना बंद कर देती है, वह सिर्फ एक अस्वीकृत अनुरोध और एक रसीद बन जाती है। दीवार आपके एजेंट को प्रयास करने की अनुमति को कम करने के लिए नहीं है। यह इसलिए है ताकि आप अंततः उसे चीजों का प्रयास करने देने से डरना बंद कर सकें।
इसे AI सुरक्षा परियोजना के रूप में पढ़ा जाता है, जो समझ में आता है, क्योंकि अभी यह सबसे जोर का मुद्दा है, लेकिन यह वास्तव में वैसा नहीं है, या कम से कम केवल वैसा नहीं है। मेरी अपनी फाइलिंग में खतरे का वर्णन करते समय "AI मॉडल" भी नहीं कहा गया है। यह कहता है कि शासित होने वाली चीज़ एक LLM, एक स्वायत्त स्क्रिप्ट, "या कोई अन्य प्रक्रिया हो सकती है जिसका व्यवहार पूरी तरह से अनुमानित नहीं है," जो यहाँ वास्तविक लक्ष्य है। एक मॉडल जो भ्रमित कर रहा है और एक रूटकिट जिसने अभी-अभी एक पैर जमाया है, इस दीवार को बिल्कुल एक जैसे दिखते हैं, क्योंकि उनमें से किसी को भी वोट नहीं मिलता है, एक दीवार के सामने से टकराता है तो दूसरा पीछे से, लेकिन वे सभी सिस्कॉल पर मिलते हैं।
और उस चौड़ाई में वह सॉफ़्टवेयर भी शामिल है जो आपका भी नहीं है। यदि कोई प्रदाता एक एजेंटिक AI उत्पाद बनाता है और आप इसे इंस्टॉल करते हैं और इसे अपने स्वयं के हार्डवेयर पर चलने देते हैं, तो वह एजेंट दीवार के संबंध में सिर्फ एक और अविश्वसनीय अनुरोधकर्ता है, जो आपके द्वारा स्वयं लिखी गई स्क्रिप्ट से अलग नहीं है। उसे अभी भी उसी स्थानीय जाँच को पास करना होगा, उसी स्थानीय रुख के खिलाफ, उसी हस्ताक्षरित-परमिट आवश्यकता के साथ, भले ही इंस्टॉल पर किसका नाम हो या सॉफ़्टवेयर मूल रूप से किसके हितों की सेवा के लिए बनाया गया था। प्रदाता अपने स्वयं के उत्पाद को आपकी मशीन पर सिर्फ इसलिए अतिरिक्त स्थिति नहीं दे सकता क्योंकि उन्होंने इसे लिखा है। कर्नहेल्म अभी भी निर्णय लेता है।
लगभग हर दृष्टिकोण जो मैंने देखा है, वह किसी न किसी तरह से अभिनेता को प्रबंधित करने की कोशिश करता है, चाहे वह बेहतर सैंडबॉक्स हो, एक समझदार नीति, इनपुट पर चल रहा बेहतर डिटेक्शन, या एक मानव जो चीजों को अधिक ध्यान से समीक्षा कर रहा है जब वास्तव में उसके लिए समय हो। और वह सब वास्तविक है और करने लायक है, लेकिन उनमें से कोई भी वास्तव में अंतर्निहित समस्या के आकार को नहीं बदलता है, जो यह है कि कुछ डाउनस्ट्रीम अभिनेता के स्वयं के व्यवहार से उस पल में इरादा निकालने की कोशिश कर रहा है, और पल में व्यवहार बिल्कुल वही चीज़ है जो एक प्रेरित हमलावर मांग पर उत्पादन कर सकता है। इससे कोई फर्क नहीं पड़ता कि वह हमलावर एक व्यक्ति है जिसने वास्तव में एक चतुर वाक्य लिखा है या एक आपूर्ति श्रृंखला समझौता है जो तीन संस्करणों से चुपचाप बैठा है।
इसलिए किसी बिंदु पर मैंने अभिनेता से उसके कार्य करने के समय इरादा पढ़ने की कोशिश करना बंद कर दिया, और इसके बजाय प्रभाव को गेट करना शुरू कर दिया। इरादा अभी भी मायने रखता है, यह किसी भी चीज़ से अधिक मायने रखता है, लेकिन इसे शुरू में, वास्तविक प्राधिकरण द्वारा स्थापित किया जाता है, और एक हस्ताक्षरित परमिट में जमे हुए किया जाता है। कुछ भी रनटाइम पर इसका अनुमान लगाने की कोशिश नहीं करता है कि चीज़ कैसे व्यवहार कर रही है। सही इरादा पहले से ही मुद्रित किया जा चुका था। दीवार सिर्फ आकार की जाँच करती है।
इसका वास्तव में मतलब है कि उस चीज़ को विभाजित करना जो कुछ चाहती है और उस चीज़ से जो कुछ करने की अनुमति है, और फिर उन दोनों के बीच एक दीवार लगाना जिस पर इच्छुक पक्ष का शून्य अधिकार है, इसलिए नहीं कि उसे आज विशेष रूप से बंद कर दिया गया, बल्कि इसलिए कि उसे शुरू करने के लिए कभी चाबी नहीं दी गई थी।
यह सटीक होने लायक है, क्योंकि यह तय करना कि हम वास्तव में एक एजेंट से क्या करवाना चाहते हैं, उसे किन मूल्यों की सेवा करनी चाहिए, कौन सा संदर्भ एक कार्रवाई को पूरी तरह से ठीक और उसी कार्रवाई को कहीं और एक आपदा बनाता है, वह एक मानवीय प्रश्न है, और हमेशा से रहा है। इस आर्किटेक्चर में कुछ भी उस प्रश्न का उत्तर देने की कोशिश नहीं करता है, और यहाँ कुछ भी कभी उस उद्देश्य के लिए नहीं था। प्रत्येक एकल परमिट जो मिंट किया जाता है, वह एक स्पष्ट निर्णय पर वापस जाता है जो एक व्यक्ति ने एक भरोसेमंद प्राधिकरण (मैं इसे गेट क्लर्क कहता हूँ, उस पर एक सेकंड में और अधिक) के माध्यम से किया था। दीवार यह तय नहीं करती कि पहले स्थान पर क्या चाहने लायक है। वह कभी इसका काम नहीं था।
यह जो हटाता है वह एक दूसरी, अलग भरोसे की आवश्यकता है जो उस पहले निर्णय के तुरंत बाद दिखाई देती है। क्योंकि अभी, एक बार जब आपने तय कर लिया कि आप क्या चाहते हैं, तो आपको एजेंट पर भी भरोसा करना होता है कि वह वास्तव में उस पर कायम रहेगा, हर बार, हर संभावित वाक्यांश के खिलाफ जिसके बारे में एक हमलावर ने अभी तक सोचा भी नहीं है। और वह दूसरी भरोसे की आवश्यकता वह है जो व्यवहार में विफल होती रहती है, क्योंकि इरादा एक ऐसी प्रणाली के संपर्क में आने पर जीवित नहीं रहता है जो विरोधी है, या भ्रमित है, या बस इस बारे में गलत है कि उसने आपका क्या मतलब समझा।