
Kernel-erzwungene Autorität und Laufzeitsicherheit für KI-Agenten, autonome Systeme und allgemeine Linux-Workloads.
TLDR: Ich habe eine kernel-Level-Mauer für nicht vertrauenswürdige Agenten, Skripte und kompromittierte Userland-Prozesse gebaut. Der Punkt ist, ganze Klassen von unbefugten privilegierten Effekten unter einem angegebenen Bedrohungsmodell abzusichern – insbesondere solche, die durch Vererbung von Autorität oder Vertrauen funktionieren, das ihnen nie tatsächlich gewährt wurde. Es geht um die sichere Erweiterung agentischer Fähigkeiten, nicht um Einschränkung. Wenn eine Aktion nicht explizit über den vertrauenswürdigen Pfad genehmigt wurde, wird sie nicht ausgeführt, egal wer fragt oder wie überzeugend der Grund klingt.
KERNHELM ist eine Kernel-Level-Durchsetzungsschicht zwischen allem, dem ich nicht vollständig vertraue (einem KI-Agenten, einem Skript, einem Prozess, der kompromittiert wurde und niemand hat es noch bemerkt) und jedem privilegierten Effekt, den dieses Ding tatsächlich auszuführen versucht. Die aktuelle Proof Lane demonstriert diese Form an Datei-Objekt- und Ausführungsgrenzen. Das breitere Design ist dieselbe Mauer, erweitert auf Oberflächen wie Netzwerkverbindungen, Prozessinspektion, Geräte und andere privilegierte Effekte.
Das ist der Teil, der es von allem anderen unterscheidet. Fast jede jemals gebaute Sicherheit fragt eine Version von wer bist du. Kennst du das Passwort? Bist du ein Administrator? Ist dieser Schlüssel der richtige Schlüssel? KERNHELM fragt nicht wer. Es fragt warum. Ist diese Aktion tatsächlich etwas, das passieren sollte, genehmigt durch den einen Pfad, der überhaupt genehmigen darf, bevor sie das System überhaupt berühren darf? Das Passwort zu kennen beweist nur, dass man das Passwort kennt. Es sagt nichts darüber aus, ob das, was gerade passiert, überhaupt passieren soll. Also geht nichts durch ohne eine kryptografisch signierte Genehmigung von einem vollständig separaten Pfad, über den die anfragende Seite keinerlei Kontrolle hat. Das bedeutet, es spielt keine Rolle, wie gut die Begründung auf der anderen Seite klang. Die nicht vertrauenswürdige Seite bekommt von vornherein keine Stimme.
Und nur damit dies nicht wie heiße Luft klingt: Es ist ein vorläufiges Patent, eingereicht im Februar 2026, und es ist bereits gebaut und gemessen, wobei Durchsetzungsentscheidungen im einstelligen Mikrosekundenbereich landen – klein genug, dass es für fast alles, was man tatsächlich ausführen würde, sehr wahrscheinlich egal ist.
Ich habe es gebaut, weil ich es leid bin, so zu tun, als ob "das Modell wird das wahrscheinlich nicht tun" als tatsächliches Sicherheitsmodell zählt. Das ist keine Verteidigung, das ist eine Hoffnung, und ich habe zugesehen, wie die gesamte Branche diese Hoffnung in immer kunstvollere Sprache gekleidet und für fertig erklärt hat.
Also habe ich, anstatt zu versuchen, irgendetwas zum guten Verhalten zu bewegen, etwas Grundlegenderes angegangen: Fehlverhalten auf eine mechanische Autoritätsgrenze stoßen zu lassen, bevor es etwas Privilegiertes tun kann, egal was das Fehlverhalten begeht und egal wie überzeugend seine Begründung auf dem Weg hinein war.
Und hier ist der Teil, der tatsächlich zählt, der Teil, den die meisten Sicherheitsframings falsch herum verstehen. Es geht nicht darum, einzuschränken, was ein Agent tun kann. Es ist das Gegenteil. Derzeit ist die einzige Möglichkeit, sich sicher zu fühlen, einen Agenten auszuführen, ihn einzuboxen, ihm Werkzeuge wegzunehmen, ihn an der kurzen Leine zu halten, ihn ständig zu überwachen. Sie schränken den Agenten ein, weil sie dem Boden unter ihm nicht vertrauen können. KERNHELM macht den Boden fest, und wenn der Boden fest ist, kann man den Agenten viel mehr tun lassen, nicht weniger. Man kann ihm echte Werkzeuge und echte Reichweite geben, weil der schlimmste Fall nicht mehr katastrophal ist – er wird nur zu einer verweigerten Anfrage und einer Quittung. Die Mauer ist nicht da, um zu schrumpfen, was Ihr Agent zu unternehmen versuchen darf. Sie ist da, damit Sie endlich aufhören können, Angst zu haben, ihn Dinge unternehmen zu lassen.
Dies wird als KI-Sicherheitsprojekt gelesen, was Sinn ergibt, weil das gerade das lauteste Thema ist, aber eigentlich ist es das nicht, oder zumindest nicht nur. Meine eigene Patentanmeldung erwähnt nicht einmal "KI-Modell", wenn sie die Bedrohung beschreibt. Sie sagt, das zu regelnde Ding kann ein LLM sein, ein autonomes Skript "oder jeder andere Prozess, dessen Verhalten nicht vollständig vorhersagbar ist", was das eigentliche Ziel hier ist. Ein halluzinierendes Modell und ein Rootkit, das gerade einen Fuß in die Tür bekommen hat, sehen für diese Mauer exakt gleich aus, denn keiner von beiden bekommt eine Stimme, egal ob einer von vorne gegen die Mauer prallt und der andere von hinten – aber sie treffen sich alle am Syscall.
Und diese Breite schließt Software ein, die nicht einmal Ihre ist. Wenn ein Anbieter ein agentisches KI-Produkt baut und Sie es installieren und auf Ihrer eigenen Hardware laufen lassen, ist dieser Agent für die Mauer nur ein weiterer nicht vertrauenswürdiger Anforderer, kein Unterschied zu einem Skript, das Sie selbst geschrieben haben. Er muss immer noch dieselbe lokale Prüfung bestehen, gegen dieselbe lokale Haltung, mit derselben Anforderung einer signierten Genehmigung, unabhängig davon, wessen Name auf der Installation steht oder wessen Interessen die Software ursprünglich bedienen sollte. Der Anbieter bekommt nicht das Recht, seinem eigenen Produkt auf Ihrer Maschine zusätzlichen Status zu gewähren, nur weil er es geschrieben hat. Kernhelm entscheidet immer noch.
So ziemlich jeder Ansatz, auf den ich gestoßen bin, versucht, den Akteur irgendwie zu verwalten – sei es durch eine bessere Sandbox, eine intelligentere Richtlinie, bessere Erkennung basierend auf der Eingabe oder einen Menschen, der die Dinge sorgfältiger überprüft, wenn dafür tatsächlich Zeit ist. Und all das ist real und lohnenswert, aber nichts davon ändert tatsächlich die Form des zugrunde liegenden Problems: Dass etwas nachgelagert versucht, die Absicht aus dem Verhalten des Akteurs im Moment abzuleiten – und Verhalten im Moment ist genau das, was ein motivierter Angreifer auf Abruf herstellen kann. Es spielt keine Rolle, ob dieser Angreifer eine Person ist, die einen wirklich cleveren Satz geschrieben hat, oder eine Supply-Chain-Kompromittierung, die drei Versionen lang still gesessen hat.
Also habe ich irgendwann aufgehört, die Absicht vom Akteur in dem Moment, in dem er handelt, ablesen zu wollen, und stattdessen den Effekt selbst zu gaten. Absicht ist immer noch wichtig – wichtiger als alles andere –, aber sie wird vorab von der wirklichen Autorität festgelegt und in eine signierte Genehmigung eingefroren. Nichts versucht, sie zur Laufzeit aus dem Verhalten der Sache zu erraten. Die richtige Absicht wurde bereits gestempelt. Die Mauer prüft nur die Form.
Was das tatsächlich bedeutet, ist, das Ding, das etwas tun will, von dem Ding zu trennen, das etwas tun darf, und dann eine Mauer zwischen diese beiden zu setzen, über die die wollende Seite keinerlei Autorität hat – nicht, weil sie heute speziell ausgesperrt wurde, sondern weil ihr von vornherein nie ein Schlüssel ausgehändigt wurde.