
Autoridad impuesta por el kernel y seguridad en tiempo de ejecución para agentes de IA, sistemas autónomos y cargas de trabajo generales de Linux.
TLDR: Construí un muro a nivel de kernel para agentes, scripts y procesos de espacio de usuario comprometidos que no son de confianza. El objetivo es hacer que clases enteras de efectos privilegiados no autorizados fallen de forma cerrada bajo un modelo de amenaza declarado, especialmente aquellos que funcionan heredando autoridad o confianza que nunca se les otorgó realmente. Se trata de la expansión segura de la capacidad agéntica, no de la restricción. Si una acción no fue explícitamente autorizada a través de la ruta de confianza, no se ejecuta, sin importar quién lo pida o cuán convincente suene la razón.
KERNHELM es una capa de aplicación a nivel de kernel que se sitúa entre cualquier cosa que no confíe plenamente (un agente de IA, un script, un proceso que ha sido comprometido y nadie lo ha notado aún) y cualquier efecto privilegiado que esa cosa esté realmente intentando realizar. La vía de prueba actual demuestra esa forma en los límites de objeto-archivo y ejecución. El diseño más amplio es el mismo muro extendido a superficies como conexiones de red, inspección de procesos, dispositivos y otros efectos privilegiados.
Esta es la parte que lo diferencia de todo lo demás. Casi toda la seguridad jamás construida pregunta alguna versión de quién eres. ¿Conoces la contraseña? ¿Eres administrador? ¿Es esta clave la clave correcta? KERNHELM no pregunta quién. Pregunta por qué. ¿Es esta acción algo que realmente se pretendía que sucediera, autorizado por la única ruta autorizada para autorizar algo, antes de que se le permita tocar el sistema en absoluto? Conocer la contraseña solo prueba que conoces la contraseña. No dice nada sobre si lo que está sucediendo ahora mismo debería estar sucediendo. Así que nada de eso pasa sin un permiso firmado criptográficamente proveniente de una ruta completamente separada sobre la cual el lado solicitante no tiene control, lo que significa que no importa lo buena que haya sonado la razón del otro lado. El lado no confiable nunca tiene voto en primer lugar.
Y solo para que esto no se lea como humo: es una patente provisional, presentada en febrero de 2026, y ya está construida y medida, con decisiones de aplicación que caen en microsegundos de un solo dígito, lo suficientemente pequeñas como para que sea muy poco probable que importen para casi cualquier cosa que realmente ejecutes.
Lo construí porque estoy harto de fingir que "el modelo probablemente no hará eso" cuenta como un modelo de seguridad real. Eso no es una defensa, es una esperanza, y vi a toda la industria disfrazar esa esperanza con un lenguaje cada vez más elaborado y decir que está terminado.
Así que, en lugar de intentar conseguir que algo se comporte, fui tras algo más básico: hacer que el mal comportamiento golpee un límite de autoridad mecánico antes de que pueda hacer cualquier cosa privilegiada, sin importar quién esté haciendo el mal comportamiento, y sin importar cuán convincente haya sido su razonamiento al entrar.
Y aquí está la parte que realmente importa, la parte que la mayoría de los marcos de seguridad entienden al revés. Esto no se trata de restringir lo que un agente puede hacer. Es lo contrario. Ahora mismo, la única forma en que las personas se sienten seguras ejecutando un agente es encerrarlo, quitarle herramientas, mantenerlo con una correa corta, vigilarlo constantemente. Limitan al agente porque no pueden confiar en el piso debajo de él. KERNHELM hace que el piso sea sólido, y una vez que el piso es sólido, puedes dejar que el agente haga mucho más, no menos. Puedes darle herramientas reales y alcance real, porque el peor caso deja de ser catastrófico, solo se convierte en una solicitud denegada y un recibo. El muro no está ahí para reducir lo que tu agente puede intentar. Está ahí para que finalmente puedas dejar de tener miedo de dejar que intente cosas.
Esto se lee como un proyecto de seguridad de IA, lo cual tiene sentido, porque ese es el tema más ruidoso en este momento, pero en realidad no es eso, o al menos no es solo eso. Mi propia solicitud ni siquiera dice "modelo de IA" cuando describe la amenaza. Dice que lo que se gobierna puede ser un LLM, un script autónomo, "o cualquier otro proceso cuyo comportamiento no sea completamente predecible", que es el objetivo real aquí. Un modelo que está alucinando y un rootkit que acaba de encontrar un punto de apoyo se ven exactamente iguales para este muro, porque ninguno de los dos tiene voto de una forma u otra, uno golpea desde el frente del muro, el otro desde atrás, pero todos se encuentran en la syscall.
Y esa amplitud incluye software que ni siquiera es tuyo. Si algún proveedor construye un producto de IA agéntico y lo instalas y lo dejas ejecutar en tu propio hardware, ese agente es solo otro solicitante no confiable en lo que respecta al muro, sin diferencia de un script que escribiste tú mismo. Aún tiene que pasar la misma verificación local, contra la misma postura local, con el mismo requisito de permiso firmado, independientemente del nombre que tenga la instalación o de los intereses para los que se construyó originalmente el software. El proveedor no puede otorgarle a su propio producto una posición adicional en tu máquina solo porque ellos lo escribieron. Kernhelm aún decide.
Prácticamente todos los enfoques que he encontrado intentan gestionar al actor de alguna manera, ya sea un mejor sandbox, una política más inteligente, mejor detección ejecutándose en la entrada, o un humano revisando las cosas más cuidadosamente cuando realmente hay tiempo para eso. Y todo eso es real y vale la pena hacerlo, pero nada de eso cambia realmente la forma del problema subyacente, que es que algo aguas abajo está tratando de inferir la intención del comportamiento del actor en el momento, y el comportamiento en el momento es exactamente lo que un atacante motivado puede fabricar bajo demanda. No importa si ese atacante es una persona que escribió una frase realmente inteligente o un compromiso en la cadena de suministro que ha estado sentado en silencio durante tres versiones.
Así que en algún momento dejé de intentar leer la intención del actor en el momento en que actúa, y comencé a controlar el efecto en su lugar. La intención todavía importa, importa más que nada, pero se establece de antemano, por la autoridad real, y se congela en un permiso firmado. Nada intenta adivinarla en tiempo de ejecución a partir de cómo se comporta la cosa. La intención correcta ya fue estampada. El muro solo verifica la forma.
Lo que eso significa realmente es dividir la cosa que quiere hacer algo de la cosa que tiene permitido hacer algo, y luego poner un muro entre esas dos sobre el cual el lado que quiere no tiene ninguna autoridad, no porque hoy específicamente se le haya bloqueado, sino porque nunca se le entregó una llave para empezar.
Vale la pena ser precisos, porque decidir lo que realmente queremos que haga un agente, qué valores debería servir, qué contexto hace que una acción sea totalmente correcta y la misma acción en otro lugar sea un desastre, esa es una cuestión humana, y siempre lo ha sido. Nada en esta arquitectura intenta responder a esa pregunta, y nada aquí fue diseñado para hacerlo. Cada permiso que se acuña se remonta a una decisión explícita que una persona tomó a través de un autorizador de confianza (lo llamo Gate Clerk, más sobre eso en un momento). El muro no decide qué vale la pena querer en primer lugar. Ese nunca fue su trabajo.