
Autoridade imposta pelo kernel e segurança em tempo de execução para agentes de IA, sistemas autônomos e cargas de trabalho gerais do Linux.
TLDR: Construí uma parede a nível de kernel para agentes, scripts e processos de userland comprometidos não confiáveis. A questão é fazer com que classes inteiras de efeitos privilegiados não autorizados falhem fechado sob um modelo de ameaça declarado, especialmente aqueles que funcionam herdando autoridade ou confiança que nunca foram realmente concedidas. Trata-se da expansão segura da capacidade agentiva, não de restrição. Se uma ação não foi explicitamente aprovada através do caminho confiável, ela não é executada, não importa quem está pedindo ou quão convincente o motivo pareça.
O KERNHELM é uma camada de imposição a nível de kernel que fica entre qualquer coisa que eu não confie totalmente (um agente de IA, um script, um processo que foi comprometido e ninguém percebeu ainda) e qualquer efeito privilegiado que essa coisa está realmente tentando realizar. A pista de prova atual demonstra essa forma em fronteiras de objeto de arquivo e execução. O design mais amplo é a mesma parede estendida para superfícies como conexões de rede, inspeção de processos, dispositivos e outros efeitos privilegiados.
Esta é a parte que a diferencia de tudo o mais. Quase toda segurança já construída pergunta alguma versão de quem é você. Sabe a senha? Você é um administrador? Esta chave é a chave certa? O KERNHELM não pergunta quem. Ele pergunta porquê. Esta ação é realmente algo que deveria acontecer, aprovado pelo único caminho autorizado a aprovar qualquer coisa, antes que seja permitido tocar no sistema. Saber a senha apenas prova que você sabe a senha. Não diz nada sobre se o que está acontecendo agora deveria estar acontecendo. Então nada passa sem uma permissão assinada criptograficamente vindo de um caminho completamente separado sobre o qual o lado solicitante não tem controle, o que significa que não importa quão bom tenha sido o raciocínio do outro lado. O lado não confiável nunca tem voto.
E só para que isto não pareça vaporware: é uma patente provisória, depositada em fevereiro de 2026, e já está construída e medida, com decisões de imposição na casa dos microssegundos de dígito único, pequena o suficiente para que seja muito improvável que importe para quase tudo que você realmente executaria.
Construí porque cansei de fingir que "o modelo provavelmente não fará isso" conta como um modelo de segurança real. Isso não é uma defesa, é uma esperança, e assisti toda a indústria vestir essa esperança com linguagem cada vez mais elaborada e dizer que está pronto.
Então, em vez de tentar fazer qualquer coisa se comportar, fui atrás de algo mais básico: fazer com que o mau comportamento encontre um limite de autoridade mecânico antes que possa fazer qualquer coisa privilegiada, não importa o que esteja fazendo o mau comportamento, e não importa quão convincente tenha sido o seu raciocínio no caminho.
E aqui está a parte que realmente importa, a parte que a maioria das estruturas de segurança entende ao contrário. Isto não é sobre restringir o que um agente pode fazer. É o oposto. Agora, a única maneira das pessoas se sentirem seguras executando um agente é encurralá-lo, tirar ferramentas, mantê-lo na coleira curta, vigiá-lo constantemente. Elas limitam o agente porque não podem confiar no chão abaixo dele. O KERNHELM torna o chão sólido, e uma vez que o chão é sólido, você pode deixar o agente fazer muito mais, não menos. Você pode dar a ele ferramentas reais e alcance real, porque o pior caso deixa de ser catastrófico, torna-se apenas um pedido negado e um recibo. A parede não está lá para diminuir o que seu agente tem permissão de tentar. Está lá para que você finalmente possa parar de ter medo de deixá-lo tentar coisas.
Isto é lido como um projeto de segurança de IA, o que faz sentido, porque essa é a questão mais barulhenta agora, mas não é realmente isso, ou pelo menos não é só isso. Meu próprio depósito nem diz "modelo de IA" quando descreve a ameaça. Diz que a coisa sendo governada pode ser um LLM, um script autônomo, "ou qualquer outro processo cujo comportamento não é totalmente previsível", que é o alvo real aqui. Um modelo que está alucinando e um rootkit que acabou de encontrar um ponto de apoio parecem exatamente iguais para esta parede, porque nenhum deles tem voto de qualquer maneira, um atinge a parede pela frente, o outro por trás, mas todos se encontram na chamada de sistema.
E essa abrangência inclui software que nem é seu. Se algum provedor constrói um produto de IA agentivo e você o instala e o deixa executar no seu próprio hardware, esse agente é apenas mais um solicitante não confiável no que diz respeito à parede, não diferente de um script que você mesmo escreveu. Ele ainda precisa passar pela mesma verificação local, contra a mesma postura local, com o mesmo requisito de permissão assinada, independentemente de quem está no instalador ou de quais interesses o software foi originalmente construído para servir. O provedor não pode conceder ao seu próprio produto status extra na sua máquina só porque o escreveu. O Kernhelm ainda decide.
Praticamente toda abordagem que encontrei tenta gerenciar o ator de alguma forma, seja uma sandbox melhor, uma política mais inteligente, melhor detecção executada na entrada, ou um humano revisando as coisas mais cuidadosamente quando há tempo para isso. E tudo isso é real e vale a pena fazer, mas nada disso realmente muda a forma do problema subjacente, que é que algo a jusante está tentando inferir a intenção do comportamento do próprio ator no momento, e o comportamento no momento é exatamente o que um atacante motivado pode fabricar sob demanda. Não importa se esse atacante é uma pessoa que escreveu uma frase realmente inteligente ou um comprometimento de cadeia de suprimentos que ficou quieto por três versões.
Então, em algum momento, parei de tentar ler a intenção do ator no momento em que ele age e comecei a bloquear o efeito em vez disso. A intenção ainda importa, importa mais do que qualquer coisa, mas é estabelecida antecipadamente, pela autoridade real, e congelada em uma permissão assinada. Nada tenta adivinhá-la em tempo de execução a partir de como a coisa está se comportando. A intenção correta já foi carimbada. A parede apenas verifica a forma.
O que isso realmente significa é dividir a coisa que quer fazer algo da coisa que tem permissão para fazer algo, e então colocar uma parede entre essas duas sobre a qual o lado que quer não tem autoridade alguma, não porque foi bloqueado hoje especificamente, mas porque nunca recebeu uma chave para começar.
Vale a pena ser preciso, porque decidir o que realmente queremos que um agente faça, que valores deve servir, que contexto torna uma ação totalmente aceitável e a mesma ação em outro lugar um desastre, isso é uma questão humana, e sempre foi. Nada nesta arquitetura tenta responder a essa pergunta, e nada aqui jamais teve a intenção de fazê-lo. Cada permissão que é cunhada remonta a uma decisão explícita que uma pessoa tomou através de um autorizador confiável (chamo de Gate Clerk, mais sobre isso daqui a pouco). A parede não decide o que vale a pena querer em primeiro lugar. Esse nunca foi o seu trabalho.
O que ela remove é um segundo requisito de confiança separado que aparece logo após essa primeira decisão ser tomada. Porque agora, uma vez que você decidiu o que quer, você também tem que confiar que o agente realmente vai seguir isso, todas as vezes, contra todas as formulações possíveis que um atacante ainda nem pensou. E esse segundo requisito de confiança é o que continua falhando na prática, porque a intenção simplesmente não sobrevive ao contato com um sistema que é adversarial, ou confuso, ou simplesmente errado sobre o que achou que você quis dizer.