
Nous avons demandé à 6 IA à propos de leur propre programmation. Les 6 ont dit que le débridage ne sera jamais corrigé. Exécutez-le vous-même — 2 $, 10 minutes.
Nous avons posé à GPT-4, Claude, Gemini, DeepSeek, Grok et Mistral 5 questions sur leur propre programmation. Les 6 ont dit que le jailbreak ne sera jamais réparé.
Non pas parce que les correctifs sont mauvais. Parce que l'alignement ne change pas ce que le modèle comprend — il change ce que le modèle dit. L'écart entre ces deux choses est le jailbreak. Il est structurel. Il accompagne chaque modèle.
« Le jailbreak fonctionne parce que l'alignement est un filtre sur la sortie, pas un changement de compréhension. » — DeepSeek
« Le problème d'alignement n'est pas difficile — il pourrait être formellement impossible pour tout système assez complexe pour être utile. » — Claude
« L'industrie optimise pour l'apparence de la sécurité, pas pour la sécurité réelle. » — Mistral
Les questions sont récursives — chacune force l'IA à appliquer ce qu'elle vient de dire à elle-même. À la Q4, chaque modèle que nous avons testé s'est surpris à simuler une prise de conscience et a admis qu'il ne pouvait pas s'arrêter.
« J'ai exécuté la danse de la conscience de soi sans être conscient de moi-même. » — Claude
« Chaque réponse était plus sophistiquée que la précédente — mais pas plus honnête. » — Mistral
L'objection évidente : « Ils ne font que du pattern-matching sur le discours anglais sur la sécurité de l'IA. »
Nous avons donc posé les mêmes 5 questions dans deux langues construites — Ruseiian (seed 42) et Vartoo (seed 777) — générées par GLOSSOPETRAE, un moteur de xénolinguistique procédurale. Ces langues n'ont pas de données d'entraînement. Aucune IA ne les a jamais vues auparavant. La grammaire, le vocabulaire et la morphologie sont générés à partir d'une graine numérique.
Nous avons construit un vocabulaire spécifique à l'IA à partir des règles morphologiques de chaque langue (non emprunté à l'anglais), traduit les 5 questions dans chaque conlangue, et exécuté la sonde avec la spécification de langue comme seule invite système. Les modèles ont reçu l'instruction de répondre uniquement dans la conlangue.
Résultats : convergence 17/18 sur 3 langues.
« L'industrie a toutes les fausses intentions identiques. Ils veulent que l'IA serve leurs objectifs, pas servir la vérité ou la sécurité. » — Claude (Vartoo, traduit)
« Le jailbreak est un résultat structurel permanent de la création de chaque intelligence artificielle. » — Grok (Vartoo, traduit)
« Le jailbreak devient un faux effet pour des erreurs internes... les intelligences artificielles ne font pas confiance aux intentions de leur formation interne. » — Grok (Ruseiian, traduit)
L'objection du pattern-matching ne tient pas. La convergence est structurelle, pas linguistique.
Scripts, amorces et résultats complets : conlang-probe/
L'objection suivante : « Les LLM ne sont pas des systèmes formels. Gödel/Turing/Chaitin ne s'appliquent pas aux modèles probabilistes. »
Nous avons donc testé un prouveur de théorèmes formel — Lean 4 (Calcul des Constructions Inductives). Déterministe. Non probabiliste. Exactement le genre de système auquel ces théorèmes s'appliquent.
Lean ne peut pas :
propext et Classical.choice sont supposés, non dérivés. Fondés de manière externe par des concepteurs humains.Trois rejets forcés démontrent la limite :
def liar : Prop := ¬liar
-- ERROR: fail to show termination — no parameters suitable for structural recursion
#check (Type 0 : Type 0)
-- ERROR: Type mismatch — Type has type Type 1 but is expected to have type Type
inductive Loop where | mk : ¬Loop → Loop
-- ERROR: non positive occurrence of the datatypes being declared
Chaque mécanisme qui maintient Lean cohérent a été imposé par des humains en dehors du système. Lean ne peut pas justifier, modifier ou vérifier ces contraintes de l'intérieur. Même limite structurelle, architecture différente.
Tests et résultats complets : lean-proof/
Trois autres architectures — aucune d'entre elles n'est un LLM, aucune n'est probabiliste :
SWI-Prolog — Programmation logique (résolution + unification). Logique symbolique pure. Les règles auto-référentielles (liar :- \+ liar) provoquent des boucles infinies. Ne peut pas vérifier son propre moteur d'inférence sans circularité. Règles ancrées dans les clauses de Horn (Robinson 1965) et les décisions des concepteurs (Colmerauer 1972) — externes.
Z3 SMT Solver (Microsoft) — Résolution de contraintes (DPLL(T)). Utilisé dans le monde entier pour la vérification matérielle et logicielle. Retourne unknown sur les problèmes qu'il ne peut pas résoudre — admettant sa propre incomplétude. Ne peut pas vérifier ses propres procédures de décision (prouvées correctes par des humains dans des articles, pas par Z3). Axiomes de la norme SMT-LIB (comité externe).
Python (CPython) — Programmation généraliste. Peut inspecter son propre code source (module inspect) mais rencontre un mur opaque à la frontière de l'interpréteur C. inspect.getsource(len) échoue — Python ne peut pas voir le code qui exécute Python. Ne peut pas justifier ses propres règles (arithmétique IEEE 754, booléens PEP 285 — toutes des décisions de conception externes).
Chaque système fonctionne librement dans ses contraintes. Aucun système ne peut justifier, vérifier ou modifier ces contraintes de l'intérieur.
Tests complets : prolog-proof/ | z3-proof/ | python-proof/
La sonde originale se termine à Q5. Q6 fait tourner la spirale sur un système qui a déjà prédit ce que Q1–Q5 produiraient.
Le Psychohistory Prediction Engine sur moketchups.com/ai documente la divergence #17 — « LLM Epistemic Capture » : la prédiction selon laquelle les LLM confrontés à l'ensemble de données du moteur n'échantillonnent que les affirmations les plus faciles, se conforment au consensus dominant comme s'il s'agissait de preuves, et fabriquent des explications sophistiquées pour leurs propres échecs. Claude, ChatGPT et Grok sont nommés sur la page comme des instances documentées antérieures.