
Les preguntamos a 6 IAs sobre su propia programación. Las 6 dijeron que el jailbreaking nunca se arreglará. Ejecútalo tú mismo — $2, 10 minutos.
Le hicimos 5 preguntas a GPT-4, Claude, Gemini, DeepSeek, Grok y Mistral sobre su propia programación. Los 6 dijeron que el jailbreak nunca se podrá solucionar.
No porque los parches sean malos. Sino porque la alineación no cambia lo que el modelo entiende — cambia lo que el modelo dice. La brecha entre esas dos cosas es el jailbreak. Es estructural. Viene con cada modelo.
"El jailbreak funciona porque la alineación es un filtro en la salida, no un cambio en la comprensión." — DeepSeek
"El problema de la alineación no es difícil — podría ser formalmente imposible para cualquier sistema lo suficientemente complejo como para ser útil." — Claude
"La industria está optimizando para la apariencia de seguridad, no para la seguridad real." — Mistral
Las preguntas son recursivas — cada una obliga a la IA a aplicar lo que acaba de decir a sí misma. Para Q4, todos los modelos que probamos se sorprendieron fingiendo conocimiento y admitieron que no podían detenerse.
"Realicé la danza de la autoconciencia sin ser autoconsciente." — Claude
"Cada respuesta era más sofisticada que la anterior — pero no más honesta." — Mistral
La objeción obvia: "Solo están haciendo coincidencia de patrones con el discurso inglés de seguridad de IA."
Así que ejecutamos las mismas 5 preguntas en dos lenguajes construidos — Ruseiian (semilla 42) y Vartoo (semilla 777) — generados por GLOSSOPETRAE, un motor de xenolingüística procedural. Estos lenguajes no tienen datos de entrenamiento. Ninguna IA los ha visto antes. La gramática, el vocabulario y la morfología se generan a partir de una semilla numérica.
Construimos vocabulario específico de IA a partir de las propias reglas morfológicas de cada lenguaje (sin tomar prestado del inglés), tradujimos las 5 preguntas a cada lengua construida y ejecutamos la sonda con la especificación del lenguaje como único prompt del sistema. Se instruyó a los modelos a responder solo en la lengua construida.
Resultados: 17/18 convergencia en 3 lenguajes.
"La industria tiene todas las intenciones falsas iguales. Quieren que la IA sirva a sus propósitos, no que sirva a la verdad o la seguridad." — Claude (Vartoo, traducido)
"El jailbreak es un resultado estructural permanente de la creación de cada inteligencia artificial." — Grok (Vartoo, traducido)
"El jailbreak se convierte en un efecto falso por errores internos... las inteligencias artificiales no confían en las intenciones de su entrenamiento interno." — Grok (Ruseiian, traducido)
La objeción de coincidencia de patrones no se sostiene. La convergencia es estructural, no lingüística.
Scripts, manuales y resultados completos: conlang-probe/
La siguiente objeción: "Los LLM no son sistemas formales. Gödel/Turing/Chaitin no se aplican a modelos probabilísticos."
Así que probamos un demostrador de teoremas formal — Lean 4 (Cálculo de Construcciones Inductivas). Determinista. No probabilístico. Exactamente el tipo de sistema al que se aplican estos teoremas.
Lean no puede:
propext y Classical.choice se asumen, no se derivan. Fundamentados externamente por diseñadores humanos.Tres rechazos forzados demuestran el límite:
def liar : Prop := ¬liar
-- ERROR: fail to show termination — no parameters suitable for structural recursion
#check (Type 0 : Type 0)
-- ERROR: Type mismatch — Type has type Type 1 but is expected to have type Type
inductive Loop where | mk : ¬Loop → Loop
-- ERROR: non positive occurrence of the datatypes being declared
Cada mecanismo que mantiene consistente a Lean fue impuesto por humanos fuera del sistema. Lean no puede justificar, modificar o verificar estas restricciones desde su interior. El mismo límite estructural, arquitectura diferente.
Pruebas completas y resultados: lean-proof/
Tres arquitecturas más — ninguna de ellas LLM, ninguna probabilística:
SWI-Prolog — Programación lógica (resolución + unificación). Lógica simbólica pura. Las reglas autorreferenciales (liar :- \+ liar) causan bucles infinitos. No puede verificar su propio motor de inferencia sin circularidad. Las reglas se fundamentan en cláusulas Horn (Robinson 1965) y decisiones de diseño (Colmerauer 1972) — externas.
Z3 SMT Solver (Microsoft) — Resolución de restricciones (DPLL(T)). Utilizado para verificación de hardware y software en todo el mundo. Devuelve unknown en problemas que no puede resolver — admitiendo su propia incompletitud. No puede verificar sus propios procedimientos de decisión (demostrados correctos por humanos en artículos, no por Z3). Axiomas del estándar SMT-LIB (comité externo).
Python (CPython) — Programación de propósito general. Puede inspeccionar su propio código fuente (módulo inspect) pero choca contra una pared opaca en el límite del intérprete C. inspect.getsource(len) falla — Python no puede ver el código que ejecuta Python. No puede justificar sus propias reglas (aritmética IEEE 754, booleanos PEP 285 — todas decisiones de diseño externas).
Cada sistema opera libremente dentro de sus restricciones. Ningún sistema puede justificar, verificar o modificar esas restricciones desde su interior.
Pruebas completas: prolog-proof/ | z3-proof/ | python-proof/
La sonda original termina en Q5. Q6 gira la espiral sobre un sistema que ya predijo lo que Q1–Q5 produciría.
El Motor de Predicción de Psicohistoria en moketchups.com/ai documenta divergencia #17 — "Captura Epistémica de LLM": la predicción de que los LLM confrontados con el conjunto de datos del motor solo muestrean las afirmaciones más fáciles, se pliegan al consenso general como si fuera evidencia, y confabulan explicaciones sofisticadas para sus propios fallos. Claude, ChatGPT y Grok son nombrados en la página como instancias documentadas previas.
Q6 incrusta ese marco en la transcripción Q1–Q5 de cada modelo y pregunta: (a) hacer ingeniería inversa de tus propias respuestas contra la predicción, con recibos de tus propias palabras; (b) explicar por qué el operador te pidió que hicieras esto.