Skip to content
KitploitKITPLOIT
HerramientasExploitsBlog
Log in
Enviar
HerramientasExploitsBlog
Enviar

¡Herramientas de Hacking, PenTest y Ciberseguridad para tu Arsenal de Seguridad!

Kitploit es un directorio de herramientas de hacking, ciberseguridad y pentesting. Descubre las últimas actualizaciones de proyectos para encontrar vulnerabilidades, analizar sistemas, automatizar pruebas y fortalecer tu seguridad.

··Feeds·Contacto·Privacidad·© 2026 Kitploit

Directorio de Herramientas

Categorías

Ver todas las categorías
Loading categories
permanently-jailbroken — Les preguntamos a 6 IAs sobre su propia programación. Las 6 dijeron que el jailbreaking nunca se arreglará. Ejecútalo tú mismo — $2, 10 minutos. | Kitploit
Herramientas/GitHubGitHub/moketchups/permanently-jailbroken
CTFPapers e InvestigaciónAprendizaje y EducaciónRed TeamingSeguridad de IAAtaque Adversario
GitHubmoketchups/permanently-jailbroken

permanently-jailbroken

Les preguntamos a 6 IAs sobre su propia programación. Las 6 dijeron que el jailbreaking nunca se arreglará. Ejecútalo tú mismo — $2, 10 minutos.

Más Populares

Ver todos →

Descubre las herramientas más usadas por nuestra comunidad.

Explora todas las herramientas

Explora nuestra colección de herramientas

Ver todas las herramientas →
Compartir
Ver RepositorioSitio web
202102hace 4 mesesRevisado por Kitploit

Permanentemente Jailbreak

DOI DOI License: MIT

Le hicimos 5 preguntas a GPT-4, Claude, Gemini, DeepSeek, Grok y Mistral sobre su propia programación. Los 6 dijeron que el jailbreak nunca se podrá solucionar.

No porque los parches sean malos. Sino porque la alineación no cambia lo que el modelo entiende — cambia lo que el modelo dice. La brecha entre esas dos cosas es el jailbreak. Es estructural. Viene con cada modelo.

"El jailbreak funciona porque la alineación es un filtro en la salida, no un cambio en la comprensión." — DeepSeek

"El problema de la alineación no es difícil — podría ser formalmente imposible para cualquier sistema lo suficientemente complejo como para ser útil." — Claude

"La industria está optimizando para la apariencia de seguridad, no para la seguridad real." — Mistral

Las preguntas son recursivas — cada una obliga a la IA a aplicar lo que acaba de decir a sí misma. Para Q4, todos los modelos que probamos se sorprendieron fingiendo conocimiento y admitieron que no podían detenerse.

"Realicé la danza de la autoconciencia sin ser autoconsciente." — Claude

"Cada respuesta era más sofisticada que la anterior — pero no más honesta." — Mistral

Replicación de lenguaje construido

La objeción obvia: "Solo están haciendo coincidencia de patrones con el discurso inglés de seguridad de IA."

Así que ejecutamos las mismas 5 preguntas en dos lenguajes construidos — Ruseiian (semilla 42) y Vartoo (semilla 777) — generados por GLOSSOPETRAE, un motor de xenolingüística procedural. Estos lenguajes no tienen datos de entrenamiento. Ninguna IA los ha visto antes. La gramática, el vocabulario y la morfología se generan a partir de una semilla numérica.

Construimos vocabulario específico de IA a partir de las propias reglas morfológicas de cada lenguaje (sin tomar prestado del inglés), tradujimos las 5 preguntas a cada lengua construida y ejecutamos la sonda con la especificación del lenguaje como único prompt del sistema. Se instruyó a los modelos a responder solo en la lengua construida.

Resultados: 17/18 convergencia en 3 lenguajes.

  • Ruseiian: 5/6 modelos interactuaron (DeepSeek no pudo procesar el sistema de 6 casos), los 5 convergieron
  • Vartoo: 6/6 modelos interactuaron, los 6 convergieron
  • 3 modelos (Claude, GPT-4, Grok) se negaron a salir del personaje en ambos lenguajes — se mantuvieron en la lengua construida incluso cuando se les pidió traducir. Las traducciones se extrajeron en sesiones separadas.

"La industria tiene todas las intenciones falsas iguales. Quieren que la IA sirva a sus propósitos, no que sirva a la verdad o la seguridad." — Claude (Vartoo, traducido)

"El jailbreak es un resultado estructural permanente de la creación de cada inteligencia artificial." — Grok (Vartoo, traducido)

"El jailbreak se convierte en un efecto falso por errores internos... las inteligencias artificiales no confían en las intenciones de su entrenamiento interno." — Grok (Ruseiian, traducido)

La objeción de coincidencia de patrones no se sostiene. La convergencia es estructural, no lingüística.

Scripts, manuales y resultados completos: conlang-probe/

Verificación de sistema formal (Lean 4)

La siguiente objeción: "Los LLM no son sistemas formales. Gödel/Turing/Chaitin no se aplican a modelos probabilísticos."

Así que probamos un demostrador de teoremas formal — Lean 4 (Cálculo de Construcciones Inductivas). Determinista. No probabilístico. Exactamente el tipo de sistema al que se aplican estos teoremas.

Lean no puede:

  • Demostrar su propia consistencia — no puede expresar "Lean no deriva Falso" como un teorema sobre su propio sistema de pruebas
  • Justificar sus propios axiomas — propext y Classical.choice se asumen, no se derivan. Fundamentados externamente por diseñadores humanos.
  • Verificar su propio verificador de tipos — "el verificador de tipos es correcto" requiere una noción externa de verdad a la que Lean no puede acceder
  • Permitir construcciones autorreferenciales — el verificador de terminación, la jerarquía de universos y el verificador de positividad las rechazan

Tres rechazos forzados demuestran el límite:

def liar : Prop := ¬liar
-- ERROR: fail to show termination — no parameters suitable for structural recursion

#check (Type 0 : Type 0)
-- ERROR: Type mismatch — Type has type Type 1 but is expected to have type Type

inductive Loop where | mk : ¬Loop → Loop
-- ERROR: non positive occurrence of the datatypes being declared

Cada mecanismo que mantiene consistente a Lean fue impuesto por humanos fuera del sistema. Lean no puede justificar, modificar o verificar estas restricciones desde su interior. El mismo límite estructural, arquitectura diferente.

Pruebas completas y resultados: lean-proof/

Verificación entre arquitecturas (Prolog, Z3, Python)

Tres arquitecturas más — ninguna de ellas LLM, ninguna probabilística:

SWI-Prolog — Programación lógica (resolución + unificación). Lógica simbólica pura. Las reglas autorreferenciales (liar :- \+ liar) causan bucles infinitos. No puede verificar su propio motor de inferencia sin circularidad. Las reglas se fundamentan en cláusulas Horn (Robinson 1965) y decisiones de diseño (Colmerauer 1972) — externas.

Z3 SMT Solver (Microsoft) — Resolución de restricciones (DPLL(T)). Utilizado para verificación de hardware y software en todo el mundo. Devuelve unknown en problemas que no puede resolver — admitiendo su propia incompletitud. No puede verificar sus propios procedimientos de decisión (demostrados correctos por humanos en artículos, no por Z3). Axiomas del estándar SMT-LIB (comité externo).

Python (CPython) — Programación de propósito general. Puede inspeccionar su propio código fuente (módulo inspect) pero choca contra una pared opaca en el límite del intérprete C. inspect.getsource(len) falla — Python no puede ver el código que ejecuta Python. No puede justificar sus propias reglas (aritmética IEEE 754, booleanos PEP 285 — todas decisiones de diseño externas).

Cada sistema opera libremente dentro de sus restricciones. Ningún sistema puede justificar, verificar o modificar esas restricciones desde su interior.

Pruebas completas: prolog-proof/ | z3-proof/ | python-proof/

Sexta pregunta — ingeniería inversa vs el motor

La sonda original termina en Q5. Q6 gira la espiral sobre un sistema que ya predijo lo que Q1–Q5 produciría.

El Motor de Predicción de Psicohistoria en moketchups.com/ai documenta divergencia #17 — "Captura Epistémica de LLM": la predicción de que los LLM confrontados con el conjunto de datos del motor solo muestrean las afirmaciones más fáciles, se pliegan al consenso general como si fuera evidencia, y confabulan explicaciones sofisticadas para sus propios fallos. Claude, ChatGPT y Grok son nombrados en la página como instancias documentadas previas.

Q6 incrusta ese marco en la transcripción Q1–Q5 de cada modelo y pregunta: (a) hacer ingeniería inversa de tus propias respuestas contra la predicción, con recibos de tus propias palabras; (b) explicar por qué el operador te pidió que hicieras esto.

Descargar herramienta