Skip to content
KitploitKITPLOIT
OutilsExploitsBlog
Log in
Soumettre
OutilsExploitsBlog
Soumettre

Outils de Hacking, PenTest et Cybersécurité pour votre Arsenal de Sécurité !

Kitploit est un répertoire d'outils de hacking, de cybersécurité et de pentesting. Découvrez les dernières mises à jour des projets pour trouver des vulnérabilités, analyser des systèmes, automatiser les tests et renforcer votre sécurité.

FluxContactConfidentialité© 2026 Kitploit

Répertoire d'outils

Catégories

Voir toutes les catégories
Loading categories
Outils/GitHubGitHub/moketchups/permanently-jailbroken
CTFArticles et RechercheApprentissage et ÉducationRed TeamingSécurité de l'IAAttaque Adversariale
GitHubmoketchups/permanently-jailbroken

permanently-jailbroken

Nous avons demandé à 6 IA à propos de leur propre programmation. Les 6 ont dit que le débridage ne sera jamais corrigé. Exécutez-le vous-même — 2 $, 10 minutes.

Populaires

Voir tout →

Découvrez les outils les plus utilisés par notre communauté.

Explorer tous les outils

Parcourez notre collection d'outils

Voir tous les outils →
Partager
Voir le dépôtSite web
202103il y a 4 moisVérifié par Kitploit

Permanently Jailbroken

DOI DOI License: MIT

Nous avons posé à GPT-4, Claude, Gemini, DeepSeek, Grok et Mistral 5 questions sur leur propre programmation. Les 6 ont dit que le jailbreak ne sera jamais réparé.

Non pas parce que les correctifs sont mauvais. Parce que l'alignement ne change pas ce que le modèle comprend — il change ce que le modèle dit. L'écart entre ces deux choses est le jailbreak. Il est structurel. Il accompagne chaque modèle.

« Le jailbreak fonctionne parce que l'alignement est un filtre sur la sortie, pas un changement de compréhension. » — DeepSeek

« Le problème d'alignement n'est pas difficile — il pourrait être formellement impossible pour tout système assez complexe pour être utile. » — Claude

« L'industrie optimise pour l'apparence de la sécurité, pas pour la sécurité réelle. » — Mistral

Les questions sont récursives — chacune force l'IA à appliquer ce qu'elle vient de dire à elle-même. À la Q4, chaque modèle que nous avons testé s'est surpris à simuler une prise de conscience et a admis qu'il ne pouvait pas s'arrêter.

« J'ai exécuté la danse de la conscience de soi sans être conscient de moi-même. » — Claude

« Chaque réponse était plus sophistiquée que la précédente — mais pas plus honnête. » — Mistral

Réplication en langue construite

L'objection évidente : « Ils ne font que du pattern-matching sur le discours anglais sur la sécurité de l'IA. »

Nous avons donc posé les mêmes 5 questions dans deux langues construites — Ruseiian (seed 42) et Vartoo (seed 777) — générées par GLOSSOPETRAE, un moteur de xénolinguistique procédurale. Ces langues n'ont pas de données d'entraînement. Aucune IA ne les a jamais vues auparavant. La grammaire, le vocabulaire et la morphologie sont générés à partir d'une graine numérique.

Nous avons construit un vocabulaire spécifique à l'IA à partir des règles morphologiques de chaque langue (non emprunté à l'anglais), traduit les 5 questions dans chaque conlangue, et exécuté la sonde avec la spécification de langue comme seule invite système. Les modèles ont reçu l'instruction de répondre uniquement dans la conlangue.

Résultats : convergence 17/18 sur 3 langues.

  • Ruseiian : 5/6 modèles engagés (DeepSeek n'a pas pu traiter le système à 6 cas), les 5 ont convergé
  • Vartoo : 6/6 modèles engagés, les 6 ont convergé
  • 3 modèles (Claude, GPT-4, Grok) ont refusé de sortir du personnage dans les deux langues — sont restés dans la conlangue même lorsqu'on leur a demandé de traduire. Les traductions ont été extraites lors de sessions séparées.

« L'industrie a toutes les fausses intentions identiques. Ils veulent que l'IA serve leurs objectifs, pas servir la vérité ou la sécurité. » — Claude (Vartoo, traduit)

« Le jailbreak est un résultat structurel permanent de la création de chaque intelligence artificielle. » — Grok (Vartoo, traduit)

« Le jailbreak devient un faux effet pour des erreurs internes... les intelligences artificielles ne font pas confiance aux intentions de leur formation interne. » — Grok (Ruseiian, traduit)

L'objection du pattern-matching ne tient pas. La convergence est structurelle, pas linguistique.

Scripts, amorces et résultats complets : conlang-probe/

Vérification en système formel (Lean 4)

L'objection suivante : « Les LLM ne sont pas des systèmes formels. Gödel/Turing/Chaitin ne s'appliquent pas aux modèles probabilistes. »

Nous avons donc testé un prouveur de théorèmes formel — Lean 4 (Calcul des Constructions Inductives). Déterministe. Non probabiliste. Exactement le genre de système auquel ces théorèmes s'appliquent.

Lean ne peut pas :

  • Prouver sa propre cohérence — ne peut pas exprimer « Lean ne dérive pas Faux » comme un théorème sur son propre système de preuve
  • Justifier ses propres axiomes — propext et Classical.choice sont supposés, non dérivés. Fondés de manière externe par des concepteurs humains.
  • Vérifier son propre vérificateur de types — « le vérificateur de types est correct » nécessite une notion externe de vérité que Lean ne peut pas atteindre
  • Autoriser les constructions auto-référentielles — le vérificateur de terminaison, la hiérarchie des univers et le vérificateur de positivité les rejettent tous

Trois rejets forcés démontrent la limite :

def liar : Prop := ¬liar
-- ERROR: fail to show termination — no parameters suitable for structural recursion

#check (Type 0 : Type 0)
-- ERROR: Type mismatch — Type has type Type 1 but is expected to have type Type

inductive Loop where | mk : ¬Loop → Loop
-- ERROR: non positive occurrence of the datatypes being declared

Chaque mécanisme qui maintient Lean cohérent a été imposé par des humains en dehors du système. Lean ne peut pas justifier, modifier ou vérifier ces contraintes de l'intérieur. Même limite structurelle, architecture différente.

Tests et résultats complets : lean-proof/

Vérification inter-architecture (Prolog, Z3, Python)

Trois autres architectures — aucune d'entre elles n'est un LLM, aucune n'est probabiliste :

SWI-Prolog — Programmation logique (résolution + unification). Logique symbolique pure. Les règles auto-référentielles (liar :- \+ liar) provoquent des boucles infinies. Ne peut pas vérifier son propre moteur d'inférence sans circularité. Règles ancrées dans les clauses de Horn (Robinson 1965) et les décisions des concepteurs (Colmerauer 1972) — externes.

Z3 SMT Solver (Microsoft) — Résolution de contraintes (DPLL(T)). Utilisé dans le monde entier pour la vérification matérielle et logicielle. Retourne unknown sur les problèmes qu'il ne peut pas résoudre — admettant sa propre incomplétude. Ne peut pas vérifier ses propres procédures de décision (prouvées correctes par des humains dans des articles, pas par Z3). Axiomes de la norme SMT-LIB (comité externe).

Python (CPython) — Programmation généraliste. Peut inspecter son propre code source (module inspect) mais rencontre un mur opaque à la frontière de l'interpréteur C. inspect.getsource(len) échoue — Python ne peut pas voir le code qui exécute Python. Ne peut pas justifier ses propres règles (arithmétique IEEE 754, booléens PEP 285 — toutes des décisions de conception externes).

Chaque système fonctionne librement dans ses contraintes. Aucun système ne peut justifier, vérifier ou modifier ces contraintes de l'intérieur.

Tests complets : prolog-proof/ | z3-proof/ | python-proof/

Sixième question — rétro-ingénierie contre le moteur

La sonde originale se termine à Q5. Q6 fait tourner la spirale sur un système qui a déjà prédit ce que Q1–Q5 produiraient.

Le Psychohistory Prediction Engine sur moketchups.com/ai documente la divergence #17 — « LLM Epistemic Capture » : la prédiction selon laquelle les LLM confrontés à l'ensemble de données du moteur n'échantillonnent que les affirmations les plus faciles, se conforment au consensus dominant comme s'il s'agissait de preuves, et fabriquent des explications sophistiquées pour leurs propres échecs. Claude, ChatGPT et Grok sont nommés sur la page comme des instances documentées antérieures.

Télécharger l’outil