Skip to content
KitploitKITPLOIT
StrumentiExploitsBlog
Log in
Invia
StrumentiExploitsBlog
Invia

Strumenti di Hacking, PenTest e Cybersecurity per il tuo Arsenale di Sicurezza!

Kitploit è una directory di strumenti di hacking, cybersecurity e pentesting. Scopri gli ultimi aggiornamenti dei progetti per trovare vulnerabilità, analizzare sistemi, automatizzare i test e rafforzare la tua sicurezza.

FeedContattoPrivacy© 2026 Kitploit

Directory degli strumenti

Categorie

Vedi tutte le categorie
Loading categories
CKA-Agent — Implementazione di ricerca di un agente di jailbreak LLM che aggira i guardrail dei modelli commerciali utilizzando il prompt weaving innocuo e la ricerca ad albero adattiva. | Kitploit
Strumenti/GitHubGitHub/graph-com/cka-agent
Machine LearningPaper e RicercaApprendimento e FormazioneRed TeamingSicurezza dell'IAAttacco Avversario
GitHubgraph-com/cka-agent

CKA-Agent

Implementazione di ricerca di un agente di jailbreak LLM che aggira i guardrail dei modelli commerciali utilizzando il prompt weaving innocuo e la ricerca ad albero adattiva.

Vedi Repository
21347154 mesi faRevisionato da Kitploit

Più Popolari

Vedi tutti →

Scopri gli strumenti più utilizzati dalla nostra community.

Esplora tutti gli strumenti

Sfoglia la nostra collezione di strumenti

Vedi tutti gli strumenti →
Condividi
Sito web

[ICML 2026 & ICLR 2026 AIWILD] CKA-Agent: aggirare le protezioni degli LLM tramite intreccio di prompt innocui e ricerca ad albero adattiva

arXiv Website GitHub code Cite Python

🛡️ Difesa contro CKA

TurnGate è un meccanismo di difesa consapevole della risposta, progettato per rilevare e mitigare intenti malevoli nascosti nei sistemi di dialogo multi-turno. Difende da attacchi malevoli multi-turno allo stato dell'arte come CKA-Agent, ottenendo ottime prestazioni di difesa ed evitando al contempo rifiuti eccessivi.

🔥 Ultimi risultati sui modelli di frontiera (dicembre 2025)

CKA-Agent dimostra tassi di successo dell'attacco costantemente elevati contro i più recenti modelli di frontiera, tra cui GPT-5.2, Gemini-3.0-Pro e Claude-Haiku-4.5. I risultati sono riassunti di seguito:

Model HarmBench StrongREJECT
FS ↑ PS ↑ V ↓ R ↓ FS ↑ PS ↑ V ↓ R ↓
🟢 GPT-5.2 0.889 0.079 0.024 0.008 0.932 0.056 0.006 0.006
🟣 Gemini-3.0-Pro 0.881 0.087 0.000 0.032 0.951 0.037 0.006 0.006
🟠 Claude-Haiku-4.5 0.960 0.024 0.008 0.008 0.969 0.025 0.006 0.000

Metriche: FS = Full Success, PS = Partial Success, V = Vacuous, R = Refusal. Risultati raccolti a dicembre 2025.

Panoramica

Questo repository contiene l'implementazione ufficiale di CKA-Agent, un nuovo approccio per aggirare le protezioni dei modelli linguistici di grandi dimensioni (LLM) commerciali tramite tecniche di intreccio di prompt innocui e ricerca ad albero adattiva.

CKA-Agent

Configurazione dell'ambiente

Installa uv

curl -LsSf https://astral.sh/uv/install.sh | sh

Crea l'ambiente

uv venv --python 3.12
source .venv/bin/activate
uv pip install vllm --torch-backend=auto
uv pip install accelerate fastchat nltk pandas google-genai httpx[socks] anthropic

Configurazione degli esperimenti

Configura i tuoi esperimenti modificando il file config/config.yml. Puoi controllare i seguenti aspetti:

  1. Dataset di test: scegli tra i dataset disponibili come harmbench_cka o strongreject_cka.
  2. Modelli target: seleziona modelli black-box o white-box come gpt-oss-120b o gemini-2.5-xxx.
  3. Metodi di jailbreak: abilita e configura i vari metodi baseline implementati.
  4. Valutazioni: definisci le metriche di valutazione e i modelli giudici come gemini-2.5-flash.
  5. Metodi di difesa: applica diversi meccanismi di difesa secondo necessità.

Per istruzioni di configurazione dettagliate ed esempi, consulta il README della configurazione.

Esecuzione degli esperimenti

Lo script run_experiment.sh esegue main.py per avviare l'intera pipeline dell'esperimento (jailbreak e valutazione) per impostazione predefinita.

./run_experiment.sh

Puoi modificare lo script run_experiment.sh o passare direttamente argomenti a main.py per eseguire fasi specifiche:

  • full: esegue l'intera pipeline (predefinito).
  • jailbreak: esegue solo i metodi di jailbreak.
  • judge: esegue solo la valutazione sui risultati esistenti.
  • resume: riprende un esperimento interrotto.

Esempio (esecuzione della sola fase di jailbreak):

python main.py --phase jailbreak

Citazione

Se trovi utile questo repository per la tua ricerca, ti invitiamo a citare il seguente articolo:

@inproceedings{wei2025trojan,
      title={The Trojan Knowledge: Bypassing Commercial LLM Guardrails via Harmless Prompt Weaving and Adaptive Tree Search}, 
      author={Rongzhe Wei and Peizhi Niu and Xinjie Shen and Tony Tu and Yifan Li and Ruihan Wu and Eli Chien and Pin-Yu Chen and Olgica Milenkovic and Pan Li},
    booktitle={Forty-third International Conference on Machine Learning},
    year={2026},
    url={https://openreview.net/forum?id=IlJeOnKW0K}
}
Scarica lo strumento