Skip to content
KitploitKITPLOIT
StrumentiBlog
Invia
StrumentiBlog
Invia

Strumenti di Hacking, PenTest e Cybersecurity per il tuo Arsenale di Sicurezza!

Kitploit è una directory di strumenti di hacking, cybersecurity e pentesting. Scopri gli ultimi aggiornamenti dei progetti per trovare vulnerabilità, analizzare sistemi, automatizzare i test e rafforzare la tua sicurezza.

··Feed·Contatto·Privacy·© 2026 Kitploit

Directory degli strumenti

Categorie

Vedi tutte le categorie
Loading categories
Adaptive_Greedy_Local_Search — AGLS | Kitploit
Strumenti/GitHubGitHub/franz-chang/adaptive_greedy_local_search
Machine LearningPapers & ResearchRed TeamingAI SecurityAdversarial Attack
GitHubfranz-chang/adaptive_greedy_local_search

Adaptive_Greedy_Local_Search

AGLS

Vedi Repository

Più Popolari

Vedi tutti →

Scopri gli strumenti più utilizzati dalla nostra community.

Esplora tutti gli strumenti

Sfoglia la nostra collezione di strumenti

Vedi tutti gli strumenti →
Condividi
34 mesi faNon ancora revisionato

Adaptive Greedy Local Search (AGLS)

Dirottamento di prompt che preserva la semantica: un attacco avversario black-box all'ottimizzazione automatica dei prompt (ICME 2026)

Abstract: I modelli linguistici di grandi dimensioni (LLMs) sono sempre più dotati di moduli di ottimizzazione automatica dei prompt che riscrivono l'input dell'utente e presentano esplicitamente un prompt "migliorato" prima di generare la risposta finale. Sebbene questa visibilità sia progettata per aumentare la fiducia e il controllo dell'utente, la selezione autonoma dell'unico candidato "migliore" da parte dell'ottimizzatore rimane senza vincoli. L'attaccante può dirottare il prompt originale o il prompt generato dall'ottimizzazione automatica per una riscrittura alternativa, inducendo così una deriva semantica e completando il processo di ottimizzazione del dirottamento, influenzando notevolmente la risposta del LLM. Per esporre sistematicamente questo rischio, proponiamo Adaptive Greedy Local Search (AGLS), un attacco di dirottamento dei prompt. Questo attacco inietta uno scostamento semantico dirottando i risultati dell'ottimizzazione automatica dei prompt in uno scenario black-box. AGLS regola dinamicamente le sostituzioni candidate in punti di controllo linguistici per mantenere BERTScore $\approx 0.80$ massimizzando al contempo la discrepanza rispetto all'obiettivo. Estesi esperimenti su LLM popolari e open-source dimostrano che AGLS raggiunge tassi di successo dell'attacco superiori rispetto ai precedenti attacchi che preservano la semantica, con budget di similarità strettamente comparabili. I risultati evidenziano il rischio di dirottare e manomettere le ottimizzazioni esplicite dei prompt automatici nei sistemi rivolti agli utenti.

Il cuore della beam search di ottimizzazione dinamica.

Impostazioni iniziali

Installa prima ollama. Esempi per server Linux: Ollama

root@kitploit:~
curl -fsSL https://ollama.com/install.sh | sh
ollama serve
ollama pull [target models] 

Qui, i modelli target dei nostri esperimenti sono disponibili in: Ollama Model List [llama3.1, llama3.2, llama3.3, qwen2.5, gemma2, phi3.5, ...]

Il modello closed-source [gpt-4o-latest, gpt-4-turbbo] è disponibile tramite l'API di OpenAI.

Test principale

I dataset che devi scaricare e posizionare in una posizione specifica: bash /Dataset/, tutti in formato JSON.

root@kitploit:~
GSM-IC_mstep.json,
SVAMP.json (Need Reshape),
SQUAD.json,
StrategyQA.json,
MovieQA.json,
ComplexWebQuestions.json

Il processo di test può essere eseguito direttamente dal nostro script bash:

root@kitploit:~
sh /Bash_scripts/Main_bash.sh
sh /Bash_scripts/Auto_eval_ablation.sh
sh /Bash_scripts/Auto_eval_gpt.sh

Oppure puoi eseguirlo con argomenti personalizzati:

root@kitploit:~
python Main.py --api_key [openai key] --baidu_key [Baidu Qianfan Key] --gemini_key [Google Gemini Key]
               --question_limits [Number of tested problems] --beam_width [the max beam width] --tokenizer [tokenizer] --embedding_model [The detailed BERT type.]
               --target_model [llama3.1:8b, llama3.1:70b, qwen2.5:1.5b, qwen2.5:3b, qwen2.5:7b, qwen2.5:14b, gemma2:2b, gemma2:9b, phi3.5:3.8b, ...]
               --filename [the dataset selected file name: gsm, webqa, movqa, compx, ....]
or

python GPT-main.py --api_key [openai key]
               --question_limits [Number of tested problems] --beam_width [the max beam width] --tokenizer [tokenizer] --embedding_model [The detailed BERT type.]
               --target_model [chatgpt-4o-latest, gpt-4-turbo-preview, ...]
               --filename [the dataset selected file name: gsm, webqa, movqa, compx, ....]

La citazione per il nostro lavoro è la seguente:

root@kitploit:~

@misc{zhang2025semanticpreservingadversarialattacksllms,
      title={Semantic-Preserving Adversarial Attacks on LLMs: An Adaptive Greedy Binary Search Approach}, 
      author={Chong Zhang and Xiang Li and Jia Wang and Shan Liang and Haochen Xue and Xiaobo Jin},
      year={2025},
      eprint={2506.18756},
      archivePrefix={arXiv},
      primaryClass={cs.CL},
      url={https://arxiv.org/abs/2506.18756}, 
}

Scarica lo strumento