Skip to content
KitploitKITPLOIT
StrumentiExploitsBlog
Log in
Invia
StrumentiExploitsBlog
Invia

Strumenti di Hacking, PenTest e Cybersecurity per il tuo Arsenale di Sicurezza!

Kitploit è una directory di strumenti di hacking, cybersecurity e pentesting. Scopri gli ultimi aggiornamenti dei progetti per trovare vulnerabilità, analizzare sistemi, automatizzare i test e rafforzare la tua sicurezza.

··Feed·Contatto·Privacy·© 2026 Kitploit

Directory degli strumenti

Categorie

Vedi tutte le categorie
Loading categories
bitcoder-v2-research — Repository di ricerca che documenta i limiti di generalizzazione degli LLM nel rilevamento di vulnerabilità di sicurezza nel codice, con valutazione incrociata su dataset sintetici e reali (Juliet, OWASP, CVEfixes, VUDENC) per SQL injection, path traversal e difetti di controllo degli accessi. | Kitploit
Strumenti/GitHubGitHub/bytepro-ai/bitcoder-v2-research
Analisi StaticaAnalisi delle VulnerabilitàAnalisi del CodiceSicurezza WebMachine LearningPaper e RicercaApprendimento e FormazioneSicurezza dell'IA
GitHub
bytepro-ai/bitcoder-v2-research

bitcoder-v2-research

Vedi Repository
11171 mese faNon ancora revisionato

Più Popolari

Vedi tutti →

Scopri gli strumenti più utilizzati dalla nostra community.

Esplora tutti gli strumenti

Sfoglia la nostra collezione di strumenti

Vedi tutti gli strumenti →

Informazioni

Repository di ricerca che documenta i limiti di generalizzazione degli LLM nel rilevamento di vulnerabilità di sicurezza nel codice, con valutazione incrociata su dataset sintetici e reali (Juliet, OWASP, CVEfixes, VUDENC) per SQL injection, path traversal e difetti di controllo degli accessi.

Condividi

Ricerca BitCoder-v2

Organizzazione: Bytepro AI
Stato: Ricerca attiva — repository privato
Obiettivo: arXiv Q3 2026 + ARC Prize Paper Track Nov 2026

Obiettivo della ricerca

Documentare empiricamente che il limite del singolo prompt osservato nel ragionamento matematico (SAIR, arXiv:2504.18897) si ripresenta nel rilevamento delle vulnerabilità di sicurezza nel codice, confermando che l'ipotesi del router è indipendente dal dominio.

Tesi del paper

gpt-oss-20b + cheatsheet strutturato eguaglia i modelli frontier sulle distribuzioni sintetiche (Juliet, OWASP Benchmark) ma crolla sotto lo shift distribuzionale verso i dati reali (CVEfixes, VUDENC), documentando un limite di generalizzazione negli LLM per i compiti di sicurezza del codice.

Categorie di vulnerabilità

CategoriaCWEFonte dati
Iniezione SQLCWE-89VUDENC + Juliet + sintetico
Attraversamento di percorsoCWE-22VUDENC + Juliet + sintetico
Credenziali hardcodedCWE-798Juliet + sintetico
Pattern di query N+1—Solo sintetico
Controllo degli accessi non funzionanteCWE-284Solo sintetico

Progettazione sperimentale

Matrice di valutazione incrociata:

  • Sintetico → Sintetico (baseline)
  • Sintetico → Reale (shift distribuzionale — collasso atteso)
  • Reale → Reale (limite delle capacità)
  • Reale → Sintetico (verifica del transfer)

Modelli

  • Baseline: gpt-oss-20b tramite OpenRouter (ragionamento soppresso, temperatura bassa — coerente con la metodologia SAIR)
  • Riferimento frontier: GPT-4o o Claude Sonnet tramite Together AI
  • Target: Qwen2.5-14B con fine-tuning sul dataset BitCoder

Struttura del repository

  • scripts/ — script di elaborazione dati e valutazione
  • data/processed/ — dataset elaborati (ignorati da git quando privati)
  • experiments/ — risultati e analisi
  • cheatsheets/ — conoscenza strutturata delle vulnerabilità (privato)
  • models/ — configurazioni di fine-tuning (checkpoint ignorati da git)
  • papers/ — bozze dei paper
Scarica lo strumento