
Awesome-LLMs-for-Vulnerability-Detection — Actualizado!
El índice más completo y actualizado continuamente de la comunidad sobre investigación de Modelos de Lenguaje de Gran Tamaño para la detección de vulnerabilidades de software: artículos sobre detección a nivel de función, a nivel de repositorio, agéntica y de contratos inteligentes, además de conjuntos de datos, puntos de referencia y estudios.
Awesome Large Language Models para Detección de Vulnerabilidades
Una lista curada de artículos, proyectos y habilidades de agentes sobre el uso de LLMs para la detección y descubrimiento de vulnerabilidades.
📄 Artículos
Solo se muestran trabajos de 2025 en adelante. Para trabajos anteriores, consulte Archivo de Artículos (2024 y anteriores).
| Título | Lugar | Año | Artículo | Github |
|---|---|---|---|---|
| VulnGym: Benchmarking Coding Agents for Repository-Level Vulnerability Detection | 2026 | enlace | enlace | |
| VulTriage: Triple-Path Context Augmentation for LLM-Based Vulnerability Detection | 2026 | enlace | enlace | |
| Synthesizing Multi-Agent Harnesses for Vulnerability Discovery | 2026 | enlace | enlace | |
| QRS: A Rule-Synthesizing Neuro-Symbolic Triad for Autonomous Vulnerability Discovery | 2026 | enlace | ||
| Seclens: Role-specific Evaluation of LLM's for security vulnerablity detection | 2026 | enlace | enlace | |
| Do Fine-Tuned LLMs Understand Vulnerabilities? An Investigation into the Semantic Trap | 2026 | enlace | ||
| Sifting the Noise: A Comparative Study of LLM Agents in Vulnerability False Positive Filtering | ISSTA | 2026 | enlace | |
| AgenticSCR: An Autonomous Agentic Secure Code Review for Immature Vulnerabilities Detection | 2026 | enlace | ||
| LLM-based Vulnerability Detection at Project Scale: An Empirical Study | 2026 | enlace | ||
| MulVul: Retrieval-augmented Multi-Agent Code Vulnerability Detection via Cross-Model Prompt Evolution | 2026 | enlace | ||
| VulnLLM-R: Specialized Reasoning LLM with Agent Scaffold for Vulnerability Detection | 2025 | enlace | ||
| VULPO: Context-Aware Vulnerability Detection via On-Policy LLM Optimization | 2025 | enlace | ||
| VulInstruct: Teaching LLMs Root-Cause Reasoning for Vulnerability Detection via Security Specifications | 2025 | enlace | ||
| From Large to Mammoth: A Comparative Evaluation of Large Language Models in Vulnerability Detection | NDSS | 2025 | enlace | |
| Benchmarking LLMs and LLM-based Agents in Practical Vulnerability Detection for Code Repositories | ACL | 2025 | enlace | enlace |
| A Systematic Literature Review on Detecting Software Vulnerabilities with Large Language Models | 2025 | enlace | enlace | |
| LLMxCPG: Context-Aware Vulnerability Detection Through Code Property Graph-Guided Large Language Models | Usenix | 2025 | enlace | enlace |
| CLeVeR: Multi-modal Contrastive Learning for Vulnerability Code Representation | ACL Findings | 2025 | enlace | enlace |
| Mono: Is Your "Clean" Vulnerability Dataset Really Solvable? Exposing and Trapping Undecidable Patches and Beyond | 2025 | enlace | enlace | |
| Learning to Focus: Context Extraction for Efficient Code Vulnerability Detection with Language Models | 2025 | enlace | ||
| SV-TrustEval-C: Evaluating Structure and Semantic Reasoning in Large Language Models for Source Code Vulnerability Analysis | SP | 2025 | enlace | enlace |
| SecVulEval: Benchmarking LLMs for Real-World C/C++ Vulnerability Detection | 2025 | enlace | enlace | |
| CVE-Bench: Benchmarking LLM-based Software Engineering Agent's Ability to Repair Real-World CVE Vulnerabilities | NAACL | 2025 | enlace | enlace |
| R2Vul: Learning to Reason about Software Vulnerabilities with Reinforcement Learning and Structured Reasoning Distillation | 2025 | enlace | enlace | |
| Neuro-symbolic Static Analysis with LLM-generated Vulnerability Patterns | 2025 | enlace | ||
| Context-Enhanced Vulnerability Detection Based on Large Language Model | 2025 | enlace | ||
| Everything You Wanted to Know About LLM-based Vulnerability Detection But Were Afraid to Ask | 2025 | enlace | enlace | |
| MOS: Towards Effective Smart Contract Vulnerability Detection through Mixture-of-Experts Tuning of Large Language Models | 2025 | enlace | ||
| Abundant Modalities Offer More Nutrients: Multi-Modal-Based Function-Level Vulnerability Detection | TOSEM | 2025 | enlace | enlace |
| Generative Large Language Model usage in Smart Contract Vulnerability Detection | 2025 | enlace | ||
| Closing the Gap: A User Study on the Real-world Usefulness of AI-powered Vulnerability Detection & Repair in the IDE | ICSE | 2025 | enlace | enlace |
| Vulnerability Detection with Code Language Models: How Far Are We? | ICSE | 2025 | enlace | enlace |
| Combining Fine-Tuning and LLM-based Agents for Intuitive Smart Contract Auditing with Justifications | ICSE | 2025 | enlace | |
| LAMD: Context-driven Android Malware Detection and Classification with LLMs | 2025 | enlace | ||
| LLMs in Software Security: A Survey of Vulnerability Detection Techniques and Insights | 2025 | enlace | enlace | |
| One-for-All Does Not Work! Enhancing Vulnerability Detection by Mixture-of-Experts (MoE) | 2025 | enlace |
🚀 Proyectos
| Nombre | Descripción | Github |
|---|---|---|
| OpenAnt (Knostic) | Descubrimiento de vulnerabilidades en múltiples etapas impulsado por LLM con verificación adversarial | enlace |
| DeepAudit | Plataforma de red team de IA multiagente con validación de exploits mediante sandbox Docker | enlace |
| AutoCVE | Detección y reporte automatizado de vulnerabilidades con arquitectura multiagente | enlace |
| Darkmoon | Plataforma autónoma de pentest con IA de código abierto (GPL-3.0) y host MCP; subagentes ofensivos por tecnología, cobertura de Active Directory y Kubernetes, más de 80 herramientas orquestadas, rastro de evidencia por hallazgo | enlace |
| strix | Herramienta autónoma de pentest con IA de código abierto instalable vía pip | enlace |
| deepsec (Vercel) | Arnés de seguridad para escaneo profundo de vulnerabilidades en codebases con agentes de codificación | enlace |
🧩 Habilidades de Agentes
| Nombre | Descripción | Enlace |
|---|---|---|
| codex-security (OpenAI) | Escaneo autónomo de vulnerabilidades a nivel de repositorio mediante agentes Codex | enlace |
| defending-code-reference-harness (Anthropic) | Habilidades de referencia para modelado de amenazas, escaneo, triaje y parcheo con Claude Code | enlace |
| security-audit-skill (Cloudflare) | Habilidad de auditoría de seguridad en seis fases con agentes de búsqueda en paralelo y validación adversarial | enlace |
📡 arxiv.md
Captura y actualización diaria automatizada de artículos de Arxiv para palabras clave específicas mediante flujos de trabajo.
Agradecimientos
El flujo de trabajo Updated Arxiv Papers Daily del proyecto se basa en este proyecto LLM4SE. Refactoricé su código original utilizando la biblioteca arxiv.