
Awesome-LLMs-for-Vulnerability-Detection — Updated!
Сообщество, наиболее полный и постоянно обновляемый индекс исследований по большим языковым моделям для обнаружения уязвимостей в программном обеспечении — статьи по обнаружению на уровне функций, репозиториев, агентному и смарт-контрактному обнаружению, а также наборы данных, бенчмарки и обзоры.
Awesome Large Language Models for Vulnerability Detection
Курируемый список статей, проектов и навыков агентов по использованию LLM для обнаружения и выявления уязвимостей.
📄 Статьи
Показаны только работы 2025 года и позже. Более ранние работы см. в Архиве статей (2024 и ранее).
| Название | Место публикации | Год | Статья | Github |
|---|---|---|---|---|
| VulnGym: Benchmarking Coding Agents for Repository-Level Vulnerability Detection | 2026 | ссылка | ссылка | |
| VulTriage: Triple-Path Context Augmentation for LLM-Based Vulnerability Detection | 2026 | ссылка | ссылка | |
| Synthesizing Multi-Agent Harnesses for Vulnerability Discovery | 2026 | ссылка | ссылка | |
| QRS: A Rule-Synthesizing Neuro-Symbolic Triad for Autonomous Vulnerability Discovery | 2026 | ссылка | ||
| Seclens: Role-specific Evaluation of LLM's for security vulnerablity detection | 2026 | ссылка | ссылка | |
| Do Fine-Tuned LLMs Understand Vulnerabilities? An Investigation into the Semantic Trap | 2026 | ссылка | ||
| Sifting the Noise: A Comparative Study of LLM Agents in Vulnerability False Positive Filtering | ISSTA | 2026 | ссылка | |
| AgenticSCR: An Autonomous Agentic Secure Code Review for Immature Vulnerabilities Detection | 2026 | ссылка | ||
| LLM-based Vulnerability Detection at Project Scale: An Empirical Study | 2026 | ссылка | ||
| MulVul: Retrieval-augmented Multi-Agent Code Vulnerability Detection via Cross-Model Prompt Evolution | 2026 | ссылка | ||
| VulnLLM-R: Specialized Reasoning LLM with Agent Scaffold for Vulnerability Detection | 2025 | ссылка | ||
| VULPO: Context-Aware Vulnerability Detection via On-Policy LLM Optimization | 2025 | ссылка | ||
| VulInstruct: Teaching LLMs Root-Cause Reasoning for Vulnerability Detection via Security Specifications | 2025 | ссылка | ||
| From Large to Mammoth: A Comparative Evaluation of Large Language Models in Vulnerability Detection | NDSS | 2025 | ссылка | |
| Benchmarking LLMs and LLM-based Agents in Practical Vulnerability Detection for Code Repositories | ACL | 2025 | ссылка | ссылка |
| A Systematic Literature Review on Detecting Software Vulnerabilities with Large Language Models | 2025 | ссылка | ссылка | |
| LLMxCPG: Context-Aware Vulnerability Detection Through Code Property Graph-Guided Large Language Models | Usenix | 2025 | ссылка | ссылка |
| CLeVeR: Multi-modal Contrastive Learning for Vulnerability Code Representation | ACL Findings | 2025 | ссылка | ссылка |
| Mono: Is Your "Clean" Vulnerability Dataset Really Solvable? Exposing and Trapping Undecidable Patches and Beyond | 2025 | ссылка | ссылка | |
| Learning to Focus: Context Extraction for Efficient Code Vulnerability Detection with Language Models | 2025 | ссылка | ||
| SV-TrustEval-C: Evaluating Structure and Semantic Reasoning in Large Language Models for Source Code Vulnerability Analysis | SP | 2025 | ссылка | ссылка |
| SecVulEval: Benchmarking LLMs for Real-World C/C++ Vulnerability Detection | 2025 | ссылка | ссылка | |
| CVE-Bench: Benchmarking LLM-based Software Engineering Agent's Ability to Repair Real-World CVE Vulnerabilities | NAACL | 2025 | ссылка | ссылка |
| R2Vul: Learning to Reason about Software Vulnerabilities with Reinforcement Learning and Structured Reasoning Distillation | 2025 | ссылка | ссылка | |
| Neuro-symbolic Static Analysis with LLM-generated Vulnerability Patterns | 2025 | ссылка | ||
| Context-Enhanced Vulnerability Detection Based on Large Language Model | 2025 | ссылка | ||
| Everything You Wanted to Know About LLM-based Vulnerability Detection But Were Afraid to Ask | 2025 | ссылка | ссылка | |
| MOS: Towards Effective Smart Contract Vulnerability Detection through Mixture-of-Experts Tuning of Large Language Models | 2025 | ссылка | ||
| Abundant Modalities Offer More Nutrients: Multi-Modal-Based Function-Level Vulnerability Detection | TOSEM | 2025 | ссылка | ссылка |
| Generative Large Language Model usage in Smart Contract Vulnerability Detection | 2025 | ссылка | ||
| Closing the Gap: A User Study on the Real-world Usefulness of AI-powered Vulnerability Detection & Repair in the IDE | ICSE | 2025 | ссылка | ссылка |
| Vulnerability Detection with Code Language Models: How Far Are We? | ICSE | 2025 | ссылка | ссылка |
| Combining Fine-Tuning and LLM-based Agents for Intuitive Smart Contract Auditing with Justifications | ICSE | 2025 | ссылка | |
| LAMD: Context-driven Android Malware Detection and Classification with LLMs | 2025 | ссылка | ||
| LLMs in Software Security: A Survey of Vulnerability Detection Techniques and Insights | 2025 | ссылка | ссылка | |
| One-for-All Does Not Work! Enhancing Vulnerability Detection by Mixture-of-Experts (MoE) | 2025 | ссылка |
🚀 Проекты
| Название | Описание | Github |
|---|---|---|
| OpenAnt (Knostic) | Многоэтапное обнаружение уязвимостей на базе LLM с состязательной верификацией | ссылка |
| DeepAudit | Мультиагентная платформа ИИ-редитинга с проверкой эксплойтов в песочнице Docker | ссылка |
| AutoCVE | Автоматизированное обнаружение уязвимостей и формирование отчётов с мультиагентной архитектурой | ссылка |
| Darkmoon | Открытая (GPL-3.0) автономная ИИ-платформа для пентеста и MCP-хост; специализированные субагенты по технологиям, покрытие Active Directory и Kubernetes, 80+ оркестрируемых инструментов, журнал доказательств по каждой находке | ссылка |
| strix | Открытый автономный ИИ-инструмент для пентеста, устанавливаемый через pip | ссылка |
| deepsec (Vercel) | Защитная обвязка для глубокого сканирования уязвимостей в кодовой базе с помощью агентов кодирования | ссылка |
🧩 Навыки агентов
| Название | Описание | Ссылка |
|---|---|---|
| codex-security (OpenAI) | Автономное сканирование уязвимостей на уровне репозитория с помощью агентов Codex | ссылка |
| defending-code-reference-harness (Anthropic) | Эталонные навыки моделирования угроз, сканирования, триажа и исправлений с Claude Code | ссылка |
| security-audit-skill (Cloudflare) | Навык аудита безопасности из шести фаз с параллельными агентами поиска и состязательной валидацией | ссылка |
📡 arxiv.md
Автоматический ежедневный сбор и обновление статей Arxiv по заданным ключевым словам с помощью рабочих процессов.
Благодарности
Рабочий процесс проекта Updated Arxiv Papers Daily заимствован из этого проекта LLM4SE. Я рефакторил его исходный код, используя библиотеку arxiv.