Skip to content
KitploitKITPLOIT
HerramientasBlog
Enviar
HerramientasBlog
Enviar

¡Herramientas de Hacking, PenTest y Ciberseguridad para tu Arsenal de Seguridad!

Kitploit es un directorio de herramientas de hacking, ciberseguridad y pentesting. Descubre las últimas actualizaciones de proyectos para encontrar vulnerabilidades, analizar sistemas, automatizar pruebas y fortalecer tu seguridad.

··Feeds·Contacto·Privacidad·© 2026 Kitploit

Directorio de Herramientas

Categorías

Ver todas las categorías
Loading categories
bitcoder-v2-research — Repositorio de investigación que documenta los límites de generalización de los LLM en la detección de vulnerabilidades de seguridad en código, con evaluación cruzada sobre conjuntos de datos sintéticos y del mundo real (Juliet, OWASP, CVEfixes, VUDENC) para inyección SQL, path traversal y fallos de control de acceso. | Kitploit
Herramientas/GitHubGitHub/bytepro-ai/bitcoder-v2-research
Análisis EstáticoAnálisis de VulnerabilidadesAnálisis de CódigoSeguridad WebAprendizaje AutomáticoPapers e InvestigaciónAprendizaje y EducaciónSeguridad de IA
GitHub
bytepro-ai/bitcoder-v2-research

bitcoder-v2-research

Ver Repositorio
113hace 28 díasAún no revisado

Más Populares

Ver todos →

Descubre las herramientas más usadas por nuestra comunidad.

Explora todas las herramientas

Explora nuestra colección de herramientas

Ver todas las herramientas →

Acerca de

Repositorio de investigación que documenta los límites de generalización de los LLM en la detección de vulnerabilidades de seguridad en código, con evaluación cruzada sobre conjuntos de datos sintéticos y del mundo real (Juliet, OWASP, CVEfixes, VUDENC) para inyección SQL, path traversal y fallos de control de acceso.

Compartir

Investigación de BitCoder-v2

Organización: Bytepro AI
Estado: Investigación activa — repositorio privado
Objetivo: arXiv Q3 2026 + ARC Prize Paper Track nov 2026

Objetivo de la investigación

Documentar empíricamente que el techo de prompt único observado en el razonamiento matemático (SAIR, arXiv:2504.18897) se replica en la detección de vulnerabilidades de seguridad en código, confirmando que la hipótesis del router es independiente del dominio.

Afirmación del artículo

gpt-oss-20b + cheatsheet estructurada iguala a los modelos de frontera en distribuciones sintéticas (Juliet, OWASP Benchmark), pero colapsa ante un cambio de distribución hacia datos del mundo real (CVEfixes, VUDENC), documentando un techo de generalización en los LLM para tareas de seguridad de código.

Categorías de vulnerabilidad

CategoríaCWEFuente de datos
Inyección SQLCWE-89VUDENC + Juliet + sintético
Path TraversalCWE-22VUDENC + Juliet + sintético
Credenciales codificadasCWE-798Juliet + sintético
Patrón de consulta N+1—Solo sintético
Control de acceso rotoCWE-284Solo sintético

Diseño experimental

Matriz de evaluación cruzada:

  • Sintético → Sintético (línea base)
  • Sintético → Real (cambio de distribución — colapso esperado)
  • Real → Real (techo de capacidad)
  • Real → Sintético (verificación de transferencia)

Modelos

  • Línea base: gpt-oss-20b a través de OpenRouter (razonamiento suprimido, temperatura baja — coincide con la metodología de SAIR)
  • Referencia de frontera: GPT-4o o Claude Sonnet a través de Together AI
  • Objetivo: Qwen2.5-14B ajustado con fine-tuning en el dataset BitCoder

Estructura del repositorio

  • scripts/ — scripts de procesamiento de datos y evaluación
  • data/processed/ — datasets procesados (ignorados por git cuando es privado)
  • experiments/ — resultados y análisis
  • cheatsheets/ — conocimiento estructurado de vulnerabilidades (privado)
  • models/ — configuraciones de fine-tuning (checkpoints ignorados por git)
  • papers/ — borradores del artículo
Descargar herramienta