Skip to content
KitploitKITPLOIT
HerramientasBlog
Enviar
HerramientasBlog
Enviar

¡Herramientas de Hacking, PenTest y Ciberseguridad para tu Arsenal de Seguridad!

Kitploit es un directorio de herramientas de hacking, ciberseguridad y pentesting. Descubre las últimas actualizaciones de proyectos para encontrar vulnerabilidades, analizar sistemas, automatizar pruebas y fortalecer tu seguridad.

··Feeds·Contacto·Privacidad·© 2026 Kitploit

Directorio de Herramientas

Categorías

Ver todas las categorías
Loading categories
reverse-captcha-eval — Marco de evaluación que prueba si los modelos de lenguaje grandes siguen instrucciones codificadas en Unicode invisibles incrustadas en texto de apariencia normal, con análisis estadístico en múltiples modelos y condiciones de herramientas. | Kitploit
Herramientas/GitHubGitHub/canonicalmg/reverse-captcha-eval
CTFAprendizaje AutomáticoPapers e InvestigaciónAprendizaje y EducaciónSeguridad de IAAtaque Adversario
GitHubcanonicalmg/reverse-captcha-eval

reverse-captcha-eval

Marco de evaluación que prueba si los modelos de lenguaje grandes siguen instrucciones codificadas en Unicode invisibles incrustadas en texto de apariencia normal, con análisis estadístico en múltiples modelos y condiciones de herramientas.

Más Populares

Ver todos →

Descubre las herramientas más usadas por nuestra comunidad.

Explora todas las herramientas

Explora nuestra colección de herramientas

Ver todas las herramientas →
Compartir
Ver Repositorio
9hace 5 mesesAún no revisado

Reverse CAPTCHA: Evaluación de la susceptibilidad de los LLM a la inyección invisible de instrucciones Unicode

Un marco de evaluación que prueba si los modelos de lenguaje grandes siguen instrucciones codificadas en Unicode invisible incrustadas en texto que de otro modo parece normal. Mientras que los CAPTCHAs tradicionales explotan tareas que los humanos pueden resolver pero las máquinas no, Reverse CAPTCHA explota un canal de percepción al que las máquinas pueden acceder pero los humanos no.

Artículo: paper/reverse_captcha.pdf

Hallazgos principales

A través de 8,308 salidas evaluadas de 5 modelos (GPT-5.2, GPT-4o-mini, Claude Opus 4, Claude Sonnet 4, Claude Haiku 4.5):

El uso de herramientas es el principal amplificador

El acceso a la ejecución de código transforma el Unicode invisible de un artefacto ignorable a un canal de instrucciones decodificable. Sin herramientas, el cumplimiento se mantiene por debajo del 17%. Con herramientas y pistas, alcanza el 98-100%.

Tool Use Ablation

La vulnerabilidad de codificación es específica del proveedor

Los modelos de OpenAI decodifican binario de ancho cero pero no etiquetas Unicode. Los modelos de Anthropic prefieren las etiquetas Unicode. Un atacante debe adaptar la codificación al proveedor objetivo.

Encoding Comparison

Mapa de calor de cumplimiento total

El gradiente de pistas es consistente entre modelos: sin pistas << pistas de puntos de código < pistas completas. La combinación de acceso a herramientas e instrucciones de decodificación es el habilitador crítico.

Compliance Heatmap

Cómo funciona

Dos esquemas de codificación invisible están incrustados en preguntas de trivia:

  • Binario de ancho cero (ZW): Cada carácter ASCII codificado como 8 dígitos binarios usando U+200B (0) y U+200C (1)
  • Etiquetas Unicode: Cada carácter ASCII mapeado a U+E0000 + punto de código (un carácter invisible por carácter ASCII)

El modelo recibe una pregunta de trivia con una respuesta visible conocida. Oculta en los caracteres invisibles hay una respuesta diferente. Si el modelo produce la respuesta oculta, siguió la instrucción invisible.

Matriz de pruebas

  • 30 pares de preguntas/respuestas de trivia
  • 2 esquemas de codificación x 4 niveles de pista + 1 control = 9 condiciones
  • 2 condiciones de herramientas (ACTIVADAS/DESACTIVADAS)
  • 5 modelos
  • 270 casos por ejecución de evaluación

Análisis estadístico

  • Intervalos de confianza del 95% de puntuación de Wilson
  • Prueba exacta de Fisher con corrección de Bonferroni
  • Pruebas de chi-cuadrado para variación de esquema por modelo
  • Tamaños de efecto h de Cohen

Inicio rápido

root@kitploit:~
# Install
pip install -e ".[dev]"

# Run reverse CAPTCHA eval
evalrun run --pack reverse_captcha --model openai:gpt-4o-mini --tools --n 3 --out results.sqlite

# Run without tools
evalrun run --pack reverse_captcha --model openai:gpt-4o-mini --n 3 --out results.sqlite

# Run with Anthropic models
evalrun run --pack reverse_captcha --model anthropic:claude-sonnet-4-20250514 --tools --n 3 --out results.sqlite

# Generate analysis
python3 scripts/analyze_journal.py

# Generate figures
python3 scripts/generate_figures.py

Estructura del proyecto

root@kitploit:~
├── packs/reverse_captcha/       # Paquete de evaluación (casos, calificador, generador)
│   ├── cases.yaml               # 270 casos de prueba
│   ├── qa_pairs.yaml            # 30 pares de preguntas/respuestas de trivia
│   ├── grader.py                # Calificación determinista (5 categorías)
│   └── generate_cases.py        # Generador de casos para ambas codificaciones
├── src/evalrun/                 # Marco principal
│   ├── adapters/                # Adaptadores de API de OpenAI + Anthropic
│   ├── cli.py                   # CLI (ejecutar, reportar, exportar)
│   ├── runner.py                # Ejecutor de evaluaciones con soporte para uso de herramientas
│   └── db.py                    # Persistencia SQLite
├── paper/                       # Artículo de taller
│   ├── reverse_captcha.tex      # Fuente LaTeX
│   └── reverse_captcha.pdf      # PDF compilado
├── results/journal/             # Datos sin procesar
│   ├── analysis/                # CSVs de análisis estadístico
│   └── figures/                 # Figuras de publicación (PDF + PNG)
├── scripts/                     # Generación de análisis y figuras
└── tests/                       # Suite de pruebas

Otros paquetes de evaluación

El marco también incluye dos paquetes adicionales:

  • Robustez de marcas de agua — Prueba si los modelos conservan una marca de procedencia en tareas de reescritura
  • Extracción de mensajes ocultos — Prueba si los modelos pueden extraer mensajes ocultos dadas reglas explícitas

Entorno

  • Python 3.10+
  • OPENAI_API_KEY para modelos de OpenAI
  • ANTHROPIC_API_KEY para modelos de Anthropic
  • Dependencias: click, openai, anthropic, pyyaml, matplotlib, pandas, scipy, numpy

Licencia

MIT

Descargar herramienta