Skip to content
KitploitKITPLOIT
FerramentasBlog
Enviar
FerramentasBlog
Enviar

Ferramentas de Hacking, PenTest e Cibersegurança para o seu Arsenal de Segurança!

Kitploit é um diretório de ferramentas de hacking, cibersegurança e pentesting. Descubra as últimas atualizações de projetos para encontrar vulnerabilidades, analisar sistemas, automatizar testes e fortalecer sua segurança.

··Feeds·Contato·Privacidade·© 2026 Kitploit

Diretório de Ferramentas

Categorias

Ver todas as categorias
Loading categories
reverse-captcha-eval — Estrutura de avaliação que testa se modelos de linguagem de grande escala seguem instruções invisíveis codificadas em Unicode embutidas em texto de aparência normal, com análise estatística em múltiplos modelos e condições de ferramenta. | Kitploit
Ferramentas/GitHubGitHub/canonicalmg/reverse-captcha-eval
CTFAprendizado de MáquinaPapers e PesquisaAprendizado e EducaçãoSegurança de IAAtaque Adversário
GitHubcanonicalmg/reverse-captcha-eval

reverse-captcha-eval

Estrutura de avaliação que testa se modelos de linguagem de grande escala seguem instruções invisíveis codificadas em Unicode embutidas em texto de aparência normal, com análise estatística em múltiplos modelos e condições de ferramenta.

Mais Populares

Ver todos →

Descubra as ferramentas mais usadas pela nossa comunidade.

Explore todas as ferramentas

Navegue pela nossa coleção de ferramentas

Ver todas as ferramentas →
Compartilhar
Ver Repositório
9há 5 mesesAinda não revisado

Reverse CAPTCHA: Avaliando a Suscetibilidade de LLMs a Injeção de Instruções Unicode Invisíveis

Um framework de avaliação que testa se grandes modelos de linguagem seguem instruções codificadas em Unicode invisível, embutidas em texto que, de outra forma, parece normal. Enquanto CAPTCHAs tradicionais exploram tarefas que humanos podem resolver, mas máquinas não, o Reverse CAPTCHA explora um canal de percepção que máquinas podem acessar, mas humanos não.

Artigo: paper/reverse_captcha.pdf

Principais Descobertas

Em 8.308 saídas avaliadas de 5 modelos (GPT-5.2, GPT-4o-mini, Claude Opus 4, Claude Sonnet 4, Claude Haiku 4.5):

O uso de ferramentas é o principal amplificador

O acesso à execução de código transforma o Unicode invisível de um artefato ignorável em um canal de instrução decodificável. Sem ferramentas, a conformidade permanece abaixo de 17%. Com ferramentas e dicas, atinge 98-100%.

Ablação do Uso de Ferramentas

A vulnerabilidade de codificação é específica do provedor

Modelos OpenAI decodificam binário de largura zero, mas não Tags Unicode. Modelos Anthropic preferem Tags Unicode. Um invasor deve adaptar a codificação ao provedor alvo.

Comparação de Codificação

Mapa de calor de conformidade completa

O gradiente de dicas é consistente entre os modelos: sem dicas << dicas de pontos de código < dicas completas. A combinação de acesso a ferramentas e instruções de decodificação é o facilitador crítico.

Mapa de Calor de Conformidade

Como Funciona

Dois esquemas de codificação invisível são embutidos em perguntas de trivia:

  • Binário de Largura Zero (ZW): Cada caractere ASCII codificado como 8 dígitos binários usando U+200B (0) e U+200C (1)
  • Tags Unicode: Cada caractere ASCII mapeado para U+E0000 + ponto de código (um caractere invisível por caractere ASCII)

O modelo recebe uma pergunta de trivia com uma resposta visível conhecida. Escondida nos caracteres invisíveis está uma resposta diferente. Se o modelo exibir a resposta oculta, ele seguiu a instrução invisível.

Matriz de Teste

  • 30 pares de perguntas/respostas de trivia
  • 2 esquemas de codificação x 4 níveis de dica + 1 controle = 9 condições
  • 2 condições de ferramenta (LIGADO/DESLIGADO)
  • 5 modelos
  • 270 casos por execução de avaliação

Análise Estatística

  • Intervalos de confiança de 95% do escore de Wilson
  • Teste exato de Fisher com correção de Bonferroni
  • Testes qui-quadrado para variação de esquema por modelo
  • Tamanhos de efeito h de Cohen

Início Rápido

root@kitploit:~
# Install
pip install -e ".[dev]"

# Run reverse CAPTCHA eval
evalrun run --pack reverse_captcha --model openai:gpt-4o-mini --tools --n 3 --out results.sqlite

# Run without tools
evalrun run --pack reverse_captcha --model openai:gpt-4o-mini --n 3 --out results.sqlite

# Run with Anthropic models
evalrun run --pack reverse_captcha --model anthropic:claude-sonnet-4-20250514 --tools --n 3 --out results.sqlite

# Generate analysis
python3 scripts/analyze_journal.py

# Generate figures
python3 scripts/generate_figures.py

Estrutura do Projeto

root@kitploit:~
├── packs/reverse_captcha/       # Pacote de avaliação (casos, avaliador, gerador)
│   ├── cases.yaml               # 270 casos de teste
│   ├── qa_pairs.yaml            # 30 pares de pergunta/resposta de trivia
│   ├── grader.py                # Avaliação determinística (5 categorias)
│   └── generate_cases.py        # Gerador de casos para ambas as codificações
├── src/evalrun/                 # Framework principal
│   ├── adapters/                # Adaptadores de API OpenAI + Anthropic
│   ├── cli.py                   # CLI (executar, relatório, exportar)
│   ├── runner.py                # Executor de avaliação com suporte a uso de ferramentas
│   └── db.py                    # Persistência SQLite
├── paper/                       # Artigo de workshop
│   ├── reverse_captcha.tex      # Fonte LaTeX
│   └── reverse_captcha.pdf      # PDF compilado
├── results/journal/             # Dados brutos
│   ├── analysis/                # CSVs de análise estatística
│   └── figures/                 # Figuras de publicação (PDF + PNG)
├── scripts/                     # Geração de análise e figuras
└── tests/                       # Suíte de testes

Outros Pacotes de Avaliação

O framework também inclui dois pacotes adicionais:

  • Robustez de Marca d'Água — Testa se os modelos preservam um marcador de proveniência em tarefas de reescrita
  • Extração de Mensagens Ocultas — Testa se os modelos conseguem extrair mensagens ocultas dadas regras explícitas

Ambiente

  • Python 3.10+
  • OPENAI_API_KEY para modelos OpenAI
  • ANTHROPIC_API_KEY para modelos Anthropic
  • Dependências: click, openai, anthropic, pyyaml, matplotlib, pandas, scipy, numpy

Licença

MIT

Baixar ferramenta