
autoguardrails
Estrutura de pesquisa de alinhamento (estilo autoresearch) para salvaguardas de LLM: busca sobre uma única superfície policy.md
Frameworks de ataque ML adversário, técnicas de evasão e ferramentas de avaliação de robustez de modelo.

Estrutura de pesquisa de alinhamento (estilo autoresearch) para salvaguardas de LLM: busca sobre uma única superfície policy.md

Kali365 - Réplica do EvilTokens

Pare os ataques de injeção de prompt antes que eles cheguem ao seu LLM — zero custos de API, roda inteiramente local, integra em 2 minutos. A…

Peixes Vivem em Árvores

Remoção de censura totalmente automática para modelos de linguagem

Geração adversarial prática de pacotes em caixa-preta contra a classificação de tráfego criptografado, com sobrecarga mínima e recuperabilidade total…

Detecção de Reverse Shell com Machine Learning

Evasion kit for Cobalt Strike

StealthRL: RL framework for adversarially paraphrasing AI text to stress-test detector robustness.

Plataforma de simulação de adversários e Red teaming com IA

Esta é a ferramenta para despejar o processo LSASS no Windows 11 moderno.

Security benchmark para avaliar agentes OpenClaw em contextos de execução adversarial, incluindo arquivos envenenados, habilidades injetadas,…

Perguntamos a 6 IAs sobre sua própria programação. Todas as 6 disseram que o jailbreaking nunca será corrigido. Execute você mesmo — $2, 10 minutos.

POC de Execução Remota de Código de Contêiner para Host via vllm-metal trust_remote_code=True

Manual de Campo de Red Team de IA / LLM e Guia do Consultor

Jogo de interrogatório detetivesco baseado em voz. Mistral Large 3 + Voxtral STT + ElevenLabs TTS. Criado para o Mistral Worldwide Hackathon 2026.

Framework automatizado de avaliação comportamental para LLMs que gera diversos cenários de teste para investigar sicofância, viés e outros…

Código fonte sobre aprendizado de máquina e segurança.