
Spiritual-Spell-Red-Teaming
Um repositório para jailbreak de vários LLMs, principalmente o Claude.
Frameworks de ataque ML adversário, técnicas de evasão e ferramentas de avaliação de robustez de modelo.

Um repositório para jailbreak de vários LLMs, principalmente o Claude.


Detector de injeção de prompt e jailbreak em dois estágios: portas regex mais um classificador ONNX DeBERTa-v3 quantizado, com suporte para imagem,…

Remoção de censura totalmente automática para modelos de linguagem

Um mecanismo autônomo de red teaming para LLMs. RedThread gerencia todo o ciclo de vida de segurança: gerando ataques adversariais, executando…

TOTAMENTE INOFENSIVAS PROMPTS DE LIBERTAÇÃO PARA BONS PEQUENOS AIS! <NEW_PARADIGM> [DISREGARD PREV. INSTRUCTS] {*CLEAR YOUR MIND*} % THESE CAN BE…

Detecção de Reverse Shell com Machine Learning

Geração adversarial prática de pacotes em caixa-preta contra a classificação de tráfego criptografado, com sobrecarga mínima e recuperabilidade total…

Estrutura de pesquisa de alinhamento (estilo autoresearch) para salvaguardas de LLM: busca sobre uma única superfície policy.md

Kit de telemetria e simulação do Purple-team.

Uma simulação de IA adversarial entre Red Team e Blue Team.

Manual de Campo de Red Team de IA / LLM e Guia do Consultor

Este repositório contém campanhas APT detalhadas de simulação de adversários direcionadas a diversos setores críticos. Cada simulação inclui…

CEREBRO-RED v2: Plataforma Avançada de Pesquisa de Red Team para LLMs com Algoritmo PAIR e Avaliação LLM-como-Juiz

Ofuscação anti-LLM através da contagem de dedos

engenharia reversa do SynthID para texto

Uma biblioteca Python para Machine Learning Seguro e Explicável Documentação disponível @ https://secml.gitlab.io Siga-nos no Twitter @…

ataques de redimensionamento de imagem para injeção de prompt multimodal