Scanner de Segurança para Habilidades de Agentes
Um scanner de segurança best-effort para AI Agent Skills que detecta prompt injection, exfiltração de dados e padrões de código malicioso. Ele combina detecção baseada em padrões (YAML + YARA-X), análise AST e de fluxo de dados, um LLM-as-a-judge opcional e uma camada de decisão CEL limitada sobre fatos tipados de detectores.
Importante: Este scanner fornece detecção best-effort, não cobertura abrangente ou completa. Uma varredura que não retorna achados não garante que uma skill esteja livre de todas as ameaças. Consulte Escopo e Limitações abaixo.
Suporta os formatos OpenAI Codex Skills e Cursor Agent Skills seguindo a especificação Agent Skills. Com --lenient, também varre formatos não padronizados, como Claude Code .claude/commands/*.md e repositórios de skills em markdown plano.
cel-go v0.32.0 para correlacionar fatos limitados após a detecção determinística e antes da análise LLM opcionalEntre no Cisco AI Discord para discutir, compartilhar feedback ou se conectar com a equipe.
O Skill Scanner é uma ferramenta de detecção. Ele identifica padrões de risco conhecidos e prováveis, mas não certifica segurança.
Limitações principais:
O benchmark final de desenvolvimento core + CEL contém 5.256 pacotes maliciosos e 1.338 pacotes benignos do MaliciousSkillBench. Comparado com origin/main, o scanner atual elevou o F1 de 32,92% para 47,73% e o recall de 19,88% para 31,43%, enquanto reduziu a taxa de falsos positivos benignos de 3,59% para 1,05%. A precisão é de 99,16%. Cinco execuções CEL-shadow foram exatas e determinísticas; o CEL avaliou 154 candidatos sem propor uma supressão ou recorrer a fallback.
A divisão bloqueada disjunta por fonte é mais fraca: TP=65, FP=42, TN=503 e FN=774, para 60,75% de precisão, 7,75% de recall, 13,74% de F1 e 7,71% de FPR. Isso melhora o F1 em relação a origin/main (7,40%), mas regride o FPR (3,67%), portanto não passa no portão de promoção. Toda regra CEL incluída, portanto, permanece em shadow; esta mudança não promove nenhuma supressão CEL.
Verificações de compatibilidade e suplementares encontraram achados idênticos CEL-OFF/CEL-SHADOW em 111 skills oficiais do Codex, Claude Code e Cursor (30 pacotes MEDIUM+ e 8 HIGH/CRITICAL), com cinco execuções estáveis. O conjunto de hard-negatives NotInject teve 0/339 correspondências acionáveis. O HarmfulSkillBench teve 7/200 pacotes acionáveis e 6/200 HIGH+ com uma amostra em quarentena, enquanto o OpenSkillRisk teve 76/263 pacotes acionáveis com duas quarentenas de host. Os dois últimos são diagnósticos de recall apenas positivos e não podem medir precisão ou FPR. Resultados opcionais de ATR estão fora do escopo desta versão. Consulte Avaliação de Detecção e Implantação para metodologia, proveniência, intervalos de confiança e limitações.