Voltar às atualizações
New releaseAug 4, 2026

skill-scanner v2.0.13

Scanner de Segurança para Habilidades de Agentes

Compartilhar

Skill Scanner

License CPython 3.11–3.14 PyPI version CI Discord Cisco AI Defense AI Security Framework Ask DeepWiki

Um scanner de segurança best-effort para AI Agent Skills que detecta prompt injection, exfiltração de dados e padrões de código malicioso. Ele combina detecção baseada em padrões (YAML + YARA-X), análise AST e de fluxo de dados, um LLM-as-a-judge opcional e uma camada de decisão CEL limitada sobre fatos tipados de detectores.

Importante: Este scanner fornece detecção best-effort, não cobertura abrangente ou completa. Uma varredura que não retorna achados não garante que uma skill esteja livre de todas as ameaças. Consulte Escopo e Limitações abaixo.

Suporta os formatos OpenAI Codex Skills e Cursor Agent Skills seguindo a especificação Agent Skills. Com --lenient, também varre formatos não padronizados, como Claude Code .claude/commands/*.md e repositórios de skills em markdown plano.


Destaques

  • Detecção Multi-Engine - Análise estática, fluxo de dados comportamental, análise semântica por LLM e varredura baseada em nuvem para cobertura em camadas, best-effort
  • Decisões CEL Tipadas - O scanner principal usa o runtime oficial cel-go v0.32.0 para correlacionar fatos limitados após a detecção determinística e antes da análise LLM opcional
  • Revisão de Achados - O Meta-analyzer opcional correlaciona, prioriza e pode filtrar achados; a validação de acurácia pareada permanece pendente
  • Pronto para CI/CD - Saída SARIF para GitHub Code Scanning, workflow reutilizável do GitHub Actions, códigos de saída para falhas de build
  • Hook de Pre-commit - Integração com o framework padrão de pre-commit para varrer skills antes de cada commit
  • Extensível - Arquitetura de plugins para analisadores personalizados

Entre no Cisco AI Discord para discutir, compartilhar feedback ou se conectar com a equipe.


Escopo e Limitações

O Skill Scanner é uma ferramenta de detecção. Ele identifica padrões de risco conhecidos e prováveis, mas não certifica segurança.

Limitações principais:

  • Nenhum achado ≠ nenhum risco. Uma varredura que retorna "Nenhum achado" indica que nenhum padrão de ameaça conhecido foi detectado. Isso não garante que uma skill seja segura, benigna ou livre de vulnerabilidades.
  • A cobertura é inerentemente incompleta. O scanner combina detecção baseada em assinaturas, análise semântica baseada em LLM, análise de fluxo de dados comportamental, serviços opcionais em nuvem e pacotes de regras configuráveis. Embora essa abordagem melhore a cobertura, nenhuma ferramenta automatizada consegue detectar todas as técnicas, especialmente ataques novos ou zero-day.
  • Falsos positivos e falsos negativos podem ocorrer. Modos de consenso e meta-análise podem ajudar a revisar achados, mas nenhuma configuração elimina todas as classificações incorretas. Ajuste a política de varredura à sua tolerância a risco.
  • A revisão humana continua essencial. A varredura automatizada é um componente de uma estratégia de defesa em profundidade. Implantações de alto risco ou em produção devem combinar os resultados do scanner com revisão manual de código e/ou modelagem de ameaças.

Evidência atual de modernização

O benchmark final de desenvolvimento core + CEL contém 5.256 pacotes maliciosos e 1.338 pacotes benignos do MaliciousSkillBench. Comparado com origin/main, o scanner atual elevou o F1 de 32,92% para 47,73% e o recall de 19,88% para 31,43%, enquanto reduziu a taxa de falsos positivos benignos de 3,59% para 1,05%. A precisão é de 99,16%. Cinco execuções CEL-shadow foram exatas e determinísticas; o CEL avaliou 154 candidatos sem propor uma supressão ou recorrer a fallback.

A divisão bloqueada disjunta por fonte é mais fraca: TP=65, FP=42, TN=503 e FN=774, para 60,75% de precisão, 7,75% de recall, 13,74% de F1 e 7,71% de FPR. Isso melhora o F1 em relação a origin/main (7,40%), mas regride o FPR (3,67%), portanto não passa no portão de promoção. Toda regra CEL incluída, portanto, permanece em shadow; esta mudança não promove nenhuma supressão CEL.

Verificações de compatibilidade e suplementares encontraram achados idênticos CEL-OFF/CEL-SHADOW em 111 skills oficiais do Codex, Claude Code e Cursor (30 pacotes MEDIUM+ e 8 HIGH/CRITICAL), com cinco execuções estáveis. O conjunto de hard-negatives NotInject teve 0/339 correspondências acionáveis. O HarmfulSkillBench teve 7/200 pacotes acionáveis e 6/200 HIGH+ com uma amostra em quarentena, enquanto o OpenSkillRisk teve 76/263 pacotes acionáveis com duas quarentenas de host. Os dois últimos são diagnósticos de recall apenas positivos e não podem medir precisão ou FPR. Resultados opcionais de ATR estão fora do escopo desta versão. Consulte Avaliação de Detecção e Implantação para metodologia, proveniência, intervalos de confiança e limitações.


Documentação

Categorias