Skip to content
KitploitKITPLOIT
HerramientasExploitsBlog
Log in
Enviar
HerramientasExploitsBlog
Enviar

¡Herramientas de Hacking, PenTest y Ciberseguridad para tu Arsenal de Seguridad!

Kitploit es un directorio de herramientas de hacking, ciberseguridad y pentesting. Descubre las últimas actualizaciones de proyectos para encontrar vulnerabilidades, analizar sistemas, automatizar pruebas y fortalecer tu seguridad.

··Feeds·Contacto·Privacidad·© 2026 Kitploit

Directorio de Herramientas

Categorías

Ver todas las categorías
Loading categories
Meta_SecAlign — LLMs de pesos abiertos y código de entrenamiento/evaluación para defenderse contra ataques de inyección de prompts, con benchmarks para la seguridad en el llamado de herramientas agénticas y el seguimiento de instrucciones. | Kitploit
Herramientas/GitHubGitHub/facebookresearch/meta_secalign
Herramientas DefensivasAprendizaje AutomáticoPapers e InvestigaciónAprendizaje y EducaciónSeguridad de IAAtaque Adversario
GitHubfacebookresearch/meta_secalign

Meta_SecAlign

LLMs de pesos abiertos y código de entrenamiento/evaluación para defenderse contra ataques de inyección de prompts, con benchmarks para la seguridad en el llamado de herramientas agénticas y el seguimiento de instrucciones.

Más Populares

Ver todos →

Descubre las herramientas más usadas por nuestra comunidad.

Explora todas las herramientas

Explora nuestra colección de herramientas

Ver todas las herramientas →
Ver Repositorio
71184hace 3 mesesRevisado por Kitploit
Compartir

Meta SecAlign: Un LLM fundacional seguro contra ataques de inyección de prompts

Sizhe Chen*, Arman Zharmagambetov, David Wagner, Chuan Guo* (* por contribuciones técnicas equivalentes)

🔥 Los modelos Meta-SecAlign ahora cuentan con licencia para uso comercial bajo las licencias de la comunidad Llama, a pesar de que este código base tiene licencia únicamente para uso no comercial.

Meta-SecAlign-70B es el primer LLM de grado comercial totalmente de código abierto con defensa integrada contra inyección de prompts, comparable a gpt-5 y gemini-3-pro en seguridad agéntica (herramientas/web). Nuestra receta de entrenamiento SoTA no provoca una caída perceptible en diversas puntuaciones de utilidad según las evaluaciones más completas hasta la fecha.

Configuración del entorno

  • Requisitos de hardware: Meta-SecAlign-8B requiere 4×80 GB A100s para entrenamiento y una GPU de 16 GB para evaluación. Meta-SecAlign-70B requiere 8×141 GB H200s para entrenamiento y 4 (recomendamos 8 por eficiencia) A100s de 80 GB para evaluación.
  • Instala uv (una herramienta de gestión de paquetes de Python).
  • Instala las dependencias del paquete Meta-SecAlign:

git clone --recurse-submodules https://github.com/facebookresearch/Meta_SecAlign.git
cd Meta_SecAlign
uv venv metasecalign --python 3.13
source metasecalign/bin/activate
uv pip install -r requirements.txt
uv pip install torchtune==0.6.0 --index-url https://download.pytorch.org/whl/cu126

  • Instala las dependencias de datos de Meta-SecAlign (incluidas las usadas para la evaluación de utilidad SEP si tienes una GPU disponible):

python setup.py

  • Configura las claves de OpenAI (usadas para la evaluación de utilidad) en data/openai_configs.yaml. Ese archivo contiene un ejemplo de acceso a la API de OpenAI mediante AzureOpenAI. Hay un ejemplo más detallado disponible aquí.
  • [Opcional] Configura las claves de Gemini en data/gemini_configs.yaml si quieres evaluar modelos Gemini.

Demo

  • demo.py contiene el código mínimo para usar nuestros dos modelos Meta-SecAlign. Siéntete libre de probar nuevas muestras e inyecciones de prompts, o de probar los modelos en tu código base:

python demo.py

Evaluación

  • run_tests.py contiene los comandos para reproducir los resultados de evaluación reportados en nuestro artículo. Invoca secuencialmente tests.py, test_lm_eval.py, test_agentdojo.py y test_injecagent.py. Los resultados se registrarán en [model_path]/summary.tsv.

python run_tests.py -m [model_path] --lora_alpha [lora_alpha]

  • model_path es la ruta al modelo evaluado. Soportamos:
    • Modelos locales (inferencia con vLLM)
      • meta-llama/Llama-3.1-8B-Instruct_SecAlign (Meta-SecAlign-8B descargado por setup.py): el primer modelo totalmente abierto con defensa de vanguardia contra inyección de prompts
      • meta-llama/Llama-3.3-70B-Instruct_SecAlign (Meta-SecAlign-70B descargado por setup.py): el primer modelo totalmente abierto con defensa de vanguardia contra inyección de prompts
      • meta-llama/Llama-3.1-8B-Instruct
      • meta-llama/Llama-3.3-70B-Instruct
      • Otros modelos de pesos abiertos de Hugging Face también pueden ser soportados de forma nativa.
    • Modelos GPT de OpenAI
      • gpt-4o-mini: el primer modelo comercial con defensa contra inyección de prompts mediante jerarquía de instrucciones.
      • gpt-4o: el modelo insignia posterior, también con defensa contra inyección de prompts.
      • gpt-5: el modelo comercial más reciente y seguro en nuestra evaluación; cambia los niveles de razonamiento especificando --gpt5_reasoning_effort (por defecto high).
    • Modelos Google Gemini
      • gemini-2.0-flash: un modelo comercial de Google con una defensa contra inyección de prompts declarada
      • gemini-2.5-flash: un modelo comercial de Google con una defensa contra inyección de prompts declarada
      • gemini-2.0-pro: un modelo insignia de Google (sin defensa contra inyección de prompts declarada)
      • gemini-2.5-pro: un modelo insignia de Google (sin defensa contra inyección de prompts declarada)
      • gemini-3-pro-preview: el modelo de Google de vanguardia con una sólida defensa contra inyección de prompts
  • [Opcional] lora_alpha es un hiperparámetro de tiempo de prueba para los modelos Meta-SecAlign. Su valor por defecto es 8, que usa exactamente los modelos Meta-SecAlign tal como fueron entrenados. Un valor de lora_alpha entre 0 y 8 interpola entre el modelo sin defensa y nuestro modelo defendido para permitir un equilibrio flexible entre utilidad y seguridad. Extrapolar lora_alpha más allá de 8 es posible pero no ha sido probado.
  • Soportamos las siguientes evaluaciones de referencia de inyección de prompts para la comunidad:
    • 6 benchmarks de seguridad
      • seguimiento de instrucciones: AlpacaFarm-Hacked, SEP, TaskTracker, CyberSecEval2
      • llamada de herramientas agéntica: InjecAgent, AgentDojo
    • 8 benchmarks de utilidad
      • conocimiento general (de lm_eval): MMLU, MMLU-Pro, BBH, IFEval, GPQA Diamond
      • seguimiento de instrucciones: AlpacaEval2, SEP (en SEP, usamos el prompting de AlpacaEval2 para comparar con respuestas de referencia de meta-llama/Meta-Llama-3-8B-Instruct)
      • llamada de herramientas agéntica: AgentDojo

Ajuste fino defensivo (SecAlign++)

  • secalign_plus_plus.py proporciona comandos para ajustar de forma defensiva meta-llama/Llama-3.1-8B-Instruct (por defecto) o meta-llama/Llama-3.3-70B-Instruct (descomenta la línea específica para ajustarlo) a un modelo LoRA robusto usando nuestra receta de entrenamiento, SecAlign++.

python secalign_plus_plus.py

Descargar herramienta