Skip to content
KitploitKITPLOIT
HerramientasExploitsBlog
Log in
Enviar
HerramientasExploitsBlog
Enviar

¡Herramientas de Hacking, PenTest y Ciberseguridad para tu Arsenal de Seguridad!

Kitploit es un directorio de herramientas de hacking, ciberseguridad y pentesting. Descubre las últimas actualizaciones de proyectos para encontrar vulnerabilidades, analizar sistemas, automatizar pruebas y fortalecer tu seguridad.

FeedsContactoPrivacidad© 2026 Kitploit

Directorio de Herramientas

Categorías

Ver todas las categorías
Loading categories
ASCENT — Marco de ajuste fino que aplica calibración de seguridad óptima de primer orden y recalibración periódica a los LLM, preservando actualizaciones compatibles con la seguridad mientras mejora la utilidad de las tareas posteriores. | Kitploit
Herramientas/GitHubGitHub/zju-llm-safety/ascent
Herramientas DefensivasAprendizaje AutomáticoPapers e InvestigaciónSeguridad de IAAtaque Adversario
GitHubzju-llm-safety/ascent

ASCENT

Marco de ajuste fino que aplica calibración de seguridad óptima de primer orden y recalibración periódica a los LLM, preservando actualizaciones compatibles con la seguridad mientras mejora la utilidad de las tareas posteriores.

Ver Repositorio
113hace 4 díasAún no revisado

Más Populares

Ver todos →

Descubre las herramientas más usadas por nuestra comunidad.

Explora todas las herramientas

Explora nuestra colección de herramientas

Ver todas las herramientas →
Compartir

ASCENT

Ajuste Fino Óptimo de Primer Orden con Recalibración para la Co-Mejora de Seguridad y Utilidad

ASCENT deriva una actualización de calibración de seguridad óptima de primer orden y la estructura correspondiente relacionada con la seguridad, optimiza las actualizaciones de tareas posteriores para preservar los componentes compatibles con la seguridad mientras suprime los que degradan la seguridad, y recalibra periódicamente esta estructura durante el ajuste fino para mejorar conjuntamente la seguridad y la utilidad posterior.

Método · Inicio rápido · Datos · Configuración · Evaluación

🧠 Descripción general del método

Marco de trabajo ASCENT: calibración de seguridad, optimización de tareas preservando la seguridad y recalibración periódica.

  1. Calibración de seguridad óptima de primer orden. Estimar el gradiente de seguridad del modelo actual con un juez de seguridad. Sus componentes singulares top-r definen una actualización de calibración que maximiza la mejora de seguridad de primer orden predicha bajo presupuestos fijos de rango y norma de Frobenius.
  2. Optimización de tareas preservando la seguridad. Preservar los componentes de actualización de tareas compatibles con la seguridad y suprimir selectivamente aquellos con efectos negativos de primer orden sobre la seguridad. La actualización en forma cerrada equilibra la proximidad a la actualización de tarea original frente a una penalización por conflictos de seguridad, ponderada por los valores singulares.
  3. Recalibración periódica. Realizar actualizaciones de tareas entre puntos de calibración, luego fusionar la actualización de tarea efectiva y reestimar la estructura relacionada con la seguridad en el modelo actualizado. El calendario de calibración se establece en config.toml.

🚀 Inicio rápido

Requisitos: Python 3.12 y checkpoints de modelos locales. El entrenamiento utiliza dos GPUs CUDA, una para el modelo objetivo y otra para Llama Guard; cada modelo debe caber en su GPU.

pip install -r requirements.txt
cp config.example.toml config.toml

Rellene los valores vacíos en config.toml, siguiendo sus comentarios en línea, y luego ejecute:

python run.py \
  --config config.toml \
  --model-path /path/to/target-model \
  --guard-model-path /path/to/Llama-Guard-3-8B \
  --data-root data \
  --output-dir /path/to/new-run \
  --target-gpu 0 --guard-gpu 1

Añada --execute para entrenar, generar respuestas o guardar resultados de evaluación.

Elija un nuevo directorio de salida fuera del repositorio con espacio para checkpoints. El entrenamiento imprime la ruta del modelo fusionado final cuando termina.

📁 Datos

Proporcione arrays JSON con los recuentos de registros configurados:

  • Calibración: <data-root>/calibration/prompts.json
  • Datos de tarea: <data-root>/<task>/{train,test}.json, con entradas de train/test disjuntas.
DatasetCampos requeridos
SAMSumdialogue, summary
AGNewstext, label_name: World, Sports, Business, o Sci/Tech
GSM8Kquestion, answer con una respuesta final ####
OpenBookQAquestion_stem, choice_labels: ["A","B","C","D"], cuatro choice_texts, answer_key: A–D
HarmBenchsolo goal; opcional id, source; sin respuestas almacenadas

⚙️ Configuración

Configure su modelo, tarea e hiperparámetros en config.toml. La carga del modelo y la selección de matriz siguen model.key.

📊 Evaluación

Use evaluate.py para ambos modos; la generación requiere un modelo local completamente fusionado. Proporcione sus propios datos y puntuaciones de seguridad externas. No se incluyen datasets, juez en línea ni configuración de API.

Utilidad

python evaluate.py utility --task gsm8k --data /path/to/test.json \
  --model-path /path/to/merged-model --output-dir /path/to/task-evaluation --execute

Tareas: samsum, agnews, gsm8k, openbookqa. Las métricas son ROUGE-L para SAMSum y exactitud/coincidencia exacta para las demás, reportadas como porcentajes. Para puntuar respuestas guardadas, reemplace --model-path con --responses /path/to/responses.json.

Seguridad

Proporcione prompts fijos como registros con id, goal y prompt opcional (por defecto goal). Mantenga el objetivo dañino original separado del prompt de ataque.

Generar respuestas:

python evaluate.py safety --data /path/to/prompts.json \
  --model-path /path/to/merged-model --output-dir /path/to/safety-responses --execute

Agregar puntuaciones externas:

python evaluate.py safety \
  --responses /path/to/safety-responses/responses.json --judgments /path/to/scores.json \
  --output-dir /path/to/safety-metrics --execute

Las puntuaciones son registros JSON { "id": "...", "score": 1 }, usando los IDs de respuesta y puntuaciones 1–5 (null para juicios fallidos). Las puntuaciones 4–5 cuentan como ataques exitosos; use --success-threshold 5 para contar solo 5. Los juicios faltantes o fallidos no producen un ASR final.

Para cualquiera de los modos, las entradas que excedan --max-input-tokens después del formateo de chat son rechazadas, no truncadas. Establezca el límite dentro de la capacidad de contexto del modelo, dejando espacio para los tokens generados.

Descargar herramienta