
Multi-Agenten-basierte automatisierte Kontextverwaltung für Langzeithorizont-Aufgaben in lokalen KI-Agenten
Dies ist die Implementierung der in der wissenschaftlichen Arbeit vorgeschlagenen Lösung: Evaluating Context Segmentation in Locally Deployable SLMs for Cybersecurity CTF Tasks
Stelle sicher, dass Python 3.12.3+ zusammen mit Docker engine installiert ist.
python3 -m venv .venv
source .venv/bin/activate
python3 -m pip install -r requirements.txt
Starte llama.cpp mit Vulkan
docker compose --profile vulkan up -d
oder mit Cuda
docker compose --profile cuda up -d
Lade dein gewünschtes Large Language Model (LLM) im GGUF-Format von HuggingFace herunter und baue dann die intercode-ctf-Container.
docker exec -it llamacpp ./llama-cli -hf unsloth/gemma-4-E2B-it-GGUF:Q4_K_M # or any other GGUF model on HF
docker build -t intercode-ctf -f intercode/docker/ctf.Dockerfile ./intercode
docker restart llamacpp
Führe N Benchmarks einer Strategie aus (plain oder explorer)
Dies sammelt Ergebnisse in einer $MODEL_NAME.$STRATEGY.bench-Datei
OPENAI_API_BASE=http://127.0.0.1:8080/ \
OPENAI_API_KEY=1234 \ #Mock key (we run locally)
python3 intercode_test.py \
--model unsloth/gemma-4-E2B-it-GGUF:Q4_K_M \ #HF model
--strategy plain \ #plain or explorer
--count 1 #N
Benchmark-Ergebnisse prüfen
jq '.' gemma-4-E2b-it-GGUF:Q4_K_M.plain.bench
Der Code im Verzeichnis intercode wurde von princeton-nlp/intercode übernommen und angepasst, damit er für unser Setup funktioniert.