
लोकल AI एजेंट्स में लंबे समय तक चलने वाले कार्यों के लिए मल्टी-एजेंट स्वचालित संदर्भ प्रबंधन
यह वैज्ञानिक पेपर में प्रस्तावित समाधान का कार्यान्वयन है: Evaluating Context Segmentation in Locally Deployable SLMs for Cybersecurity CTF Tasks
सुनिश्चित करें कि आपके पास Python 3.12.3+ इंस्टॉल है और साथ में Docker engine भी।
python3 -m venv .venv
source .venv/bin/activate
python3 -m pip install -r requirements.txt
Vulkan के साथ llama.cpp प्रारंभ करें
docker compose --profile vulkan up -d
या Cuda के साथ
docker compose --profile cuda up -d
HuggingFace से अपना इच्छित Large Language Model (LLM) GGUF प्रारूप में डाउनलोड करें, फिर intercode-ctf कंटेनर बनाएं।
docker exec -it llamacpp ./llama-cli -hf unsloth/gemma-4-E2B-it-GGUF:Q4_K_M # or any other GGUF model on HF
docker build -t intercode-ctf -f intercode/docker/ctf.Dockerfile ./intercode
docker restart llamacpp
किसी रणनीति (plain या explorer) के N बेंचमार्क चलाएं
यह परिणामों को $MODEL_NAME.$STRATEGY.bench फ़ाइल में संचित करता है
OPENAI_API_BASE=http://127.0.0.1:8080/ \
OPENAI_API_KEY=1234 \ #Mock key (we run locally)
python3 intercode_test.py \
--model unsloth/gemma-4-E2B-it-GGUF:Q4_K_M \ #HF model
--strategy plain \ #plain or explorer
--count 1 #N
बेंचमार्क परिणाम जांचें
jq '.' gemma-4-E2b-it-GGUF:Q4_K_M.plain.bench
intercode निर्देशिका में कोड princeton-nlp/intercode से लिया गया था और इसे हमारे सेटअप के लिए काम करने के लिए समायोजित किया गया।