Skip to content
KitploitKITPLOIT
ToolsBlog
Log in
Einreichen
ToolsBlog
Einreichen

Hacking-, PenTest- und Cybersicherheits-Tools für Ihr Sicherheitsarsenal!

Kitploit ist ein Verzeichnis von Hacking-, Cybersicherheits- und Pentesting-Tools. Entdecken Sie die neuesten Projekt-Updates, um Schwachstellen zu finden, Systeme zu analysieren, Tests zu automatisieren und Ihre Sicherheit zu stärken.

··Feeds·Kontakt·Datenschutz·© 2026 Kitploit

Tool-Verzeichnis

Kategorien

Alle Kategorien anzeigen
Loading categories
llm-circuit-finder — Ich habe Ngs RYS-Methode repliziert und festgestellt, dass das Duplizieren von 3 bestimmten Layern in Qwen2.5-32B das Reasoning um 17 % steigert und das Duplizieren der Layer 12-14 in Devstral-24B die logische Deduktion bei BBH von 0.22→0.76 verbessert — kein Training, keine Gewichtsänderungen, nur das zweimalige Leiten verborgener Zustände durch dieselbe Schaltung. Tools inklusive. Zwei AMD-GPUs, ein Abend. | Kitploit
Tools/GitHubGitHub/alainnothere/llm-circuit-finder
ExploitationReverse EngineeringMaschinelles LernenPapers & ForschungLernen & BildungKI-Sicherheit
GitHubalainnothere/llm-circuit-finder

llm-circuit-finder

Repository anzeigen

Beliebteste

Alle anzeigen →

Entdecken Sie die meistgenutzten Tools unserer Community.

Alle Tools erkunden

Durchsuchen Sie unsere Tool-Sammlung

Alle Tools anzeigen →
2421816vor 6 MonatenVon Kitploit geprüft

Über

Ich habe Ngs RYS-Methode repliziert und festgestellt, dass das Duplizieren von 3 bestimmten Layern in Qwen2.5-32B das Reasoning um 17 % steigert und das Duplizieren der Layer 12-14 in Devstral-24B die logische Deduktion bei BBH von 0.22→0.76 verbessert — kein Training, keine Gewichtsänderungen, nur das zweimalige Leiten verborgener Zustände durch dieselbe Schaltung. Tools inklusive. Zwei AMD-GPUs, ein Abend.

Teilen

llm-circuit-finder

Ich habe Ng's RYS-Methode nachgebildet und herausgefunden, dass das Duplizieren von 3 spezifischen Layern in Qwen2.5-32B die Argumentation um 17% verbessert und das Duplizieren der Layer 12-14 in Devstral-24B die logische Deduktion von 0,22→0,76 bei BBH steigert – kein Training, keine Gewichtsänderungen, nur das Weiterleiten von Hidden States durch denselben Schaltkreis zweimal. Werkzeuge enthalten. Zwei AMD GPUs, ein Abend.

llm-circuit-finder

3 Layer duplizieren. Kein Training. Logische Deduktion von ~0,22 → 0,76.

Dieses Toolkit findet und nutzt "Reasoning Circuits", die in Transformer-Modellen verborgen sind. Die Idee: Bestimmte zusammenhängende Layer-Blöcke fungieren als unteilbare kognitive Einheiten. Dupliziert man sie im Forward Pass – gleiche Gewichte, kein Training, kein Merging – wird das Modell in bestimmten Fähigkeiten messbar intelligenter.

Basiert auf David Ng's RYS-Methode und erweitert durch neue Erkenntnisse. Alles hier wurde an einem Abend auf zwei AMD Consumer GPUs (RX 7900 XT + RX 6950 XT) entdeckt.

Ergebnisse

Devstral-Small-2-24B: Layer 12, 13, 14 einmal dupliziert

Ich habe die vollständigen Tests auf einer H200-Instanz bei Vast.ai durchgeführt und vergleiche Devstral-Basis mit dem Surgery-Modell. Die Ergebnisse sind da: Die Operation bewirkt etwas Reales und Spezifisches: Sie verbessert mathematisches Denken und kausales Denken, aber auf Kosten der Befolgungsfähigkeit von Anweisungen und der Codegenerierung. Das Modell denkt intensiver, folgt aber Anweisungen weniger präzise.

Im Ordner results finden Sie die Ergebnisse unter eval_base und eval_surgery. Ich habe auch vastai_rys_eval.sh zum Repository hinzugefügt, das Skript, das verwendet wurde, um die ganze Angelegenheit auf Vast.ai auszuführen. Die Vast.ai-Instanz wurde erstellt mit:

vastai create instance somenumberhere --image vastai/base-image:cuda-12.8.1-cudnn-devel-ubuntu22.04 --disk 80 --direct --ssh

=================================================================================
lm_eval Results Comparison
=================================================================================
Metric                                              base  rys_12_15 Δ(last-first)
---------------------------------------------------------------------------------
bbh/causal_judgement [exact_match]                0.5775     0.6364     +0.0588

bbh/date_understanding [exact_match]              0.9440     0.9000     -0.0440

bbh/logical_deduction_five_objects [exact_match]     0.7440     0.7320     -0.0120

bbh/navigate [exact_match]                        0.9600     0.9440     -0.0160

gsm8k_cot [flexible-extract]                      0.8650     0.8787     +0.0136
gsm8k_cot [strict-match]                          0.8408     0.8704     +0.0296

ifeval [inst_level_loose_acc]                     0.7446     0.7206     -0.0240
ifeval [inst_level_strict_acc]                    0.6990     0.6595     -0.0396
ifeval [prompt_level_loose_acc]                   0.6728     0.6488     -0.0240
ifeval [prompt_level_strict_acc]                  0.6229     0.5767     -0.0462

mbpp [pass_at_1]                                  0.7000     0.6700     -0.0300
=================================================================================

Average (all metrics)                             0.7610     0.7488     -0.0122

Qwen2.5-Coder-32B: Layer 7, 8, 9 einmal dupliziert

Gemessen mit einer benutzerdefinierten Testsuite (BBH-abgeleitet + EQ-Bench-Stil + GSM8K):

ProbeBase+3 LayerÄnderung
Reasoning (kausal + Logik + Navigation)76,5%94,1%+23%
EQ (emotionale Intelligenz)92,193,6+1,6%

Was passiert hier?

Transformer organisieren sich während des Trainings in funktionale Schaltkreise – mehrschichtige Verarbeitungseinheiten, die vollständige kognitive Operationen durchführen. Diese Schaltkreise sind unteilbar: Das Duplizieren eines einzelnen Layers bringt fast nichts, aber das Duplizieren des richtigen Blocks von 3-4 Layern gibt dem Modell einen zweiten Durchlauf durch seine Reasoning-Pipeline.

Verschiedene Modelle haben verschiedene Schaltkreise an verschiedenen Stellen:

  • Devstral-24B (40 Layer): Reasoning-Schaltkreis bei Layer 12-14
  • Qwen2.5-32B (64 Layer): Reasoning-Schaltkreis bei Layer 7-9

Die Grenzen sind scharf. Verschiebt man den Block um einen Layer in eine der beiden Richtungen, verschwindet die Verbesserung oder kehrt sich um.

Die "Modi"-Entdeckung

Unterschiedliche Duplizierungsmuster erzeugen aus denselben Gewichten unterschiedliche kognitive Profile:

MusterMatheEQCharakter
Doppelpass 13-16↑↑↑Mathe-Spezialist
Dreifachpass 13-16↑↑↑EQ-Spezialist
Verflochten 13,13,14,14,15,15,16↑↑↑↓Reiner Mathe-Modus
Vierfachpass 13-16—↑↑EQ-Modus, Mathe neutral

Dieselben Gewichte auf der Festplatte. Derselbe VRAM für das Basismodell. Nur andere Weiterleitungen.

Schnellstart

Finden Sie Schaltkreise in Ihrem Modell

pip install gguf requests tqdm

python sweep.py \
    --model /path/to/model.gguf \
    --llama-server /path/to/llama-server \
    --tmpdir /dev/shm/rys \
    --results pass.jsonl \
    --block-sizes 3 4 5 \
    --stride 1 \
    --start-min 10 --start-max 20 \
    --skip-baseline \
    --port 8099 \
    --server-args --device Vulkan1,Vulkan2

Wenden Sie einen bekannten Schaltkreis an

# Duplizieren Sie Layer 12-14 in Devstral (das oben validierte Ergebnis)
python layer_path.py model.gguf improved.gguf \
    -p "0..14,12,13,14,15..39" -v

# Duplizieren Sie Layer 7-9 in Qwen2.5-32B
python layer_path.py model.gguf improved.gguf \
    -p "0..9,7,8,9,10..63" -v

# Gehen Sie wild: Dreifachpass, verflochten, Layer überspringen, was immer Sie möchten
python layer_path.py model.gguf experiment.gguf \
    -p "0..16,13,14,15,16,13,14,15,16,17..39" -v

Validieren Sie mit etablierten Benchmarks

# Starten Sie den Server mit dem modifizierten Modell
llama-server -m improved.gguf --port 8089 -ngl 99 --device Vulkan1,Vulkan2

# Führen Sie lm-evaluation-harness aus
lm_eval --model local-chat-completions \
    --model_args model=test,base_url=http://localhost:8089/v1/chat/completions,num_concurrent=1,max_retries=3,tokenized_requests=False \
    --tasks gsm8k_cot,ifeval,mbpp,bbh_cot_fewshot_logical_deduction_five_objects \
    --apply_chat_template --limit 50 \
    --output_path ./eval_results

# Vergleichen Sie Durchläufe
python compare_eval.py ./eval_base ./eval_improved

Dateien

DateiFunktion
sweep.pyHaupt-Sweep-Harness – findet optimale Layer-Duplizierungskonfigurationen
layer_path.pyErstellt beliebige GGUF mit explizitem Layer-Ausführungspfad
gguf_surgery.pyLow-Level GGUF-Layer-Duplizierung (von sweep.py verwendet)
math_probe.pyHarte Rechensonde (Ng's Teilpunktebewertung)
eq_probe.pyEmotionale-Intelligenz-Sonde (EQ-Bench-Stil)
reasoning_probe.pyBBH-abgeleitete kausale/logische/Navigations-/Mathe-Textaufgaben
compare_eval.pyVergleicht lm-evaluation-harness-Ergebnisse über Durchläufe hinweg
visualize.pyText- und PNG-Heatmaps der Sweep-Ergebnisse

Wie der Sweep funktioniert

  1. Für jede Layer-Konfiguration (i, j):
    • GGUF-Surgery erstellt ein Modell, bei dem Layer i..j-1 physisch dupliziert sind
    • Der neue Forward Pass: layers 0..j-1 → layers i..j-1 nochmal → layers j..N-1
    • llama-server lädt das modifizierte Modell
    • Drei Test-Suiten laufen: Mathe, EQ, Reasoning (BBH-abgeleitet)
    • Ergebnisse werden mit dem Basiswert verglichen, Ergebnisse live angezeigt
    • Server beendet, modifizierte GGUF gelöscht, nächste Konfiguration
Tool herunterladen