Forschungslaufzeit für differenzierbare neuronale Computer, GPU-basierte CPU-Emulation und Programmsynthese. Bietet neuronale ALU, konstantzeit-Kryptographie, JEPA-Weltmodelle und einen selbsthostenden C-Compiler auf Metal.
Ein vollständiger Computer, bei dem jede Schicht – Arithmetik, Betriebssystem, Compiler, Display – entweder ein trainiertes neuronales Netz ist oder vollständig auf der GPU läuft.
Das Modell läuft nicht auf dem Computer. Das Modell ist der Computer.
nCPU ist ein Repository, das eine These aus fünf Richtungen verfolgt: Ein Computer kann aus gelernten Komponenten aufgebaut werden, und sobald der gesamte Ausführungsstapel differenzierbar ist, hören Programme auf, Dinge zu sein, die man schreibt, und werden zu Dingen, die man mittels Gradientenabstieg suchen kann. Jedes der folgenden Subsysteme basiert auf eigenen Messungen; zusammen decken sie den Stapel von einzelnen ALU-Operationen über ein Betriebssystem bis hin zur Programmsynthese ab.
Jede ALU-Operation – Addition, Subtraktion, Multiplikation, bitweise Logik, Verschiebungen, Division – ist ein trainiertes neuronales Netz. Das neuronale Betriebssystem (neurOS) verwaltet Speicher, plant Prozesse und kompiliert Code durch 11 trainierte Modelle ohne handgeschriebene Rückfallebene. Ein neuronales Display rendert Zeichen durch Char→Glyph-MLPs und ein ConvNet (143K Parameter). Die gesamte Pipeline – Quellcode → neuronaler Compiler → neuronaler Assembler → neuronale CPU → neuronales Display – ist durchgängig differenzierbar.
Die neuronale ALU erreicht 100 % Genauigkeit bei 32-Bit-Ganzzahlarithmetik, die exhaustiv über jede mögliche Eingabe verifiziert wurde. Ein Ergebnis kehrt die herkömmliche Hardware-Hierarchie um: Multiplikation ist hier 12-mal schneller als Addition, weil Addition eine 8-stufige Übertragskette benötigt, während Multiplikation in parallele Byte-Paar-Tabellennachschlagen zerlegt wird.
| Befehl | Strategie | Latenz |
|---|---|---|
| ADD/SUB/CMP | Kogge-Stone-Übertragsvorausberechnung (8 Durchläufe) | 248 µs |
| MUL | Byte-Paar-Nachschlagetabelle (65.536 Einträge) | 21 µs |
| AND/OR/XOR | Vektorisierte Wahrheitstabelle | 21 µs |
| SHL/SHR | Aufmerksamkeitsbasierte Bitlenkung | 434 µs |
| DIV | Restaurierende Division (neuronale Subtraktion) | variiert |
Genauigkeit der neurOS-Komponenten:
| Komponente | Genauigkeit | Komponente | Genauigkeit |
|---|---|---|---|
| MMU | 100 % | Assembler-Codegenerierung | 100 % |
| TLB | 99,6 % | Assembler-Tokenizer | 99,4 % |
| Cache | 99,7 % | Compiler-Optimierer | 95,2 % |
| Scheduler | 99,2 % | Watchdog | 100 % |
| Prefetch | 97,8 % | Blockzuordner | 98,4 % |
Ein autarker Computer auf einer einzigen GPU – die CPU wird nur beim Bootstrapping benötigt. Der Rust+Metal-Kernel führt etwa 200 ARM64-Befehle (Ganzzahl- und Gleitkommazahlen) mit etwa 1,9 Mio. Befehle pro Sekunde aus, mit Zero-Copy-Shared-Memory und Null-Zyklusvarianz zwischen Läufen (σ = 0,0).
Was darauf läuft:
nSynth ist ein Rust-basiertes Programmsynthesesystem, das ausführbare Programme aus Eingabe-/Ausgabebeispielen durch Gradientenabstieg, Enumeration und Suche entdeckt. In Kombination mit einer umfassenden ML-/Tensor-Engine und einem vollständigen Web-Stack ermöglicht es die Synthese von:
Abdeckung: 420/420 Syntheseprobleme (Mog: 315/315, nSynth: 105/105)
Drei Säulen:
cd nsynth
cargo run --release --bin nsynth_codegen --lang python --examples '{
"name":"reverse","signature":"fn reverse(arr: List<i64>) -> List<i64>",
"examples":[{"inputs":[[1,2,3]],"expected":[3,2,1]}]
}'
# → def reverse(arr): return arr[::-1]
Die neuronale ALU wird in den Forward-Pass eines Transformers injiziert, als gerouteter Experte. Ein gelerntes, tokenweises Gate entscheidet, ob jedes Token durch das ursprüngliche MLP oder durch die neuronale ALU fließt. Bilineare Soft-Wahrheitstabellen bieten differenzierbare Logik, Tensor-Operationen differenzierbare Arithmetik, und die Gattersteuerung wird durch die Modellkonfidenz moduliert.
Ergebnisse aus einem 11-Modell-Durchlauf über die Qwen-2.5/3/3.5-Familien bei arithmetischen Aufgaben:
| Modell | Arithmetikgenauigkeit | Anmerkung |
|---|---|---|
| Qwen3.5-2B (Instruct) | 14,5 % → 71,0 % (+56,5 PP) | Insgesamt am besten |
| Qwen3.5-2B (Base) | 15,5 % → 63,0 % (+47,5 PP) | 100 % bei ADD/SUB/MUL/DIV |
| Qwen3.5-4B | +51,0 PP | Größter Gewinn bei Basismodellen (gleich) |
| Qwen3.5-9B | +51,0 PP | Größter Gewinn bei Basismodellen (gleich) |
Die reale Übertragbarkeit wird gemessen, nicht extrapoliert: Bei vollständigem HumanEval (Qwen3.5-4B, A100) stieg 62,2 % auf 64,6 % – vier zusätzlich gelöste Probleme.