विभेदनीय तंत्रिका कंप्यूटर, GPU-आधारित CPU अनुकरण और प्रोग्राम संश्लेषण के लिए अनुसंधान रनटाइम। इसमें तंत्रिका ALU, स्थिर-समय क्रिप्टो, JEPA विश्व मॉडल और Metal पर स्व-होस्टिंग C कंपाइलर शामिल हैं।
एक पूरा कंप्यूटर जिसमें प्रत्येक परत — अंकगणित, OS, कंपाइलर, प्रदर्शन — या तो प्रशिक्षित तंत्रिका नेटवर्क है या पूरी तरह से GPU पर चलता है।
मॉडल कंप्यूटर पर नहीं चलता। मॉडल ही कंप्यूटर है।
nCPU एक ऐसा रिपॉजिटरी है जो एक ही थीसिस को पाँच दिशाओं से आगे बढ़ाता है: एक कंप्यूटर को सीखे गए घटकों से बनाया जा सकता है, और जब पूरा निष्पादन स्टैक डिफरेंशिएबल हो जाता है, तो प्रोग्राम वे चीज़ें नहीं रह जाते जो आप लिखते हैं, बल्कि वे चीज़ें बन जाते हैं जिन्हें आप ग्रेडिएंट डिसेंट द्वारा खोज सकते हैं। नीचे प्रत्येक उप-प्रणाली अपने स्वयं के माप के आधार पर खड़ी है; साथ में वे ALU संचालन से लेकर ऑपरेटिंग सिस्टम से प्रोग्राम संश्लेषण तक पूरे स्टैक को कवर करते हैं।
प्रत्येक ALU संचालन — जोड़, घटाव, गुणा, बिटवाइज लॉजिक, शिफ्ट, विभाजन — एक प्रशिक्षित तंत्रिका नेटवर्क है। तंत्रिका OS (neurOS) मेमोरी प्रबंधित करता है, प्रक्रियाओं को शेड्यूल करता है, और 11 प्रशिक्षित मॉडलों के माध्यम से कोड संकलित करता है, जिसमें कोई हाथ से लिखा गया फ़ॉलबैक नहीं है। एक तंत्रिका प्रदर्शन char→glyph MLPs और एक ConvNet (143K पैरामीटर) के माध्यम से वर्ण रेंडर करता है। पूरी पाइपलाइन — स्रोत कोड → तंत्रिका कंपाइलर → तंत्रिका असेंबलर → तंत्रिका CPU → तंत्रिका प्रदर्शन — अंत से अंत तक डिफरेंशिएबल है।
तंत्रिका ALU 32-बिट पूर्णांक अंकगणित पर 100% सटीकता प्राप्त करता है, हर संभव इनपुट पर विस्तार से सत्यापित किया गया है। एक परिणाम पारंपरिक हार्डवेयर पदानुक्रम को उलट देता है: गुणा यहाँ जोड़ की तुलना में 12x तेज़ है, क्योंकि जोड़ को 8-पास कैरी चेन की आवश्यकता होती है जबकि गुणा समानांतर बाइट-जोड़ी तालिका लुकअप में विघटित हो जाता है।
| निर्देश | रणनीति | विलंबता |
|---|---|---|
| ADD/SUB/CMP | Kogge-Stone carry-lookahead (8 पास) | 248 µs |
| MUL | बाइट-जोड़ी LUT (65,536 प्रविष्टियाँ) | 21 µs |
| AND/OR/XOR | वेक्टरीकृत सत्य तालिका | 21 µs |
| SHL/SHR | ध्यान-आधारित बिट रूटिंग | 434 µs |
| DIV | पुनर्स्थापना विभाजन (तंत्रिका घटाव) | भिन्न |
neurOS घटक सटीकता:
| घटक | सटीकता | घटक | सटीकता |
|---|---|---|---|
| MMU | 100% | असेंबलर कोडजन | 100% |
| TLB | 99.6% | असेंबलर टोकनाइज़र | 99.4% |
| कैश | 99.7% | कंपाइलर ऑप्टिमाइज़र | 95.2% |
| शेड्यूलर | 99.2% | वॉचडॉग | 100% |
| प्रीफ़ेच | 97.8% | ब्लॉक आवंटक | 98.4% |
एक एकल GPU पर आत्मनिर्भर कंप्यूटर — CPU केवल बूटस्ट्रैप पर शामिल होता है। Rust + Metal कर्नेल लगभग 200 ARM64 निर्देश (पूर्णांक और फ्लोटिंग-पॉइंट) लगभग 1.9M निर्देश प्रति सेकंड पर निष्पादित करता है, जिसमें जीरो-कॉपी शेयर्ड मेमोरी और रनों में जीरो साइकिल-काउंट भिन्नता (σ = 0.0) है।
इस पर क्या चलता है:
nSynth एक Rust-आधारित प्रोग्राम संश्लेषण प्रणाली है जो इनपुट/आउटपुट उदाहरणों से निष्पादन योग्य प्रोग्राम खोजती है, ग्रेडिएंट डिसेंट, गणना और खोज का उपयोग करके। एक व्यापक ML/टेंसर इंजन और पूर्ण वेब स्टैक के साथ मिलकर, यह निम्नलिखित के संश्लेषण को सक्षम बनाता है:
कवरेज: 420/420 संश्लेषण समस्याएँ (Mog: 315/315, nSynth: 105/105)
तीन स्तंभ:
cd nsynth
cargo run --release --bin nsynth_codegen --lang python --examples '{
"name":"reverse","signature":"fn reverse(arr: List<i64>) -> List<i64>",
"examples":[{"inputs":[[1,2,3]],"expected":[3,2,1]}]
}'
# → def reverse(arr): return arr[::-1]
तंत्रिका ALU को एक ट्रांसफॉर्मर के फॉरवर्ड पास में एक रूटेड विशेषज्ञ के रूप में इंजेक्ट किया गया। एक सीखा हुआ प्रति-टोकन गेट तय करता है कि प्रत्येक टोकन मूल MLP से गुजरेगा या तंत्रिका ALU से। बिलिनियर सॉफ्ट सत्य तालिकाएँ डिफरेंशिएबल लॉजिक प्रदान करती हैं, टेंसर ऑप्स डिफरेंशिएबल अंकगणित प्रदान करते हैं, और गेटिंग मॉडल आत्मविश्वास द्वारा मॉड्यूलेट की जाती है।
Qwen 2.5/3/3.5 परिवारों में 11 मॉडल स्वीप के परिणाम, अंकगणितीय कार्यों पर:
| मॉडल | अंकगणित सटीकता | नोट |
|---|---|---|
| Qwen3.5-2B (instruct) | 14.5% → 71.0% (+56.5 pp) | सर्वश्रेष्ठ समग्र |
| Qwen3.5-2B (base) | 15.5% → 63.0% (+47.5 pp) | ADD/SUB/MUL/DIV पर 100% |
| Qwen3.5-4B | +51.0 pp | सबसे बड़ा बेस-मॉडल लाभ (बराबर) |
| Qwen3.5-9B | +51.0 pp | सबसे बड़ा बेस-मॉडल लाभ (बराबर) |
वास्तविक दुनिया का स्थानांतरण मापा जाता है, अनुमानित नहीं: पूर्ण HumanEval पर (Qwen3.5-4B, A100), 62.2% → 64.6% — चार अतिरिक्त समस्याएँ हल।
कंप्यूटर का ही एक पूर्वानुमानित विश्व मॉडल। सटीक निष्पादन के साथ, एक JEPA-शैली नेटवर्क (Joint Embedding Predictive Architecture) एक संपीड़ित अव्यक्त स्थान में मशीन स्थिति संक्रमणों की भविष्यवाणी करना सीखता है:
latent_state_t + instruction → predictor → latent_state_{t+1}
यह दो स्तरों पर चलता है। एक Python डेमो (ncpu/jepa_neural_cpu/) भविष्यवक्ता के बगल में वास्तविक प्रोग्राम निष्पादित करता है, पूर्वानुमान त्रुटि को एक लाइव विसंगति संकेत में बदलता है। एक Rust Metal कार्यान्वयन (kernels/rust_metal/src/jepa/, 2,858 पंक्तियाँ) डिटर्मिनिस्टिक GPU निष्पादन का अवलोकन करता है और सीखे गए पूर्वाग्रह ओवरराइड के माध्यम से शेड्यूलिंग को सक्रिय रूप से संचालित करता है।