
بيئة تشغيل للأبحاث حول الحواسيب العصبية القابلة للتفاضل، ومحاكاة وحدة معالجة مركزية قائمة على GPU، وتوليف البرامج. تتميز بوحدة ALU عصبية، وتشفير زمني ثابت، ونماذج عالم JEPA، ومترجم C ذاتي الاستضافة على Metal.
حاسوب كامل حيث كل طبقة — الحساب، نظام التشغيل، المترجم، العرض — إما شبكة عصبية مُدرَّبة أو تعمل بالكامل على وحدة معالجة الرسوميات (GPU).
النموذج لا يعمل على الحاسوب. النموذج هو الحاسوب.
nCPU هو مستودع واحد يسعى إلى أطروحة واحدة من خمسة اتجاهات: يمكن بناء حاسوب من مكونات مُتعلمة، وبمجرد أن تصبح مجموعة التنفيذ الكاملة قابلة للتفاضل، تتوقف البرامج عن كونها أشياءً تكتبها وتصبح أشياءً يمكنك البحث عنها بواسطة الانحدار التدرجي. كل نظام فرعي أدناه يعتمد على قياساته الخاصة؛ معًا يغطون المجموعة بدءًا من عمليات ALU الفردية وصولًا إلى نظام تشغيل إلى تركيب البرامج.
كل عملية ALU — الجمع، الطرح، الضرب، المنطق البتّي، الإزاحات، القسمة — هي شبكة عصبية مُدرَّبة. نظام التشغيل العصبي (neurOS) يدير الذاكرة، ويجذب العمليات، ويُجمّع الكود من خلال 11 نموذجًا مُدرَّبًا دون أي تراجع مكتوب يدويًا. شاشة عرض عصبية تُعرض الأحرف عبر شبكات MLP للتحويل من حرف إلى شكل رسومي وشبكة ConvNet (143 ألف معامل). خط الأنابيب الكامل — كود المصدر → المترجم العصبي → المُجمّع العصبي → وحدة المعالجة المركزية العصبية → الشاشة العصبية — قابل للتفاضل من البداية إلى النهاية.
وحدة ALU العصبية تصل إلى دقة 100% على العمليات الحسابية الصحيحة 32 بت، تم التحقق منها بشكل شامل عبر كل إدخال ممكن. نتيجة واحدة تقلب التسلسل الهرمي التقليدي للعتاد: الضرب أسرع بـ 12 مرة من الجمع هنا، لأن الجمع يحتاج إلى سلسلة ترحيل من 8 تمريرات بينما الضرب يتحلل إلى عمليات بحث جدولية متوازية لأزواج البايتات.
دقة مكونات neurOS:
حاسوب مكتفٍ ذاتيًا على وحدة معالجة رسوميات واحدة — وحدة المعالجة المركزية (CPU) تشارك فقط عند الإقلاع. نواة Rust + Metal تنفذ حوالي 200 تعليمة ARM64 (عددية وعائمة) بسرعة تقريبًا 1.9 مليون تعليمة في الثانية، مع ذاكرة مشتركة بدون نسخ وبدون تباين في عدد الدورات عبر التشغيل (σ = 0.0).
ما يعمل عليه:
nSynth هو نظام توليف برامج مبني على Rust يكتشف برامج قابلة للتنفيذ من أمثلة الإدخال/الإخراج باستخدام الانحدار التدرجي، والتعداد، والبحث. بالاقتران مع محرك ML/موتر شامل ومجموعة ويب كاملة، يتيح توليف:
التغطية: 420/420 مشكلة توليف (Mog: 315/315، nSynth: 105/105)
ثلاثة أركان:
cd nsynth
cargo run --release --bin nsynth_codegen --lang python --examples '{
"name":"reverse","signature":"fn reverse(arr: List<i64>) -> List<i64>",
"examples":[{"inputs":[[1,2,3]],"expected":[3,2,1]}]
}'
# → def reverse(arr): return arr[::-1]
وحدة ALU العصبية المُحقنة في تمريرة المحول إلى الأمام كخبير مُوجَّه. بوابة مُتعلمة لكل رمز تقرر ما إذا كان كل رمز يمر عبر MLP الأصلي أو عبر ALU العصبية. جداول الحقيقة اللينة ثنائية الخطية توفر منطقًا قابلاً للتفاضل، وعمليات الموتر توفر حسابًا قابلاً للتفاضل، ويتم تعديل البوابة بواسطة ثقة النموذج.
نتائج من 11 نموذجًا عبر عائلات Qwen 2.5/3/3.5، في المهام الحسابية:
يتم قياس النقل في العالم الحقيقي، وليس استقراءه: على HumanEval الكامل (Qwen3.5-4B، A100)، 62.2% → 64.6% — أربع مشاكل إضافية تم حلها.
نموذج عالمي تنبؤي للحاسوب نفسه. إلى جانب التنفيذ الدقيق، تتعلم شبكة من نمط JEPA (بنية التضمين المشترك التنبؤية) توقع انتقالات حالة الآلة في فضاء كامن مضغوط:
latent_state_t + instruction → predictor → latent_state_{t+1}
يعمل على مستويين. عرض توضيحي بلغة بايثون (ncpu/jepa_neural_cpu/) ينفذ برامج حقيقية بجانب المتنبئ، محولاً خطأ التنبؤ إلى إشارة شاذة حية. تنفيذ Rust Metal (kernels/rust_metal/src/jepa/، 2,858 سطرًا) يراقب تنفيذ GPU الحتمي ويوجه الجدولة بنشاط من خلال تجاوزات متعلمة للانحياز.
لأن الركيزة الأساسية دقيقة، هذا النموذج العالمي لديه خاصيتان يفتقر إليهما معظم النماذج الأخرى: حقيقة أرضية مجانية غير محدودة (تشغيل المزيد من البرامج)، والقدرة على خلط التنفيذ المتوقع والدقيق حسب الرغبة — تخمين كامن رخيص عند الاستكشاف، وتنفيذ دقيق عندما يهم الأمر. الاتجاه طويل المدى هو تسلسل هرمي للمتنبئات على مستويات البت، والتعليمة، والبرنامج، والمهمة.
python3 -m ncpu.jepa_neural_cpu.demo # عرض توضيحي لـ JEPA العصبي من الأسفل لأعلى
python -m ncpu.world_model.quickstart # بداية سريعة لنموذج العالم الآلي JEPA
pip install -e ".[demo,dev]"
# العرض التوضيحي الرئيسي: GPU كحاسوب كامل (macOS / Apple Silicon)
python -m ncpu gpu # إقلاعه
python -m ncpu gpu --neural-alu # مع ALU العصبية داخل تظليل Metal
python -m ncpu gpu debug # مصحح أخطاء حتمي بـ 26 أمرًا
# عبر المنصات، لا تبعيات ثقيلة
python -m ncpu discover # برنامج من الأمثلة، عبر التوليف القابل للتفاضل
python -m ncpu text --interactive # نص عصبي / آلة تشفير
# خط أنابيب عصبي كامل (يتطلب مجموعة النماذج)
python -m ncpu full-neural # وحدة معالجة مركزية عصبية من الأعلى + شاشة عرض عصبية
python -m ncpu meta-compare # عرض مقارنة جنبًا إلى جنب
# طبقة JEPA التنبؤية
python3 -m ncpu.jepa_neural_cpu.demo
python -m ncpu.world_model.quickstart
# أصلي لـ Rust، لا يتطلب بايثون
cd kernels/rust_metal
cargo run --bin ncpu_run -- --elf ../../demos/gpu/busybox.elf --rootfs -- echo hello
جميع الأوضاع الثلاثة تنفذ نفس البرامج وتنتج نفس النتائج. الوضع العصبي يرسل كل عملية عبر شبكات مُدرَّبة. الوضع السريع يستخدم موترات أصلية مع نفس مجموعة التعليمات ونفس قابلية التفاضل. الوضع الحسابي يستبدل تدفق التدرج بالسرعة — حيث يتم إقلاع نظام التشغيل UNIX، ويستضيف المترجم نفسه، ويعمل BusyBox.
# الوضع العصبي — كل عملية هي نموذج مُدرَّب
from ncpu.model import CPU
cpu = CPU(neural_execution=True)
cpu.load_program("MOV R0, 7\nMOV R1, 6\nMUL R2, R0, R1\nHALT")
cpu.run()
print(cpu.get_register("R2")) # 42 — محسوبة بواسطة جدول بحث أزواج البايت العصبي
# المعالج المساعد القابل للتفاضل — حقنه في أي نموذج Hugging Face
from ncpu.coprocessor import inject_ncpu_coprocessor, NCPUCoprocessorConfig
config = NCPUCoprocessorConfig(confidence_aware=True, deterministic_alu=True)
inject_ncpu_coprocessor(model, config)
# التوليف القابل للتفاضل للبرامج
from ncpu.differentiable import ProgramSynthesizer, SynthesisSpec
spec = SynthesisSpec(examples=[
({0: 3.0, 1: 5.0}, {2: 8.0}),
({0: 7.0, 1: 2.0}, {2: 9.0}),
])
synth = ProgramSynthesizer(max_program_len=6)
result = synth.synthesize(spec, max_iters=2000)
# يكتشف: ADD R2, R0, R1; HALT
# نموذج العالم JEPA — توقع انتقالات حالة الآلة
from ncpu.world_model.je_world_model import JEWorldModel, JEWMConfig
model = JEWorldModel(JEWMConfig(state_dim=22, action_dim=8))
pred = model.predict_next_latent(model.encode_state(state), model.encode_action(action))
ينتج التنفيذ هنا تباينًا صفريًا في عدد الدورات — σ = 0.0 عبر 270 تشغيل، حيث يُظهر نفس الكود على Apple Silicon الأصلي تباينًا في التوقيت بنسبة 47–73%. بدون ذاكرة تخزين مؤقت للبيانات، لا توجد خطوط تخزين مؤقت ولا عقوبة لفقدان التخزين المؤقت، لذا فإن هجمات جدول T لـ AES ليس لديها ما تقيسه.
مبنيًا على هذه الخاصية، يوفر ncpu/crypto/ تشفير AES-128 بالزمن الثابت (ECB و CBC) من 19 عنصرًا أساسيًا بالزمن الثابت، مجتازًا جميع ناقلات اختبار FIPS 197 و NIST SP 800-38A.
وحدة تحكم مخفية تحول جزءًا من الآلة العصبية إلى معالج مساعد داخلي لتوليد الكود: حلقة مخزنة للتفكير → الكتابة → التحقق → التصحيح → الالتزام، رؤوس متعلمة للفعل/الإيقاف/الوصف/تصحيح الحالة/الذاكرة، وأوزان سريعة محلية المهمة تُحدّث أثناء الاستدلال. رأس الذاكرة المُتعلم حسن متوسط الخطأ التربيعي للتحقق بنسبة 83.26% مقارنة بالخط الأساسي.
مقاسة من النهاية إلى النهاية: HumanEval+ لـ qwen3.5:4b تحسنت من 147 إلى 154 ولـ qwen3.5:9b من 144 إلى 156; BigCodeBench-Hard لـ qwen3.5:9b تحسنت من 33 إلى 49.
SUBLEQ بالإضافة إلى MUX، تعمل في جميع أوضاع التنفيذ الثلاثة. في الوضع العصبي، تمر SUB عبر سلسلة ترحيل Kogge-Stone (~248 ميكروثانية) و MUX عبر AND/OR/NOT العصبية (~63 ميكروثانية). تحمّل صور .dec وتُقلع eForth. النقطة: إذا كانت الشبكات المُدرَّبة تنفذ بدقة حاسوبًا بتعليمتين ومجموعة تعليمات واحدة، فإن البناء يمتد إلى أي مجموعة تعليمات.
cargo build --release --bin nsynth_codegen
./target/release/nsynth_codegen --lang python --examples '{
"name":"square","signature":"fn square(x: i64) -> i64",
"examples":[{"inputs":[0],"expected":0},{"inputs":[3],"expected":9}]
}'
# → def square(x: int): return (0 * x * x) + (1 * x * x) + 0
ncpu/
differentiable/ # تنفيذ قابل للتفاضل، توليف برامج، اكتشاف مجموعة تعليمات
coprocessor/ # حقن nCPU في تمريرات المحول إلى الأمام
execution_training/# التنفيذ القابل للتفاضل كإشارة تدريب لنماذج لغة الكود
crypto/ # تشفير بالزمن الثابت (AES-128)
distributed/ # تنفيذ موزع على عدة وحدات GPU
jepa_neural_cpu/ # عرض توضيحي لـ JEPA العصبي من الأسفل
world_model/ # نموذج العالم الآلي JEPA (ديناميكيات تنبؤية)
autoresearch/ # بحث آلي + حلقة NPCoT مركبة
os/
neuros/ # نظام تشغيل عصبي: 17 وحدة (MMU، TLB، ذاكرة تخزين مؤقت، جدولة...)
gpu/ # نظام تشغيل UNIX على GPU: شل، نظام ملفات، أداة تحميل ELF، كود مصدر C
self_optimizing/ # SOME: وحدة تحكم مخفية، أوزان سريعة
neural/ # وحدة معالجة مركزية عصبية: جسر ALU عصبي، خط أنابيب نسج
model/ # وحدة معالجة مركزية قائمة على النموذج (عمليات عصبية، مُجمّع)
tensor/ # محاكي ARM64 قائم على الموتر (قابل للتفاضل)
# النوى الخلفية المترجمة / المسرّعة
kernels/ # rust_metal (نواة Rust+Metal ARM64)، mlx، npcot_wasm
nsynth/ # محرك توليف عالمي: تدرج + تعداد + بحث + ML + ويب
# 420/420 تغطية توليف، أكثر من 1000 واجهة ML، أكثر من 500 واجهة ويب
# الأساس: توليف برامج (105/105)، ML/موتر (18+ وحدة)، ويب (19+ وحدة)
# ML عالمي: انتباه، انتشار، تدفقات، معادلات تفاضلية، NeRF، تعلم تعزيزي، تعلم فوقي
# ويب كامل: WASM، WebGPU، أطر، واجهات API، تنسيق، تجميع
packages/ # حزم مصاحبة (metal_mlp)
# النماذج ومجموعة التوليف
models/ # أوزان المكونات العصبية المُدرَّبة (انظر models/MODEL_INDEX.md)
programs/ # مجموعة معايير التوليف (حساب، بتات، خوارزميات، ...)
# الأدلة، الورقة، التجارب
artifacts/ # نتائج معيارية ملتزمة مذكورة في الورقة + اختبارات
paper/ # ورقة بحثية + أقسام معيارية
benchmarks/ # نصوص تشغيل المعايير
experiments/ # تشغيلات تجارب استكشافية
# الاستخدام والعمليات
examples/ # عروض توضيحية صغيرة قابلة للتشغيل (واحد لكل مسار تنفيذ)
demos/ # جولات عرض توضيحية أكبر (BusyBox، Alpine، مترجم)
scripts/ # نقاط الدخول + أتمتة الصيانة
tools/ # أدوات المطور
training/ # خطوط أنابيب التدريب
packaging/ # سقالات النشر (Homebrew، Modal، DEPLOYMENT.md)
# اختبارات، وثائق، أصول
tests/ # مجموعة اختبارات (انظر tests/README.md)
docs/ # وثائق
assets/ # شعارات / أصول ثابتة
# مخرجات البناء والتشغيل (مُهملة بـ git — قابلة لإعادة التوليد، غير ملتزمة)
checkpoints/ # نقاط تفتيش أوزان كبيرة .pt
training_results/ # مسوحات مقياس المعالج المساعد، دراسات إزالة
dist/ # توزيعات البناء
logs/ outputs/ # سجلات التشغيل ومخرجات مؤقتة
كل دليل على المستوى الأعلى لديه README.md خاص به يصف غرضه.
python -m ncpu doctor
pytest tests/ -q # أكثر من 2,500 اختبار عبر المجموعة
التغطية تشمل التحقق الرسمي الشامل لـ ALU، العمليات العصبية، neurOS، وضع الحساب، التنفيذ متعدد العمليات، MUXLEQ، BusyBox/Alpine، مجموعة أدوات تصحيح أخطاء GPU، المعالج المساعد، توليف Mog، التنفيذ القابل للتفاضل، التشفير بالزمن الثابت، البرامج ذاتية التعديل، المترجم التفاضلي، التوزيع على عدة GPU، SOME، ونماذج JEPA التنبؤية.
MIT
| التعليمات | الإستراتيجية | زمن الاستجابة |
|---|
| ADD/SUB/CMP | توقع الترحيل Kogge-Stone (8 تمريرات) | 248 ميكروثانية |
| MUL | جدول بحث أزواج البايت (65,536 إدخال) | 21 ميكروثانية |
| AND/OR/XOR | جدول حقيقة مُعَظَّم | 21 ميكروثانية |
| SHL/SHR | توجيه بتات قائم على الانتباه | 434 ميكروثانية |
| DIV | قسمة استرجاعية (طرح عصبي) | يختلف |
| المكون | الدقة | المكون | الدقة |
|---|
| MMU | 100% | توليد كود المُجمّع | 100% |
| TLB | 99.6% | محلل الرموز للمُجمّع | 99.4% |
| ذاكرة التخزين المؤقت | 99.7% | محسّن المترجم | 95.2% |
| الجدولة | 99.2% | المراقب | 100% |
| الجلب المسبق | 97.8% | مخصص الكتل | 98.4% |
| النموذج | الدقة الحسابية | ملاحظة |
|---|
| Qwen3.5-2B (تعليمي) | 14.5% → 71.0% (+56.5 نقطة مئوية) | الأفضل بشكل عام |
| Qwen3.5-2B (أساس) | 15.5% → 63.0% (+47.5 نقطة مئوية) | 100% على ADD/SUB/MUL/DIV |
| Qwen3.5-4B | +51.0 نقطة مئوية | أكبر مكسب للنموذج الأساسي (مشترك) |
| Qwen3.5-9B | +51.0 نقطة مئوية | أكبر مكسب للنموذج الأساسي (مشترك) |
| الوضع | ما يعمل | قابل للتفاضل؟ | السرعة |
|---|
| عصبي | 13 نموذجًا مُدرَّبًا .pt | نعم — تدفق تدرج كامل | ~5K تعليمة/ثانية |
| سريع | عمليات موتر أصلية | نعم — تفاضل تلقائي قياسي | ~5K تعليمة/ثانية |
| حسابي | تظليل Rust + Metal | لا (عتاد منفصل) | ~1.9M تعليمة/ثانية |
| الطبقة | التنفيذ | النتيجة |
|---|
| ALU | 13 نموذجًا مُدرَّبًا .pt | حساب صحيح دقيق 32 بت، تم التحقق منه بشكل شامل |
| نظام التشغيل | neurOS — 11 نموذجًا عصبيًا، بدون تراجعات | MMU مُتعلم، TLB، ذاكرة تخزين مؤقت، جدولة، مترجم |
| حساب GPU | نواة Rust Metal، ~200 تعليمة ARM64 | برامج عشوائية بسرعة ~1.9M تعليمة/ثانية |
| نظام UNIX | C مُجمَّع على Metal | fork/pipe/wait، شل بـ 25 أمرًا، 28 استدعاء نظام |
| المترجم | cc.c، ~4,200 سطر، يستضيف نفسه | يجمّع نفسه، ثم يجمّع برامج — على GPU |
| أداة تحميل ELF | ملفات Linux ثنائية حقيقية على GPU | BusyBox و Alpine Linux v3.20 على Metal |
| المعالج المساعد | ALU عصبية في تمريرة المحول إلى الأمام | الرموز تُوجَّه عبر الحساب العصبي، مكاسب مقاسة |
| JEPA | نموذج عالمي تنبؤي لديناميكيات الآلة | تخمين كامن + كشف الشذوذ على ركيزة دقيقة |
| توليف البرامج | الانتشار العكسي عبر التنفيذ | برامج مكتشفة من أمثلة الإدخال/الإخراج |
| التشفير بالزمن الثابت | AES-128 ECB/CBC (ncpu/crypto/) | σ = 0.0 توقيت؛ ناقلات اختبار FIPS 197 + NIST SP 800-38A ناجحة |
| متعدد GPU | نوى موزعة مع ذاكرة مشتركة | fork/pipe/wait عبر وحدات GPU؛ تنفيذ متوازي وخط أنابيب |
| SOME | وحدة تحكم مخفية مع رؤوس كامنة | استدلال ذاتي التحسين؛ مكاسب في HumanEval+ و BigCodeBench |