
Entropica repo का सार्वजनिक संस्करण
मुझे निजी रिपॉजिटरी से कुछ कार्य यहाँ स्थानांतरित करने की आवश्यकता है। मिक्सर और रीडआउट फ़ंक्शन को अलग करके बड़े पैमाने पर बहु-हेडेड मॉडल का उपयोग करने की खोज जारी है। वर्तमान में 8GB GPU पर आसानी से प्रशिक्षित होने वाले 3B-समतुल्य मॉडल पर एक चीनी TinyStories प्रशिक्षित किया जा रहा है। हम आवश्यक GPU मेमोरी में 80-90% की कमी देख रहे हैं। इस आने वाले सप्ताह में और अधिक कार्य यहाँ स्थानांतरित किया जाएगा।
यह एक मजेदार छुट्टी थी। पहली IP फ़ाइलें दाखिल की गई हैं। सभी-ऑप्टिकल अनुमान (कोई GPU नहीं!) के साथ कई POC पूरे किए गए हैं ताकि यह पता लगाया जा सके कि क्या संभव है:
https://github.com/dwallener/EntropicaPublic/blob/main/v0.4-alphago/README.md
https://github.com/dwallener/EntropicaPublic/blob/main/v0.4-gps/README.md
https://github.com/dwallener/EntropicaPublic/blob/main/v0.4-target/README.md
हम Entropica प्रस्तुत करते हैं, पहला जनरेटिव भाषा मॉडल जिसका फॉरवर्ड पास एक निष्क्रिय रैखिक-ऑप्टिकल इंटरफेरोमीटर के रूप में भौतिक रूप से साकार किया जा सकता है जो अनुमान के दौरान शून्य विद्युत शक्ति पर काम करता है।
मॉडल प्रोग्रामेबल Mach-Zehnder मेश (Reck आर्किटेक्चर) की 32 परतों के साथ 1024-आयामी जटिल हिल्बर्ट स्पेस का उपयोग करता है और 650 nm लेज़र बीम पर बॉर्न नियम के माध्यम से सीधे टोकन संभावनाएँ प्राप्त करता है।
केवल यूनिटरी ऑपरेशन और कोई अटेंशन मैकेनिज्म का उपयोग न करने के बावजूद, एक 1024×32 मॉडल एकल उपभोक्ता GPU पर <1.8 घंटे के प्रशिक्षण के बाद सुसंगत TinyStories जनरेशन प्राप्त करता है। हम पारदर्शिता फिल्म पर मुद्रित चरण मास्क और $30 लेज़र डायोड का उपयोग करके एक पूर्ण ऑप्टिकल कार्यान्वयन पथ भी प्रदर्शित करते हैं।
https://zenodo.org/records/17764289

https://zenodo.org/records/17764289
पहले Entropica पेपर का स्रोत कोड। मॉडल स्वयं v000/quantum_lm.py में है।
https://github.com/dwallener/EntropicaPublic/blob/main/v001/quantum_lm.py
स्क्रिप्ट generate/sample/train डेटासेट, अनुमान और प्रशिक्षण प्रक्रिया का प्रबंधन करती हैं।