
Öffentliche Version des Entropica-Repos
Ich muss einige Arbeiten aus den privaten Repos verschieben. Die Untersuchung zur Verwendung massiv multi-verkopfter Modelle mit getrennten Mixer- und Readout-Funktionen wird fortgesetzt. Derzeit wird eine chinesische TinyStories auf einem 3B-äquivalenten Modell trainiert, das problemlos auf einer 8-GB-GPU läuft. Wir sprechen von einer 80-90%igen Reduzierung des benötigten GPU-Speichers. Ich werde in der kommenden Woche mehr von der Arbeit hierher verschieben.
Es waren unterhaltsame Feiertage. Erste Patente wurden angemeldet. Mehrere Proofs of Concept mit rein optischer Inferenz (keine GPU!) wurden durchgeführt, um die Grenzen des Möglichen auszuloten:
https://github.com/dwallener/EntropicaPublic/blob/main/v0.4-alphago/README.md
https://github.com/dwallener/EntropicaPublic/blob/main/v0.4-gps/README.md
https://github.com/dwallener/EntropicaPublic/blob/main/v0.4-target/README.md
Wir stellen Entropica vor, das erste generative Sprachmodell, dessen Vorwärtspass physikalisch als passives linear-optisches Interferometer realisierbar ist, das während der Inferenz bei null elektrischer Leistung arbeitet.
Das Modell verwendet einen 1024-dimensionalen komplexen Hilbertraum mit 32 Schichten programmierbarer Mach-Zehnder-Gitter (Reck-Architektur) und leitet Token-Wahrscheinlichkeiten direkt über die Bornsche Regel auf einem 650-nm-Laserstrahl ab.
Trotz der Verwendung nur unitärer Operationen und ohne Aufmerksamkeitsmechanismus erreicht ein 1024×32-Modell nach weniger als 1,8 Stunden Training auf einer einzelnen handelsüblichen GPU eine kohärente TinyStories-Generierung. Wir demonstrieren weiterhin einen vollständigen optischen Implementierungspfad unter Verwendung gedruckter Phasenmasken auf Transparentfolie und einer 30-Dollar-Laserdiode.
Aktuellster technischer Hinweis:
https://zenodo.org/records/17764289

https://zenodo.org/records/17764289
Der Quellcode für das erste Entropica-Papier. Das Modell selbst befindet sich in v000/quantum_lm.py
https://github.com/dwallener/EntropicaPublic/blob/main/v001/quantum_lm.py
Die Skripte generate/sample/train verwalten den Datensatz, die Inferenz und den Trainingsprozess.