
Version publique du dépôt Entropica
Je dois transférer une partie du travail depuis les dépôts privés. L'exploration de l'utilisation de modèles à très multiples têtes avec des fonctions de mixage et de lecture séparées se poursuit. Actuellement, j'entraîne un modèle Chinese TinyStories sur un modèle équivalent à 3B qui s'entraîne facilement sur un GPU de 8 Go. Nous observons une réduction de 80 à 90 % de la mémoire GPU nécessaire. Davantage de travail sera transféré la semaine prochaine.
Ce furent des vacances amusantes. Les premiers titres de propriété intellectuelle ont été déposés. Plusieurs POC réalisés avec inférence tout-optique (pas de GPU !) pour explorer les limites du possible :
https://github.com/dwallener/EntropicaPublic/blob/main/v0.4-alphago/README.md
https://github.com/dwallener/EntropicaPublic/blob/main/v0.4-gps/README.md
https://github.com/dwallener/EntropicaPublic/blob/main/v0.4-target/README.md
Nous présentons Entropica, le premier modèle de langage génératif dont le passage avant est physiquement réalisable sous forme d'un interféromètre linéaire-optique passif fonctionnant sans consommation électrique pendant l'inférence.
Le modèle utilise un espace de Hilbert complexe de dimension 1024 avec 32 couches de mailles de Mach–Zehnder programmables (architecture Reck) et calcule les probabilités des tokens directement via la règle de Born sur un faisceau laser de 650 nm.
Malgré l'utilisation uniquement d'opérations unitaires et d'aucun mécanisme d'attention, un modèle 1024×32 parvient à générer des TinyStories cohérentes après moins de 1,8 heure d'entraînement sur un seul GPU grand public. Nous démontrons en outre une voie de mise en œuvre optique complète utilisant des masques de phase imprimés sur film transparent et une diode laser à 30 $.
Note technique la plus récente :
https://zenodo.org/records/17764289

https://zenodo.org/records/17764289
Le code source du premier article Entropica. Le modèle lui-même se trouve dans v000/quantum_lm.py
https://github.com/dwallener/EntropicaPublic/blob/main/v001/quantum_lm.py
Les scripts generate/sample/train gèrent le jeu de données, l'inférence et le processus d'entraînement.