
Versione pubblica del repo Entropica
Devo spostare qui parte del lavoro dai repository privati. Continua l'esplorazione dell'uso di modelli massicciamente multi-testa con funzioni mixer e readout separate. Attualmente sto addestrando una TinyStories in cinese su un modello equivalente a 3B che si addestra facilmente su una GPU da 8GB. Stiamo vedendo una riduzione dell'80-90% della memoria GPU necessaria. Sposterò altro lavoro la prossima settimana.
È stata una vacanza divertente. Sono stati depositati i primi IP. Diverse PoC realizzate con inferenza completamente ottica (senza GPU!) per esplorare i limiti di ciò che è possibile:
https://github.com/dwallener/EntropicaPublic/blob/main/v0.4-alphago/README.md
https://github.com/dwallener/EntropicaPublic/blob/main/v0.4-gps/README.md
https://github.com/dwallener/EntropicaPublic/blob/main/v0.4-target/README.md
Presentiamo Entropica, il primo modello linguistico generativo il cui forward pass è fisicamente realizzabile come un interferometro ottico lineare passivo che opera a zero potenza elettrica durante l'inferenza.
Il modello utilizza uno spazio di Hilbert complesso a 1024 dimensioni con 32 strati di reti programmabili di Mach–Zehnder (architettura di Reck) e deriva le probabilità dei token direttamente tramite la regola di Born su un raggio laser da 650 nm.
Nonostante utilizzi solo operazioni unitarie e nessun meccanismo di attenzione, un modello 1024×32 ottiene una generazione coerente di TinyStories dopo < 1.8 ore di addestramento su una singola GPU consumer. Dimostriamo inoltre un percorso di implementazione ottica completo utilizzando maschere di fase stampate su pellicola trasparente e un diodo laser da $30.
https://zenodo.org/records/17764289

https://zenodo.org/records/17764289
Il codice sorgente del primo articolo su Entropica. Il modello stesso si trova in v000/quantum_lm.py
https://github.com/dwallener/EntropicaPublic/blob/main/v001/quantum_lm.py
Gli script generate/sample/train gestiscono il dataset, l'inferenza e il processo di addestramento.