
Versão pública do repositório Entropica
Preciso transferir parte do trabalho dos repositórios privados. A exploração do uso de modelos com um grande número de cabeças, com funções de mixer e readout separadas, continua. Atualmente estamos treinando um TinyStories em chinês em um modelo equivalente a 3B, que treina facilmente em uma GPU de 8 GB. Estamos observando uma redução de 80 a 90% na memória de GPU necessária. Vou transferir mais do trabalho nesta próxima semana.
Foram férias divertidas. Os primeiros IPs foram depositados. Vários POCs concluídos com inferência totalmente óptica (sem GPU!) para explorar os limites do que é possível:
https://github.com/dwallener/EntropicaPublic/blob/main/v0.4-alphago/README.md
https://github.com/dwallener/EntropicaPublic/blob/main/v0.4-gps/README.md
https://github.com/dwallener/EntropicaPublic/blob/main/v0.4-target/README.md
Apresentamos o Entropica, o primeiro modelo generativo de linguagem cujo forward pass é fisicamente realizável como um interferômetro linear-óptico passivo que opera com zero de energia elétrica durante a inferência.
O modelo usa um espaço de Hilbert complexo de 1024 dimensões com 32 camadas de malhas Mach–Zehnder programáveis (arquitetura de Reck) e deriva as probabilidades dos tokens diretamente pela regra de Born em um feixe de laser de 650 nm.
Apesar de usar apenas operações unitárias e nenhum mecanismo de atenção, um modelo 1024×32 alcança geração coerente de TinyStories após menos de 1,8 horas de treinamento em uma única GPU de consumo. Também demonstramos um caminho completo de implementação óptica usando máscaras de fase impressas em filme de transparência e um diodo laser de US$ 30.
https://zenodo.org/records/17764289

https://zenodo.org/records/17764289
O código-fonte do primeiro artigo do Entropica. O modelo em si está em v000/quantum_lm.py
https://github.com/dwallener/EntropicaPublic/blob/main/v001/quantum_lm.py
Os scripts generate/sample/train gerenciam o dataset, o processo de inferência e o de treinamento.