我需要从私有仓库迁移一些工作过来。关于使用大规模多头模型并将混合器(mixer)与读出(readout)函数分离的探索仍在继续。目前正在一个 3B 等效模型上训练中文 TinyStories,该模型可以轻松地在 8GB GPU 上训练。我们预计所需 GPU 内存可减少 80-90%。下周将迁移更多工作过来。
假期过得很愉快。首批知识产权(IP)申请已提交。我们完成了几个采用全光学推理(无需 GPU!)的概念验证(POC),以探索可能性的边界:
https://github.com/dwallener/EntropicaPublic/blob/main/v0.4-alphago/README.md
https://github.com/dwallener/EntropicaPublic/blob/main/v0.4-gps/README.md
https://github.com/dwallener/EntropicaPublic/blob/main/v0.4-target/README.md
我们提出 Entropica,这是第一个生成式语言模型,其前向传播可在物理上实现为一个在推理期间以零电功率运行的无源线性光学干涉仪。
该模型使用一个 1024 维复希尔伯特空间,包含 32 层可编程马赫-曾德尔网格(Reck 架构),并通过 650 nm 激光束上的玻恩规则直接推导词元概率。
尽管仅使用酉运算且没有注意力机制,一个 1024×32 的模型在单个消费级 GPU 上训练不到 1.8 小时后即可实现连贯的 TinyStories 生成。我们进一步展示了一条完整的光学实现路径,即使用打印在透明胶片上的相位掩模和一个 30 美元的激光二极管。
https://zenodo.org/records/17764289

https://zenodo.org/records/17764289
这是第一篇 Entropica 论文的源代码。模型本身位于 v000/quantum_lm.py
https://github.com/dwallener/EntropicaPublic/blob/main/v001/quantum_lm.py
generate/sample/train 脚本负责管理数据集、推理与训练过程。