
プライベートリポジトリからいくつかの作業を移行する必要があります。ミキサー関数と読み出し関数を分離した超多ヘッドモデルの活用に関する探求は継続中です。現在、8GBのGPUで容易にトレーニングできる3B相当のモデル上で、中国語のTinyStoriesをトレーニングしています。必要なGPUメモリは80〜90%削減できる見込みです。来週にはさらに多くの作業を移行する予定です。
楽しい休暇でした。最初のIP出願が完了しました。可能性の限界を探るため、全光学推論(GPU不要!)によるPoCをいくつか完了しました:
https://github.com/dwallener/EntropicaPublic/blob/main/v0.4-alphago/README.md
https://github.com/dwallener/EntropicaPublic/blob/main/v0.4-gps/README.md
https://github.com/dwallener/EntropicaPublic/blob/main/v0.4-target/README.md
我々はEntropicaを提案します。これは、推論中に消費電力ゼロで動作するパッシブ線形光学干渉計としてフォワードパスが物理的に実現可能な、初の生成言語モデルです。
このモデルは、32層のプログラム可能なマッハ・ツェンダーメッシュ(Reckアーキテクチャ)を備えた1024次元の複素ヒルベルト空間を使用し、650nmレーザービーム上のボルン則を通じてトークン確率を直接導出します。
ユニタリ演算のみを使用し、アテンション機構を一切使用しないにもかかわらず、1024×32モデルは、1台のコンシューマー向けGPUでの1.8時間未満のトレーニング後に、首尾一貫したTinyStories生成を達成します。さらに、透明フィルム上の印刷位相マスクと30ドルのレーザーダイオードを使用した完全な光学実装経路も実証します。
https://zenodo.org/records/17764289

https://zenodo.org/records/17764289
最初のEntropica論文のソースコードです。モデル自体は v000/quantum_lm.py にあります。
https://github.com/dwallener/EntropicaPublic/blob/main/v001/quantum_lm.py
generate/sample/train の各スクリプトが、データセット、推論、トレーニングプロセスを管理します。