
Entropica 저장소의 공개 버전
비공개 저장소에서 일부 작업을 옮겨야 합니다. 믹서(mixer)와 리드아웃(readout) 함수를 분리한 대규모 멀티헤드 모델 사용에 대한 탐구는 계속되고 있습니다. 현재 8GB GPU에서 쉽게 학습되는 3B 상당 모델로 중국어 TinyStories를 학습시키고 있습니다. 필요한 GPU 메모리가 80-90% 감소할 것으로 보고 있습니다. 이번 주에 더 많은 작업을 옮길 예정입니다.
즐거운 휴가였습니다. 첫 번째 IP가 출원되었습니다. 가능성의 범위를 탐색하기 위해 전광(all-optical) 추론(GPU 없이!)으로 여러 POC를 완료했습니다:
https://github.com/dwallener/EntropicaPublic/blob/main/v0.4-alphago/README.md
https://github.com/dwallener/EntropicaPublic/blob/main/v0.4-gps/README.md
https://github.com/dwallener/EntropicaPublic/blob/main/v0.4-target/README.md
우리는 추론 중 전기 소비가 0인 수동 선형 광학 간섭계로 물리적으로 구현 가능한 순방향 패스를 가진 최초의 생성형 언어 모델인 Entropica를 소개합니다.
이 모델은 32개 레이어의 프로그래밍 가능한 Mach–Zehnder 메시(Reck 아키텍처)로 구성된 1024차원 복소 힐베르트 공간을 사용하며, 650nm 레이저 빔에 대한 Born 규칙을 통해 토큰 확률을 직접 도출합니다.
유니터리 연산만 사용하고 어텐션 메커니즘이 없음에도 불구하고, 1024×32 모델은 단일 소비자용 GPU에서 1.8시간 미만의 훈련으로 일관된 TinyStories 생성을 달성합니다. 또한 투명 필름에 인쇄된 위상 마스크와 30달러 레이저 다이오드를 사용한 완전한 광학 구현 경로를 추가로 시연합니다.
https://zenodo.org/records/17764289

https://zenodo.org/records/17764289
첫 번째 Entropica 논문의 소스 코드입니다. 모델 자체는 v000/quantum_lm.py에 있습니다.
https://github.com/dwallener/EntropicaPublic/blob/main/v001/quantum_lm.py
generate/sample/train 스크립트는 데이터셋, 추론 및 훈련 프로세스를 관리합니다.