Runtime de pesquisa para computadores neurais diferenciáveis, emulação de CPU baseada em GPU e síntese de programas. Recursos: ALU neural, criptografia de tempo constante, modelos de mundo JEPA e um compilador C auto-hospedado no Metal.
Um computador completo onde cada camada — aritmética, SO, compilador, tela — é uma rede neural treinada ou roda inteiramente na GPU.
O modelo não roda no computador. O modelo é o computador.
O nCPU é um repositório que persegue uma tese a partir de cinco direções: um computador pode ser construído a partir de componentes aprendidos, e quando toda a pilha de execução é diferenciável, programas deixam de ser coisas que você escreve e se tornam coisas que podem ser procuradas por gradiente descendente. Cada subsistema abaixo se sustenta por suas próprias medidas; juntos eles cobrem a pilha desde operações individuais da ALU até um sistema operacional e síntese de programas.
Toda operação da ALU — adição, subtração, multiplicação, lógica bit a bit, deslocamentos, divisão — é uma rede neural treinada. O SO neural (neurOS) gerencia memória, escala processos e compila código através de 11 modelos treinados sem quedas para código escrito à mão. Uma tela neural renderiza caracteres através de MLPs char→glyph e uma ConvNet (143K parâmetros). O pipeline completo — código fonte → compilador neural → montador neural → CPU neural → tela neural — é diferenciável de ponta a ponta.
A ALU neural atinge 100% de precisão em aritmética de inteiros de 32 bits, verificada exaustivamente sobre todas as entradas possíveis. Um resultado inverte a hierarquia de hardware convencional: multiplicação é 12x mais rápida que adição aqui, porque adição precisa de uma cadeia de transporte de 8 passagens enquanto a multiplicação se decompõe em consultas paralelas de tabela de pares de bytes.
| Instrução | Estratégia | Latência |
|---|---|---|
| ADD/SUB/CMP | Carry-lookahead de Kogge-Stone (8 passagens) | 248 µs |
| MUL | LUT de par de bytes (65.536 entradas) | 21 µs |
| AND/OR/XOR | Tabela verdade vetorizada | 21 µs |
| SHL/SHR | Roteamento de bits baseado em atenção | 434 µs |
| DIV | Divisão restaurativa (subtração neural) | varia |
Precisão dos componentes do neurOS:
| Componente | Precisão | Componente | Precisão |
|---|---|---|---|
| MMU | 100% | Geração de código do montador | 100% |
| TLB | 99,6% | Tokenizador do montador | 99,4% |
| Cache | 99,7% | Otimizador do compilador | 95,2% |
| Escalonador | 99,2% | Watchdog | 100% |
| Prefetch | 97,8% | Alocador de blocos | 98,4% |
Um computador autossuficiente em uma única GPU — a CPU é envolvida apenas no boot. O kernel Rust + Metal executa cerca de 200 instruções ARM64 (inteiros e ponto flutuante) a aproximadamente 1,9M instruções por segundo, com memória compartilhada de cópia zero e variância de contagem de ciclos zero entre execuções (σ = 0,0).
O que roda nele:
nSynth é um sistema de síntese de programas baseado em Rust que descobre programas executáveis a partir de exemplos de entrada/saída usando gradiente descendente, enumeração e busca. Combinado com um motor ML/tensor abrangente e pilha web completa, permite a síntese de:
Cobertura: 420/420 problemas de síntese (Mog: 315/315, nSynth: 105/105)
Três Pilares:
cd nsynth
cargo run --release --bin nsynth_codegen --lang python --examples '{
"name":"reverse","signature":"fn reverse(arr: List<i64>) -> List<i64>",
"examples":[{"inputs":[[1,2,3]],"expected":[3,2,1]}]
}'
# → def reverse(arr): return arr[::-1]
A ALU neural injetada na passagem direta de um transformer como um expert roteado. Uma porta aprendida por token decide se cada token flui através do MLP original ou através da ALU neural. Tabelas verdade suaves bilineares fornecem lógica diferenciável, operações tensorais fornecem aritmética diferenciável, e o roteamento é modulado pela confiança do modelo.
Resultados de uma varredura de 11 modelos nas famílias Qwen 2.5/3/3.5, em tarefas aritméticas:
| Modelo | Precisão aritmética | Nota |
|---|---|---|
| Qwen3.5-2B (instruct) | 14,5% → 71,0% (+56,5 pp) | melhor geral |
| Qwen3.5-2B (base) | 15,5% → 63,0% (+47,5 pp) | 100% em ADD/SUB/MUL/DIV |
| Qwen3.5-4B | +51,0 pp | maior ganho em modelo base (empatado) |
| Qwen3.5-9B | +51,0 pp | maior ganho em modelo base (empatado) |
A transferência para o mundo real é medida, não extrapolada: no HumanEval completo (Qwen3.5-4B, A100), 62,2% → 64,6% — quatro problemas adicionais resolvidos.