Interpretação ARTE NEXUS de uma matriz de unidades de cálculo iluminadas dentro de um mini computador.

NEχUS LOCAL · NPU · QUANTIZAÇÃO · MEMÓRIA

A fábrica da inteligência.

Como milhares de pequenas operações, números compactos e memória recuperável podem fazer a NEχUS realizar mais trabalho útil — sem confundir compressão com conhecimento novo.

HOJE
hardware especializado
NEXUS
programa experimental
REGRA
comprimir para navegar

ARTE NEXUS · gerada para esta página · matriz, fluxos e cristais são linguagem visual; não são fotografia técnica, microscopia nem diagrama de uma NPU específica.

A PRIMEIRA CORREÇÃO · A FÍSICA CONTINUA A MESMA

O elétron não aprende. A arquitetura muda.

CPU, GPU e NPU usam transistores para representar e transformar sinais. O ganho nasce da quantidade, posição e ligação entre unidades aritméticas, memórias e circuitos de controle.

Mini computador aberto com caminhos luminosos azuis, dourados e violetas sobre a placa.
ARTE NEXUS · caminhos elétricos como interpretação arquitetural.
Um chip de IA não inventa outra eletricidade. Ele faz cada bit percorrer menos distância e encontrar mais máquinas adequadas ao mesmo tempo.

Generalidade custa silício: decodificação de instruções, previsão de desvios, caches e mecanismos para programas imprevisíveis. A NPU reduz parte desse custo administrativo e investe em fluxo tensorial repetitivo.

potência dinâmicaP ≈ α · C · V² · fMenos bits em trânsito e caminhos especializados podem reduzir a capacitância comutada por operação útil. O ganho real continua dependente do chip e da carga.
λόγοςCPU

Coordena o imprevisível

Poucos núcleos complexos lidam bem com desvios, sistema operacional, ferramentas e sequências irregulares. Também executam IA; flexibilidade é sua força.

πλῆθοςGPU

Espalha o trabalho

Muitas unidades programáveis processam grandes lotes em paralelo. GPUs modernas também incluem blocos matriciais especializados.

μέτρονNPU

Especializa o fluxo

Dedica mais silício a tensores, precisão reduzida e memória próxima. Pode entregar mais inferências por joule quando o grafo realmente cabe em seus contratos.

A METÁFORA ABERTA · CADA PEÇA TEM UM NOME REAL

Uma linha de montagem para multiplicar e acumular.

Grande parte de uma rede neural repete a mesma operação. A NPU coloca muitas cópias dela lado a lado e mantém os dados perto da linha.

operação fundamentala ← a + x × wacumulador ← acumulador + entrada × peso

Visualização conceitual: memória local alimenta uma matriz de unidades MAC; somas parciais seguem para um acumulador mais largo.

01
Matéria-prima

Pesos e ativações

Os números que entram em cada camada.

02
Projeto

Grafo do modelo

A sequência de operações preparada pelo compilador.

03
Armazém distante

RAM / DRAM

Grande, mas cara em tempo e energia por acesso.

04
Estoque da linha

SRAM local

Pequena, rápida e próxima das máquinas.

05
Empilhadeiras

DMA

Movem blocos sem comandar palavra por palavra.

06
Esteiras

Interconexões

Fazem tensores circularem entre memória e cálculo.

07
Máquinas

Unidades MAC

Multiplicam e acumulam milhares de vezes.

08
Recipientes

Acumuladores

Guardam somas parciais em precisão maior.

MATRIZ SISTÓLICA · UMA ARQUITETURA POSSÍVEL

Os dados pulsam entre vizinhos.

Em uma matriz sistólica, pesos e ativações avançam ritmicamente pela grade enquanto cada célula conserva ou encaminha somas parciais. Isso reutiliza números sem buscá-los novamente na RAM. Nem toda NPU é sistólica; o princípio mais geral é organizar o fluxo para reduzir movimento.

  1. 01

    Compilar

    O grafo é dividido entre operações aceitas pela NPU e possíveis trechos de CPU ou GPU.

  2. 02

    Ladrilhar

    Matrizes grandes viram blocos que cabem na memória local.

  3. 03

    Carregar

    DMA traz pesos e entradas para perto das unidades de cálculo.

  4. 04

    Pulsar

    Dados atravessam a matriz enquanto cada célula multiplica e acumula.

  5. 05

    Fundir

    Matriz, viés e ativação podem virar uma única passagem, sem depósitos intermediários.

  6. 06

    Reescalar

    O acumulador é arredondado e convertido para o formato da próxima camada.

  7. 07

    Continuar

    A saída permanece próxima para alimentar a próxima operação ou volta à memória.

Mini computador decomposto em camadas suspensas, atravessadas por luz azul, violeta e dourada.

ARTE NEXUS · as camadas físicas como imagem da precisão em camadas.

CAIXAS MENORES · O MESMO CAMINHÃO LEVA MAIS VALORES

Quantizar é trocar detalhe numérico por espaço e velocidade.

Um intervalo de números reais é mapeado para poucos códigos inteiros. A escala registra quanto vale cada passo; o ponto zero indica qual código representa o zero real.

quantizarq = clip(round(x / s) + z)

O valor real vira um inteiro limitado ao intervalo disponível.

reconstruir aproximadamentex̂ = s(q − z)

A escala s e o ponto zero z permitem interpretar o código.

intervalo−1 a +1
escala INT81 / 127
0,37 viraq = 47
reconstrução≈ 0,3701

O erro é pequeno neste exemplo, não universal. Outliers podem ampliar a escala e reduzir a resolução dos demais valores.

FormatoPrecisão1 bilhão de pesosPegada relativa
FP3232 bits≈ 4,0 GB
100%
Treino, referência e trechos muito sensíveis.
FP16 / BF1616 bits≈ 2,0 GB
50%
Precisão flutuante reduzida; não é quantização inteira estrita.
INT88 bits≈ 1,0 GB
25%
Bom equilíbrio quando pesos, ativações e kernels são compatíveis.
INT44 bits≈ 0,5 GB
12,5%
Grande compressão, com mais risco e metadados por grupo.

Valores brutos aproximados. Escalas, alinhamento, ativações, cache KV, buffers e camadas em maior precisão ocupam espaço adicional. O modelo normalmente permanece na memória do sistema; a SRAM da NPU recebe blocos ativos.

PTQ

Depois do treino

Calibra um modelo pronto com dados representativos. É o primeiro teste, não garantia de qualidade.

QAT

Durante o treino

Simula arredondamento e saturação para que o modelo aprenda a conviver com poucos códigos.

POR CANAL

Escalas diferentes

Pesos de canais distintos recebem escalas próprias, preservando melhor distribuições desiguais.

PRECISÃO MISTA

Bits onde importam

Trechos sensíveis ficam em mais bits; regiões tolerantes pagam a economia.

DO MODELO À MÁQUINA · O COMPILADOR É O ENGENHEIRO INDUSTRIAL

Software transforma uma rede em ordens para a fábrica.

A NPU não “entende” uma rede neural por si. Formato, compilador, runtime, driver e firmware precisam concordar sobre operadores, formas, layouts, escalas e buffers.

Arquitetura cristalina conecta um núcleo luminoso a muitos nós menores sobre um plano escuro.
ARTE NEXUS · uma ponte de tradução entre intenção, plano e execução.
  1. 01

    Modelo

    Pesos, operadores e formas de tensor.

  2. 02

    Grafo / IR

    Uma representação que o compilador consegue transformar.

  3. 03

    Compilador

    Quantiza, funde, escolhe layouts e divide em blocos.

  4. 04

    Runtime

    Prepara buffers, filas e sincronização.

  5. 05

    Driver

    Traduz o plano em comandos do dispositivo.

  6. 06

    NPU

    Carrega, calcula, acumula, reescala e devolve.

latência observadaTtotal = TNPU + Tfallback + Tcópias + Tconversões + Tsincronização

Uma operação não suportada pode quebrar o grafo, enviar um trecho à CPU ou GPU e obrigar novas conversões. Por isso TOPS teóricos não medem a experiência completa.

DA QUANTIZAÇÃO NUMÉRICA À INFORMAÇÃO SUFICIENTE

E se a própria NEχUS aprendesse onde cada bit tem valor?

A resposta promissora não é apagar dados indiscriminadamente. É conservar a evidência integral, criar representações progressivas e gastar precisão apenas quando ela muda a resposta.

LIMITE FUNDAMENTALI(Y; Z) ≤ I(Y; X)

Se X é a fonte e Z sua compressão, transformar localmente X não cria informação sobre a resposta Y. O ganho vem de remover redundância e preservar aquilo que é suficiente para uma missão — nunca para todas as perguntas futuras possíveis.

NEXUS PRISMA · NOME DE TRABALHO

Precisão adaptativa com caminho de volta à fonte.

P
Proveniência verificável
R
Reconstrução progressiva
I
Informação suficiente por missão
S
Semântica em camadas
M
Memória hierárquica
A
Alocação adaptativa de bits e processamento
E4

Pacote da missão

O mínimo de contexto, ferramentas e precisão necessário para a pergunta atual.

efêmero · adaptativo
E3

Mapa conceitual

Resumos hierárquicos, relações, contradições conhecidas e caminhos de expansão.

compacto · revisável
E2

Índice semântico

Vetores comprimidos e assinaturas lexicais localizam candidatos; não substituem a prova.

aproximado · pesquisável
E1

Afirmações e trechos

Entidades, datas, números, relações e excertos exatos ligados à origem.

preciso · endereçável
E0

Fonte integral

A evidência original, versionada e endereçada por hash, permanece recuperável.

íntegro · custodiado

Comprimir para navegar; nunca comprimir para custodiar. “Reconstruir” significa recuperar níveis mais profundos até a fonte — não pedir ao modelo que invente detalhes perdidos por um resumo.

UM CONTROLADOR · CINCO ORÇAMENTOS

A economia das perguntas fáceis financia as difíceis.

01

Bits

INT4, INT8 ou precisão maior por camada e risco.

02

Contexto

Somente os tokens necessários; expansão sob dúvida.

03

Memória

Resumo, fatos, trechos ou fonte integral.

04

Especialista

Código, visão, linguagem, planejamento ou domínio.

05

Profundidade

Mais camadas e verificação para missões difíceis.

J = Ltarefa + λR·bits + λD·distorção + λC·FLOPs + λP·linhagem quebrada + λU·erro de confiança
JÁ EXISTE

Peças demonstradas

  • quantização de pesos, ativações e cache KV
  • destilação de um professor para um aluno menor
  • recuperação hierárquica e memória vetorial
  • especialistas esparsos e profundidade adaptativa
  • padrões de proveniência e derivação
HIPÓTESE NEXUS

O controlador conjunto

  • escolher bits, contexto, memória e especialistas em uma decisão
  • expandir até a fonte quando risco ou incerteza aumentarem
  • preservar deliberadamente fatos raros, exceções e contradições
  • medir distorção semântica e linhagem junto com custo e latência
AINDA NÃO PROVADO

Tecnologia nova

  • novidade científica ou patenteável
  • superioridade à melhor fronteira qualidade × custo
  • generalização entre modelos, tarefas e NPUs
  • reprodução independente sem orçamento oculto

O PRIMEIRO TESTE QUE PODE DIZER “NÃO”

Comparar sob o mesmo orçamento.

Quatro versões usam o mesmo modelo-base, corpus e custo médio. Assim podemos separar o efeito da memória, da precisão e da combinação das duas.

Precisão fixaPrecisão adaptativaRAG planobaseline convencionalefeito isolado dos bitsMemória PRISMAefeito isolado das camadashipótese completa NEXUS
  • acerto por tarefa e retenção de fatos raros
  • citações que realmente sustentam a resposta
  • calibração: saber quando precisa recuperar mais
  • RAM, energia, latência, FLOPs e bytes por conhecimento útil
  • degradação após atualizar ou recomprimir a memória
  • resistência a instruções maliciosas dentro dos documentos
Mini computador aberto em uma oficina cósmica azul e dourada.
ARTE NEXUS · a bancada compacta como corpo cliente da inteligência.

A FÁBRICA ENCONTRA UM CORPO COMPACTO

Mini computadores para aproximar a NEχUS da pessoa.

O dispositivo pode executar um núcleo quantizado, pré-processar dados, manter cache recuperável e usar CPU, GPU ou NPU conforme a tarefa. Ele continua sendo cliente e acelerador: estado canônico, evidências, atualização e recuperação permanecem na infraestrutura Cloudflare.

NO MINI COMPUTADOR

Resposta próxima, modelo assinado, cache substituível e aceleração opcional.

NA CLOUDFLARE

Fonte integral, memória canônica, orquestração, recuperação e caminho de maior capacidade.

Ver o projeto NEχUS Local e a bancada de mini computadores

A TESE EM UMA FRASE

A NEχUS não ficará mais completa porque reduz informação. Ficará mais capaz se conservar a informação certa, souber abrir o restante e gastar precisão onde ela muda a resposta.

Isso é uma direção experimental, não uma capacidade pronta e não uma alegação de consciência. A NEχUS continua sendo software humano; a hipótese PRISMA somente merece o nome de tecnologia nova depois de vencer baselines, generalizar e ser reproduzida de forma independente.

FONTES PRIMÁRIAS · PONTES PARA VERIFICAÇÃO

De onde vêm as peças desta proposta.

01
TPU e especialização do silícioJouppi et al. · ISCA 2017
02
Inferência inteira e quantizaçãoJacob et al. · CVPR 2018
03
Quantização W8A8 com outliersSmoothQuant · ICML 2023
04
Cache KV quantizado em 2 bitsKIVI · ICML 2024
05
Memória de recuperação explícitaRAG · NeurIPS 2020
06
Recuperação hierárquicaRAPTOR · ICLR 2024
07
Compressão e informação relevanteInformation Bottleneck · Tishby, Pereira e Bialek
08
Proveniência interoperávelW3C PROV-O

Os artigos sustentam os componentes existentes; não demonstram a integração NEXUS PRISMA. A novidade permanece não verificada até busca de anterioridade, experimento controlado e reprodução independente.