Um setup doméstico demonstrou que é possível ter Inteligência Artificial de ponta em execução localmente sem depender da nuvem, com quatro unidades do NVIDIA DGX Spark, o especialista e analista Patrick Moorhead conseguiu executar o enorme modelo DeepSeek V4.1-Flash e alcançou impressionantes 494 tokens por segundo, tendo entre os benefícios maior controle, privacidade e a ausência de limites de processamento.
Para acomodar a exigência de 476 GB de memória do modelo, o cluster combina quatro nós DGX Spark de 128 GB cada, totalizando 512 GB de memória unificada. Em vez de gastar com um switch de rede caro recomendado pela fabricante, Moorhead interligou as máquinas em uma topologia de anel inteligente por meio de cabos diretos QSFP para baratear e compactar o projeto.
Em termos de processamento, cada módulo traz um GB10 Superchip, com CPU Arm de 20 núcleos, GPU Blackwell integrada de 6.144 núcleos CUDA (similar à RTX 5070), capaz de entregar até 1.000 TOPS em dados no formato NVFP4 para IA, e largura de banda de memória elevada de 273 GB/s.Clique aqui para ler mais
