Muthaiah Venkatachalam da Intel e Tate Berenbaum do Not Community Labs publicaram um artigo em 19 de agosto demonstrando que Intel AI PCs convencionais podem executar inferência distribuída de LLM sem kernels customizados ou hardware em nuvem. Uma configuração Llama 3.1 8B com dois nós atingiu 43,97 tokens por segundo atendendo dois usuários simultâneos—1,79× a taxa de transferência de uma única máquina. Uma frota Lunar Lake com quatro nós executou um modelo 70B em velocidade interativa; nenhuma máquina individual conseguiria processá-lo.
A arquitetura particiona modelos em limites de camadas em shards por estágio, cada um pré-compilado como OpenVINO IR INT4. Máquinas carregam seu shard, decodificam uma etapa e passam ativações para o próximo nó via TCP. Viagens de ida e volta por token dominam a latência. Decodificação especulativa—elaborando múltiplos tokens por passagem dianteira—atenua isso, mas modelos OpenVINO com estado enfrentam um obstáculo: o rewind de KV-cache custa 48 milissegundos por chamada em Arc B390 com cache de 72-token, anulando ganhos.
Primeira correção: zerar posições attention_mask em vez de aparar fisicamente o cache. Isto é bit-exato com aparagem física e custa quase nada, desbloqueando 1,33× aceleração média em especulação de nó único, subindo para 1,6× em gerações de 2048-token. Segunda correção: injeção de beam_idx Gather. Ferramentas de exportação padrão falham em shards modernos devido a fluxo de controle dinâmico em embeddings rotativos e operações de KV cache. O time alternnou para torch.jit.trace com embeddings rotativos pré-computados, depois injetou nós beam_idx Parameter e Gather pós-exportação. Isso dispara a fusão IndirectKVCache do OpenVINO no plugin GPU. Sem isso, shards executam 13–23% mais lentamente que modelos monolíticos. Com isso, correspondem à taxa de transferência monolítica dentro de 4%.
Terceiro: micro-batching. Objetos OpenVINO InferRequest carregam KV caches com estado, deixando fluxos de usuário separados intercalarem em estágios de pipeline sem mudanças de framework. Dois fluxos geram 1,80× escala de taxa de transferência do sistema. Sob latência WAN de 100 milissegundos, a pilha combinada—sharding, especulação e micro-batching—entrega 4,04× a taxa de transferência de decodificação naive de pipeline, que cai abaixo do limite interativo nesse cenário.
Lacunas conhecidas permanecem. Crescimento de KV cache ainda corrói taxa de transferência em deployments 70B de contexto longo. Suporte a NPU existe, mas benchmarks executam em iGPU. Caching INT8 KV foi mais lento e foi descartado.
Código, logs e scripts de reprodução estão em github.com/labscommunity/pipeline-sharded-inference-paper sob CC BY 4.0. Inferência distribuída de LLM em edge em Intel AI PCs foi limitada por três lacunas específicas de gráfico e escalonamento no OpenVINO—cada uma agora fechada com patches prontos para deployment.