Pesquisadores da Northeastern University, University of Minnesota e University of Connecticut publicaram SparseDitto em 5 de agosto de 2026 — um sistema que implanta agentes LLM para sintetizar kernels GPU customizados para operações de matriz esparsa. Para a mesma operação de matriz esparsa, cuSPARSE mostra uma lacuna de desempenho de 350x entre formatos de armazenamento CSR e Blocked-ELL. Essa variância não é um caso extremo — é o estado padrão da computação esparsa.
Kernels de matriz esparsa — SpMV, SpMM, SpGEMM — fundamentam treinamento de GNN, análise de grafos e computação científica. O desempenho depende de como os valores nonzero se distribuem e como isso mapeia para padrões de acesso à memória GPU. CSR funciona bem para matrizes com comprimentos de linha irregulares. Blocked-ELL explora regularidade para atingir Tensor Cores. COO, HYB e meia dúzia de formatos gerados por compilador cada um tem seus próprios regimes de desempenho. Antes de SparseDitto, o estado da arte era escolher um formato para todas as entradas (errado a maior parte do tempo) ou usar um classificador ML estático para selecionar entre um menu fixo de kernels existentes (limitado pelo que está no menu).
SparseDitto descarta o menu. Seu pipeline tem três estágios: um modelo aditivo leve ingere características estruturais da matriz de entrada — distribuição de comprimento de linha, densidade nonzero, regularidade de bloco — e classifica estratégias de execução candidatas. Um planejador ciente da arquitetura propõe designs de kernel ajustados à hierarquia de memória da GPU alvo. Agentes de codificação e verificação implementam cada design, o executam no hardware alvo e iteram usando medições de latência real como feedback. O loop se fecha na GPU, não em simulação.
Em uma NVIDIA RTX PRO 6000, SparseDitto alcança um speedup de média geométrica de 2.68x sobre cuSPARSE em três operadores esparsos e benchmarks diversos de matrizes, com pico de 146.61x. Em um H200, a média geométrica é 2.79x, pico 78.5x. A lacuna entre média geométrica e pico reflete variância subjacente: algumas matrizes caem onde um kernel gerado supera dramaticamente qualquer baseline de formato fixo; outras veem ganhos modestos.
O resultado operacionalmente mais significativo é 3.39x: o speedup em treinamento GCN em lote completo. Treinamento GNN é onde operações esparsa dominam tempo de execução total — profiling de treinamento GraphSAGE em lote completo mostra que SpMM representa 83.6% do tempo total de treinamento. Uma melhoria de 3.39x naquele kernel se traduz diretamente em throughput de treinamento.
Duas restrições práticas importam. Primeiro, SparseDitto gera um kernel por tríplice matriz-operador-GPU. Para serving de inferência com matrizes de peso esparso fixas, geração é um custo offline único. Para treinamento com padrões de esparsidade dinamicamente mutáveis — pruning iterativo, esparsificação dinâmica — a matemática de amortização muda. Segundo, o sistema foi avaliado em RTX PRO 6000 e H200; comportamento em outras arquiteturas (A100, B200, AMD MI300X) ainda não está caracterizado.
A arquitetura SparseDitto — ranking baseado em features → planejamento de candidatos → agente de codificação LLM → verificação com hardware em loop — é um padrão geral para operações onde desempenho é sensível ao formato ou sensível à distribuição de entrada. Atenção esparsa, layouts customizados de GEMM quantizado e roteamento MoE esparsificado todos têm a mesma estrutura: desempenho varia 10–100x por escolha de configuração, ajuste estático é insuficiente e o espaço de solução é muito grande para busca manual. SparseDitto prova que agentes LLM podem fechar aquele loop em hardware real.
Se sua stack GNN ou inferência esparsa executa cuSPARSE com seleção de formato padrão, você está executando o kernel errado para suas matrizes específicas na sua GPU específica. A lacuna pode ser centenas de x, não percent.