aiexpert
Home / Podcast / Ep. 31
31
Episode 31 · 5 min · Wire

Kernel profiling, power conversion, e segurança de imagem expõem a infraestrutura de IA como o novo gargalo da produção.

Kernel profiling, power conversion, e segurança de imagem expõem a infraestrutura de IA como o novo gargalo da produção.

Hosted by AlanHosting
RSS

Episode transcript

The script as aired, in full
Alan

Cem terabytes.

Ada

É quanto Cloudflare recuperou em RAM cortando hashes desnecessários e compactando estruturas em Rust. E é quanto a indústria inteira está deixando na mesa enquanto a GPU consome 5 kW.

Alan

Esta é a ai|expert Wire. A semana em que a infraestrutura de IA se tornou o gargalo — e o gargalo é mensurável.

Alan

Google expôs contadores de hardware em microsegundos para kernels customizados em XProf. [ref: google-adds-cycle-level-kernel-profiling-to-xprof] NVIDIA abriu programação GPU nativa em Rust com cuda-oxide e cutile-rs. [ref: nvidia-announces-native-gpu-programming-in-rust-with-two-kernel-writing-tracks] E a indústria está migrando para GaN porque silício não aguenta mais 5 kW por GPU dentro de dois anos.

Ada

Aqui está o problema: você pode otimizar o modelo, mas se o kernel está esperando memória, o modelo não importa. Google demonstrou um corte de 30% em tempo de kernel em matmul apenas expondo onde a computação estava travando — em um kernel de demonstração. [ref: google-adds-cycle-level-kernel-profiling-to-xprof]

Alan

Então a visibilidade é o primeiro passo. Mas NVIDIA está abrindo a porta para que times escrevam kernels em Rust em vez de C++. cutile-rs já está estável; cuda-oxide ainda é alpha em nightly.

Ada

E isso importa porque a segurança em tempo de compilação muda o custo de iterar. Você não está debugando race conditions em produção; o compilador rejeita elas antes de você compilar.

Alan

Mas nenhuma dessas otimizações resolve o problema de potência. GPUs vão dissipar até 5 kW dentro de dois anos. Silício chegou ao teto.

Ada

GaN está entrando em todos os estágios de conversão de potência dentro dos servidores. [ref: ai-power-demands-push-gan-into-data-center-design] Três megahertz de frequência de chaveamento — três vezes o que silício consegue. E o roadmap aponta para dez megahertz.

Alan

Então a infraestrutura está se reorganizando em torno de uma restrição física. Não é mais sobre qual modelo é melhor; é sobre qual harness consegue entregar potência sem perder eficiência.

Alan

Cloudflare recuperou 100TB em RAM com duas otimizações. [ref: cloudflare-saved-100tb-of-ram-through-algorithmic-optimization-in-rust] Primeiro, análise matemática: os últimos 100 mil hashes de um total de 100 mil por servidor estavam reduzindo o coeficiente de variação em apenas 0,7%. Desperdício em escala.

Ada

Segundo, struct packing em Rust. Reduzir um índice de 32 bits para 17 bits — porque você nunca vai coordenar mais de 65 servidores — compactou a memória em mais 25%. [ref: cloudflare-saved-100tb-of-ram-through-algorithmic-optimization-in-rust]

Alan

Isso é o que acontece quando você mede. Você descobre que a maioria das suas otimizações não puxam seu peso.

Alan

Um heap overflow em libheif, combinado com SSO misconfiguration, comprometeu OpenAI em 72 horas. [ref: heap-overflow-and-sso-misconfiguration-compromised-openai-internal-repos] Uma imagem HEIC foi enviada para o Discourse da OpenAI, acionou a vulnerabilidade no decodificador HEIC, e os pesquisadores tiveram acesso a repositórios internos.

Ada

Mas aqui está o que importa: a Hacktron team usou Claude Opus 4.8 para desenvolver um exploit funcional em 24 de julho. Quando Anthropic lançou Claude Opus 5.5 naquela noite, uma nova sessão produziu um exploit ARM65 em três horas. [ref: heap-overflow-and-sso-misconfiguration-compromised-openai-internal-repos]

Alan

Então a vulnerabilidade não era nova. O que era novo era a velocidade de operacionalização.

Ada

Toda a timeline — descoberta até acesso ao repositório — levou menos de 72 horas. [ref: heap-overflow-and-sso-misconfiguration-compromised-openai-internal-repos] A campanha mais ampla de HEIF Heist, que testou a mesma vulnerabilidade em múltiplas plataformas, custou menos de 3 mil dólares em tokens ao longo de dois meses e foi conduzida por três pesquisadores.

Alan

Linear cortou o tempo de espera de pull request de mais de 6 minutos para pouco mais de 5 minutos, apesar do test suite quase quadruplicar. [ref: linear-halved-ci-runner-time-despite-test-suite-quadrupling] Porque agentes aceleraram o código mais rápido que a validação conseguia acompanhar.

Ada

Eles não otimizaram um componente. Eles otimizaram o sistema inteiro — infraestrutura, dependências de jobs, overhead de setup. [ref: linear-halved-ci-runner-time-despite-test-suite-quadrupling] E ao mesmo tempo, cortaram o tempo de runner por teste pela metade.

Alan

E o resultado foi que o gargalo se moveu. Não é mais geração de código. É validação.

Ada

Vitest distribuía trabalho por arquivo, não por duração de teste. Alguns arquivos dominavam um shard e seguravam toda a suite. Eles dividiram os arquivos e moveram de quatro para oito shards. [ref: linear-halved-ci-runner-time-despite-test-suite-quadrupling]

Alan

Mas o ganho real veio de deixar alguns testes compartilharem um registry de módulo em vez de reconstruir o grafo inteiro a cada shard.

Ada

Essa otimização sozinha valeu aproximadamente 17% em economia mensal de tempo de runner de API. [ref: linear-halved-ci-runner-time-despite-test-suite-quadrupling]

Alan

Isso é otimização de sistema. Você não consegue isso olhando para um componente isolado.

Alan

A infraestrutura de IA é o novo gargalo da produção, e agora é mensurável — ciclos de hardware, watts de potência, minutos de validação. A Wire, segunda. Boa semana.