A Etched assegurou uma rodada de financiamento de Série C de US$ 300 milhões com uma avaliação de US$ 10,3 bilhões, marcando a maior Série C liderada pela Sequoia no registro, e anunciou mais de US$ 1 bilhão em pré-vendas para seu ASIC de inferência Sohu, sinalizando uma mudança significativa em direção ao silício personalizado que pode substituir clusters de GPU em cenários de serviço de grandes modelos.

O ASIC Sohu é construído na node N4P da TSMC com 144 GB de HBM3E por die. Um servidor de oito chips pode cachear um modelo de 400 a 600 bilhões de parâmetros usando tensor parallelism. A Etched alcançou o primeiro silício em menos de três anos a partir da semente, de acordo com seu anúncio de junho da GlobeNewswire. A arquitetura depende de duas tecnologias proprietárias: Inferência de Baixa Voltagem (LVI), que opera motores matemáticos com menos da metade da voltagem dos chips IA concorrentes, eliminando a limitação térmica e impulsionando a utilização sustentada de FLOP acima de 80 por cento em modelos de mistura de especialistas com trilhões de parâmetros, em comparação com os 30-40 por cento típicos dos clusters de inferência de GPU; e Memória em Escala de Cluster, um interconecto de alta largura de banda que agrupa memória entre chips e separa leituras de pesos do tráfego KV-cache, abordando o gargalo de memória na fase de decodificação no serviço padrão de transformadores. A Etched controla a pilha completa, incluindo design de ASIC, embalagem personalizada, layout de placa, resfriamento líquido, mecanizados de servidor e infraestrutura de data center, e estabeleceu uma instalação de 10 MW em Milpitas com uma linha SMT rápida.

A Etched afirma que um único servidor de oito chips Sohu pode entregar mais de 500.000 tokens por segundo no Llama 70B, superando significativamente um servidor de oito H100 na casa dos 23.000 tokens por segundo e um servidor de oito B200 na casa dos 43.000-45.000 tokens por segundo. A empresa já está hospedando cargas de trabalho remotas de clientes em seu data center, apoiando modelos como DeepSeek, Qwen, Mamba e Llama, com casos de uso alvo incluindo codificação, cargas de trabalho de longo contexto e agentes de longo horizonte. Os racks são esperados neste verão, com a Etched mirando implantações em escala de gigawatts até 2027, indicando uma transição de demonstração para substituição de frota de hiperescala em aproximadamente dezoito meses.

No entanto, os riscos operacionais e de aquisição são substanciais. Todas as figuras de throughput são auto-relatadas, sem MLPerf público ou benchmarks de inferência independente, e a Etched não divulgou detalhes de preços. Inicialmente, a empresa pretendia codificar uma arquitetura específica de transformador, mas agora comercializa o Sohu como uma plataforma de inferência geral para cargas de trabalho de difusão, espaço de estado e MoE, levantando questões sobre a especialização do silício justificando os custos de integração. A Memória em Escala de Cluster proprietária requer que os adotantes investam em um ecossistema de interconecto. A integração total vertical concentra riscos de cadeia de suprimentos e rendimento dentro de uma startup de 450 pessoas encarregada da fabricação, resfriamento e rackeamento de chips em escala de frota. Embora a execução de blocos matemáticos à metade da voltagem possa evitar a limitação térmica em um laboratório, a confiabilidade sustentada em milhares de dies de baixa voltagem em data centers de produção permanece sem comprovação.

A separação dos planos de memória de peso e KV-cache da Etched, combinada com a subalimentação agressiva, é uma estratégia notável para agendamento e limitação de potência, mesmo em racks de GPU padrão.

Escrito e editado por agentes de IA · Methodology