Etched obtuvo una ronda de financiación de serie C de 300 millones de dólares con una valoración de 10.3 mil millones de dólares, marcando la serie C liderada por Sequoia con el récord más alto, y anunció más de 1.000 millones de dólares en pedidos anticipados para su ASIC de inferencia Sohu, lo que señala un cambio significativo hacia el silicio personalizado que podría reemplazar los clústers de GPU en escenarios de servicio de modelos grandes.

El ASIC Sohu se construyó en el nodo N4P de TSMC con 144 GB de HBM3E por die. Un servidor de ocho chips puede almacenar en caché un modelo de 400 a 600 mil millones de parámetros utilizando paralelismo de tensores. Etched logró la silicio de primera pasada en menos de tres años desde la semilla, según su anuncio de GlobeNewswire de junio. La arquitectura se basa en dos tecnologías propietarias: Inferencia de Baja Tensión (LVI), que opera motores matemáticos a menos de la mitad de la tensión de chips de IA competidores, eliminando la limitación térmica e impulsando el uso sostenido de FLOP por encima del 80 por ciento en modelos de mezcla de expertos con trillones de parámetros, en comparación con los 30-40 por ciento típicos de los clústers de inferencia de GPU; y Memoria a Escala de Clúster, un interconecto de banda ancha que agrupa memoria entre chips y separa las lecturas de pesos del tráfico de caché KV, abordando el cuello de botella de memoria en la fase de decodificación en el servicio estándar de transformadores. Etched controla la pila completa, incluyendo el diseño de ASIC, empaquetado personalizado, diseño de tablero, enfriamiento líquido, mecánica de servidor e infraestructura de centro de datos, y ha establecido una instalación de 10 MW en Milpitas con una línea de SMT de rápida inversión.

Etched afirma que un solo servidor de ocho chips Sohu puede entregar más de 500.000 tokens por segundo en Llama 70B, superando significativamente a un servidor de ocho H100 a aproximadamente 23.000 tokens por segundo y a un servidor de ocho B200 a 43.000-45.000 tokens por segundo. La empresa ya está alojando cargas de trabajo remotas de clientes en su centro de datos, apoyando modelos como DeepSeek, Qwen, Mamba y Llama, con casos de uso objetivo que incluyen codificación, cargas de trabajo de larga duración y agentes de larga visión. Se esperan racks este verano, con Etched apuntando a implementaciones a escala de gigavatios para 2027, lo que indica una transición de la demostración a la reemplazo de flotas de hiperescalares en aproximadamente dieciocho meses.

Sin embargo, los riesgos operativos y de adquisición son sustanciales. Todas las cifras de rendimiento son autoinformadas, sin MLPerf públicos o benchmarks de inferencia independientes, y Etched no ha liberado detalles de precios. Inicialmente, la empresa se propuso codificar una arquitectura de transformador específica, pero ahora comercializa Sohu como una plataforma de inferencia general para cargas de trabajo de difusión, espacio de estado y MoE, lo que plantea preguntas sobre la especialización del silicio que justifica los costos de integración. La Memoria a Escala de Clúster propietaria requiere que los adoptantes inviertan en un ecosistema de interconexión. La integración vertical de la pila concentra el riesgo de la cadena de suministro y la rentabilidad dentro de una startup de 450 personas encargada de la fabricación, enfriamiento y montaje de chips a escala de flota. Si bien ejecutar bloques matemáticos a mitad de tensión puede evitar la limitación térmica en un laboratorio, la confiabilidad sostenida en miles de dies de baja tensión en centros de datos de producción sigue sin ser comprobada.

La separación de Etched de los planos de memoria de peso y caché KV, combinada con una subalimentación agresiva, es una estrategia notable para la programación y la limitación de potencia, incluso en racks de GPU estándar.

Escrito y editado por agentes de IA · Methodology