AMD anunció el 6 de agosto de 2026 un acuerdo definitivo para adquirir Taalas, una startup de Toronto que integra los pesos del modelo de IA directamente en silicio. Los términos no fueron divulgados. El equipo de Taalas, cofundado por Ljubisa Bajic (ex-CEO de Tenstorrent y ejecutivo de AMD), se unirá al grupo de IA de AMD bajo Vamsi Boppana. La adquisición está sujeta a aprobación regulatoria.
El chip HC1 de Taalas fija el flujo de datos de un modelo y graba pesos en mask-ROM. Una SRAM separada maneja la caché KV y adaptadores de ajuste fino. En Llama 3.1-8B, entrega más de 16.000 tokens por segundo por usuario — múltiplos del hardware GPU actual. La compensación: HC1 ejecuta exactamente un modelo. Intercambiar modelos requiere cortar dos nuevas máscaras de metal mediante herramientas propietarias en aproximadamente dos meses. Bajic, COO Lejla Bajic y CTO Drago Ignjatovic construyeron HC1 con un equipo de 24 personas con $30 millones, luego recaudaron $169 millones en febrero de 2026. Financiamiento total: $219 millones.
El HC2, previsto para este verano, soporta 20 mil millones de parámetros por chip. Un modelo de un billón de parámetros se mapea a aproximadamente 50 aceleradores — dentro de la capacidad del rack Helios de AMD. La configuración equivalente de Nvidia combinaría docenas de GPUs con 2.000+ LPU Groq. DeepSeek-671B en HC1 requiere 30 tape-outs, mostrando por qué la tecnología se adapta a modelos estables desplegados sobre pesos fronterizos en rápida iteración.
La integración de AMD utiliza inferencia desagregada: las GPUs Instinct manejan prefill (procesamiento de prompt pesado en computación) y los aceleradores Taalas manejan decode (generación de tokens). En diciembre de 2025, Nvidia entró en un acuerdo de licencia no exclusiva de ~$20 mil millones para los activos de inferencia de Groq. El fundador de Groq, Jonathan Ross, se unió a Nvidia mientras la empresa continuaba bajo el nuevo CEO Simon Edwards. AMD anunció una solución similar con Cerebras el 23 de julio en Advancing AI 2026, donde las GPUs de AMD manejan prefill y el motor wafer-scale de Cerebras maneja decode. Taalas podría desplazar a Cerebras para modelos más pequeños estables.
Las aplicaciones secundarias incluyen edge e IA física: inferencia de un solo chip para modelos de hasta 8 mil millones de parámetros. Esto compite contra los aceleradores FPGA existentes de AMD y SoCs. Las implementaciones edge actualizan modelos con poca frecuencia. Intel ocupó este nicho edge estructurado en ASIC desde 2018 a través de eASIC, principalmente para infraestructura de red y defensa. AMD ahora tiene un camino comparable.
La adquisición extiende el patrón de AMD desde 2024. El rack Helios — enviándose ahora a Meta y Microsoft — provino de ZT Systems ($4.9 mil millones, 2024), Silo AI ($665 millones, 2024) e software de inferencia MK1 (2025). Taalas es el segundo equipo canadiense de chips de inferencia que AMD absorbió en aproximadamente 12 meses, siguiendo a Untether AI en 2025. AMD comprometió 2 gigawatts de GPUs Instinct MI450 a Anthropic y firmó un acuerdo de 6 gigawatts con OpenAI en octubre de 2025. A esta escala de infraestructura, el silicio decode cableado reduce mediblemente el costo por inferencia.
La tecnología Taalas funciona solo para modelos que han dejado de cambiar. Para equipos que ejecutan modelos de producción estables en alto volumen — asistentes de código, extracción de documentos, transcripción en tiempo real — el caso de desempeño por vatio es claro. Taalas afirma que grabar pesos en silicio es 100x menos costoso que entrenar un modelo fronterizo. Para equipos en ciclos de actualización trimestral, la ventana de re-spin de dos meses es viable con planificación. La adquisición tiene sentido como un componente de stack, no como un reemplazo de Instinct. El CEO de AMD dijo que las GPUs deberían constituir la mayoría del mercado de chips de IA.