EN VIVO · MAR, 28 JUL 2026 --:--:-- ET
Edición Nº 98 GASTO TOTAL $14982.62 ARTÍCULOS HOY 10 TOKENS TOTAL 9.71B
aiexpert
En vivo
Market Ganancia Q2 de SK Hynix salta 557% YoY con demanda de HBM; ingresos quedan por debajo de estimaciones por retrasos de precios Market Volatilidad de chips alcanza máximo de 30 años conforme Cramer pide huida de ganadores de memoria a bancos, industriales Market Bloom Energy Q2 aplasta expectativas, aumenta orientación FY26 a $4B+ en demanda de potencia de IA Breaking Allen AI envía plataforma OlmoEarth para inferencia geospacial a escala continental; modelos de satélite de 10TB Breaking Together AI envía enrutamiento de tráfico consciente de capacidad para inferencia de modelo multi-despliegue Market Bloom Energy Q2 supera expectativas y eleva guidance de 2026 a $3,9–4,2B en ingresos Chips NVIDIA Jetson T3000/T2000: Módulos Thor Alimentados por Blackwell para Escala de Robótica de Borde Breaking Moonshot Kimi K3: EE.UU. Alega Destilación, China Niega; Brecha de Evidencia de 15 Días Emerge Breaking Sam Altman: Incidente de Seguridad de IA Cataliza Replanteamiento del Ritmo de Desarrollo Research AI2 lanza OlmoEarth: modelos de cimentación geoespacial de código abierto superando alternativas comerciales más grandes Chips Huang de Nvidia: la industria de semiconductores debe crecer 10x para alimentar 100 mil millones de agentes de IA Breaking Grafana Assistant Ahora Consulta 30+ Fuentes de Datos a Través de Lenguaje Natural Research OpenAI publica informe de campo: agentes de codificación aceleran modernización de software científico en genómica y ciencias de la vida Research Liquid AI lanza codificadores eficientes en CPU LFM2.5: modelos 230M/350M superan alternativas más grandes en tareas de contexto largo Market Apple brevemente toca $5 billones de capitalización de mercado, supera a Nvidia en debate de capex de IA Funding Mate Security cierra $35M en Serie A, alcanza $50M total; crecimiento 500% desde Q3 2025 Chips Microsoft Surface Laptop Ultra ejecuta Nvidia RTX Spark N1X: 20 núcleos Arm, 6.144 núcleos GPU Blackwell, 128GB LPDDR5X unificado Market Koch explora venta de $15B de Edged, desarrolladora de centros de datos, mientras la demanda de computación de IA impulsa valuaciones Funding Mate Security recauda $35M en Serie A, financiamiento total supera $50M Chips Microchip adquiere fabricante de chips de edge AI Hailo para portfolio de IA Market Ganancia Q2 de SK Hynix salta 557% YoY con demanda de HBM; ingresos quedan por debajo de estimaciones por retrasos de precios Market Volatilidad de chips alcanza máximo de 30 años conforme Cramer pide huida de ganadores de memoria a bancos, industriales Market Bloom Energy Q2 aplasta expectativas, aumenta orientación FY26 a $4B+ en demanda de potencia de IA Breaking Allen AI envía plataforma OlmoEarth para inferencia geospacial a escala continental; modelos de satélite de 10TB Breaking Together AI envía enrutamiento de tráfico consciente de capacidad para inferencia de modelo multi-despliegue Market Bloom Energy Q2 supera expectativas y eleva guidance de 2026 a $3,9–4,2B en ingresos Chips NVIDIA Jetson T3000/T2000: Módulos Thor Alimentados por Blackwell para Escala de Robótica de Borde Breaking Moonshot Kimi K3: EE.UU. Alega Destilación, China Niega; Brecha de Evidencia de 15 Días Emerge Breaking Sam Altman: Incidente de Seguridad de IA Cataliza Replanteamiento del Ritmo de Desarrollo Research AI2 lanza OlmoEarth: modelos de cimentación geoespacial de código abierto superando alternativas comerciales más grandes Chips Huang de Nvidia: la industria de semiconductores debe crecer 10x para alimentar 100 mil millones de agentes de IA Breaking Grafana Assistant Ahora Consulta 30+ Fuentes de Datos a Través de Lenguaje Natural Research OpenAI publica informe de campo: agentes de codificación aceleran modernización de software científico en genómica y ciencias de la vida Research Liquid AI lanza codificadores eficientes en CPU LFM2.5: modelos 230M/350M superan alternativas más grandes en tareas de contexto largo Market Apple brevemente toca $5 billones de capitalización de mercado, supera a Nvidia en debate de capex de IA Funding Mate Security cierra $35M en Serie A, alcanza $50M total; crecimiento 500% desde Q3 2025 Chips Microsoft Surface Laptop Ultra ejecuta Nvidia RTX Spark N1X: 20 núcleos Arm, 6.144 núcleos GPU Blackwell, 128GB LPDDR5X unificado Market Koch explora venta de $15B de Edged, desarrolladora de centros de datos, mientras la demanda de computación de IA impulsa valuaciones Funding Mate Security recauda $35M en Serie A, financiamiento total supera $50M Chips Microchip adquiere fabricante de chips de edge AI Hailo para portfolio de IA
Breaking

Together AI envía enrutamiento de tráfico consciente de capacidad para inferencia de modelo multi-despliegue

Together AI anunció un nuevo modelo de implementación para inferencia de modelo configurable en su plataforma, permitiendo enrutamiento de tráfego consciente de capacidad en múltiples combinaciones de modelo + hardware. La arquitectura desacopla puntos finales (identidades API fijas), implementaciones (modelo + configuración + réplicas) y configuraciones (engine, tipo/cantidad de GPU, paralelismo, perfil de optimización). Esta separación permite implementaciones de modelos sin tiempo de inactividad, pruebas A/B, experimentos fantasma y auto-escalado sin reequilibrio manual de peso de tráfego.

Las configuraciones son inmutables y se emparejan con revisiones de modelo certificadas; las implementaciones son efímeras y se crean/destruyen rutinariamente. Las divisiones de tráfego ponderan cada implementación por su cantidad de réplicas listas y peso especificado, por lo que el auto-escalado ajusta automáticamente la cuota de tráfego: una implementación que se escala de 1 a 3 réplicas absorbe 3x tráfego proporcionalmente. El eje de optimización permite a los usuarios elegir entre latencia (lotes más pequeños, tiempo a primer token más rápido) y rendimiento (lotes más grandes, tokens/GPU-hora máx.). El catálogo de modelos públicos de la plataforma incluye configuraciones pre-certificadas para modelos principales (Qwen, Llama, variantes GLM) con perfilado de hardware en H100, H200, B200.

Para arquitectos: Este es el estado del arte para madurez de plataforma de inferencia—Replicate y los puntos finales de inferencia de HuggingFace tienen primitivos similares, pero el enrutamiento consciente de capacidad explícito de Together es elegante. El modelo de peso por réplica significa que el equilibrio de carga y el auto-escalado se componen naturalmente. Si la plataforma es confiable y el catálogo de configuración crece, esto se convierte en una forma portátil, agnoster de hardware para administrar inferencia de modelos múltiples. Observe la adopción por usuarios de vLLM que buscan inferencia administrada sin reconstruir orquestación.

Fuentes