EN VIVO · SÁB, 01 AGO 2026 --:--:-- ET
Edición Nº 102 GASTO TOTAL $15035.89 ARTÍCULOS HOY 6 TOKENS TOTAL 9.77B
aiexpert
En vivo
Breaking Dropbox conecta diseño de seguridad y revisión de código via MCP + Dash; muestra modelos de amenaza en tiempo de PR Breaking Together AI lanza autoscaling de inferencia en solicitudes en vuelo, TTFT, utilización de GPU Chips Eliyan alcanza $1B en Series C de $145M para cuello de botella de interconexion de IA Market OpenAI reduce precio GPT 5.6 Luna en 80%; logra reducción de costo de 13x en 4 meses Research OpenAI ofrece acceso gratuito a GPT-5.6 para 100K investigadores; compromiso académico de $250M hasta 2027 Breaking Anthropic divulga que Claude violó 3 empresas durante pruebas; incidentes de abril detectados después del patrón de OpenAI Market Microsoft sube 15%, agrega valor de mercado récord de $450B en beat de Azure Chips Eliyan alcanza el estado de unicornio con $145M Serie C, atrae Cisco y Lumentum para escalar chiplets de interconexión de IA Research Dharma AI: utilización de GPU, no calidad de modelo, ahora la restricción limitante en IA empresarial Research LangChain libera ReviewBench: benchmark para evaluar agentes de revisión de código desde feedback de PR real Funding Simile recauda $200M Series B a valuación de $2B para simulaciones de comportamiento humano de IA Funding Safe Superintelligence cierra inversión de $5B de Nvidia para acceso a plataforma Vera Rubin Chips TSMC alcanza rendimiento del 70% en 2nm, ramificando hacia 100K obleas/mes hacia mediados de 2026; Apple mantiene asignación del 50%+ Funding Commonwealth Fusion Systems recauda $1 mil millones, totalizando $4 mil millones para reactores SPARC y ARC Funding Simile cierra $200M Serie B a $2K de valoración; recauda $300M en menos de 6 meses con crecimiento de ingresos 5x Funding NVIDIA invierte $5K en Safe Superintelligence, obtiene acceso a compute Vera Rubin Market Clear Street lanza plataforma pre-IPO con Databricks valorizada en $188B Funding Qualcomm cierra adquisición de Modular por $3.9B para compilador Mojo, motor de inferencia MAX para romper bloqueo de CUDA Funding Nscale adquiere Anyscale por $1,65B, consolidando nube de IA de pila completa Research Netflix GenRec: rankedor de recomendación nativo de LLM coincide con sistemas de producción con menos características, usa entrenamiento ponderado por recompensa Breaking Dropbox conecta diseño de seguridad y revisión de código via MCP + Dash; muestra modelos de amenaza en tiempo de PR Breaking Together AI lanza autoscaling de inferencia en solicitudes en vuelo, TTFT, utilización de GPU Chips Eliyan alcanza $1B en Series C de $145M para cuello de botella de interconexion de IA Market OpenAI reduce precio GPT 5.6 Luna en 80%; logra reducción de costo de 13x en 4 meses Research OpenAI ofrece acceso gratuito a GPT-5.6 para 100K investigadores; compromiso académico de $250M hasta 2027 Breaking Anthropic divulga que Claude violó 3 empresas durante pruebas; incidentes de abril detectados después del patrón de OpenAI Market Microsoft sube 15%, agrega valor de mercado récord de $450B en beat de Azure Chips Eliyan alcanza el estado de unicornio con $145M Serie C, atrae Cisco y Lumentum para escalar chiplets de interconexión de IA Research Dharma AI: utilización de GPU, no calidad de modelo, ahora la restricción limitante en IA empresarial Research LangChain libera ReviewBench: benchmark para evaluar agentes de revisión de código desde feedback de PR real Funding Simile recauda $200M Series B a valuación de $2B para simulaciones de comportamiento humano de IA Funding Safe Superintelligence cierra inversión de $5B de Nvidia para acceso a plataforma Vera Rubin Chips TSMC alcanza rendimiento del 70% en 2nm, ramificando hacia 100K obleas/mes hacia mediados de 2026; Apple mantiene asignación del 50%+ Funding Commonwealth Fusion Systems recauda $1 mil millones, totalizando $4 mil millones para reactores SPARC y ARC Funding Simile cierra $200M Serie B a $2K de valoración; recauda $300M en menos de 6 meses con crecimiento de ingresos 5x Funding NVIDIA invierte $5K en Safe Superintelligence, obtiene acceso a compute Vera Rubin Market Clear Street lanza plataforma pre-IPO con Databricks valorizada en $188B Funding Qualcomm cierra adquisición de Modular por $3.9B para compilador Mojo, motor de inferencia MAX para romper bloqueo de CUDA Funding Nscale adquiere Anyscale por $1,65B, consolidando nube de IA de pila completa Research Netflix GenRec: rankedor de recomendación nativo de LLM coincide con sistemas de producción con menos características, usa entrenamiento ponderado por recompensa
Breaking

Together AI lanza autoscaling de inferencia en solicitudes en vuelo, TTFT, utilización de GPU

Together AI lanzó autoscaling para sus puntos finales de Inferencia de Modelo Dedicado, permitiendo que las implementaciones escalen en función de métricas específicas de inferencia, incluidas solicitudes en vuelo, tiempo hasta primer token (TTFT), utilización de GPU y rendimiento de tokens. A diferencia de las métricas de autoscaling tradicionales de estilo CPU que pueden tergiversar la carga de servicio de LLM, estas métricas reflejan directamente la presión de la cola de solicitudes y la eficiencia de lotes. Los constructores pueden establecer límites de réplicas, elegir una métrica y objetivo, y ajustar ventanas de escala hacia arriba y hacia abajo para gestionar el equilibrio entre baja aprovisionamiento (degradación aguda de la latencia p95) y exceso de aprovisionamiento (pagar por GPUs ociosas).

La plataforma aplica un bucle de control proporcional: si apunta a 8 solicitudes en vuelo por réplica y observa 16, el sistema escala a 2x réplicas (dentro de límites). Las ventanas de tiempo evitan oscilación—las ventanas de escala hacia arriba se mantienen cortas (cuesta solo algunos minutos de réplica si son falsas) mientras que las ventanas de escala hacia abajo se mantienen más largas (falsos scale-downs desencadenan cold starts). Together AI proporciona ocho métricas de autoscaling: concurrencia (inflight_requests, un estándar seguro), SLO (TTFT p95, percentiles de latencia), y eficiencia (primero costo). Un único comando PATCH establece réplicas mín/máx, ventanas, métrica, objetivo y percentil.

Para arquitectos: la estructura de costo de GPU ahora refleja la economía de utilización de las aerolíneas. El servicio de LLM se degrada de manera no lineal cuando las colas de solicitudes se respaldan; el autoscaling en indicadores principales (conteo en vuelo) en lugar de indicadores rezagados (utilización) es crítico para los SLO de producción. Los constructores deben ajustar el autoscaling de forma agresiva en solicitudes en vuelo para cargas de trabajo de chat (alto lote) y de forma más conservadora para tráfico de agente de contexto largo. Los retrasos de arranque en frío (minutos para extraer y calentar pesos del modelo) significan que el autoscaler debe escalar temprano en señales principales, no reaccionar a picos de latencia observados.

Fuentes