Alibaba Qwen3.8: modelo multimodal de 2.4T afirma "segundo solo después de Fable 5" — sin benchmarks publicados
El equipo Qwen de Alibaba previewó Qwen3.8-Max el 19 de julio en la Conferencia Mundial de IA de Shanghai, afirmando que clasifica segundo solo después del Fable 5 de Anthropic. El modelo lleva 2,4 billones de parámetros totales en un diseño disperso de Mixture-of-Experts (MoE) y es el primer modelo Qwen por encima de 1 billón de parámetros en ser multimédia, manejando texto, imágenes, video y documentos. Las acciones de Alibaba subieron hasta 5,4% en el anuncio. La afirmación llega tres días después de que el rival chino Moonshot lanzara Kimi K3, también 2,8 billones de parámetros, marcando una rápida serie de lanzamientos multitrillonarios de laboratorios chinos.
El problema: Alibaba publicó cero puntajes de benchmark, sin tarjeta de modelo y sin evaluación independiente para respaldar la clasificación "segundo solo después de Fable 5". El anuncio se mantiene como el posicionamiento de la propia empresa. Para contexto, Qwen3.7-Max, el flagship anterior, obtuvo 56.6 en el Índice de Inteligencia de Análisis de Inteligencia Artificial (5to lugar general, modelo chino más clasificado) y 60.6 en SWE-Bench Pro—aproximadamente 20 puntos por debajo del 80.4 de Fable 5 en la misma prueba. Qwen3.8 es accesible a través del Token Plan de Alibaba al 10% del precio estándar, con pesos abiertos "prometidos pronto".
Esto refleja un patrón reciente: Kimi K3 encabezó el leaderboard de codificación frontend de Arena.ai pero luego mostró tasas de alucinación de ~51% en tareas de recuperación de conocimiento, ilustrando la brecha entre benchmarks de anuncio y confiabilidad de producción. Ningún leaderboard independiente—no Open LLM de Hugging Face, Análisis de Inteligencia o Arena.ai—ha puntuado a Qwen3.8 aún. El timing subraya el impulso de China por afirmaciones visibles de paridad de frontera siguiendo anuncios de modelos estadounidenses y europeos (GPT-5.6 el 9 de julio, Bristol Myers en Vera Rubin, recaudación de €3B de Mistral).
Para arquitectos: trate esto como una señal de capacidad genúina *emparejada con* una bandera de precaución. El rendimiento anterior de Qwen3.7-Max hace que "segundo solo después de Fable 5" sea no absurdo, pero sin verificar hasta que lleguen evaluaciones de terceros. El lanzamiento de pesos abiertos será el punto de prueba. Hasta entonces, el recuento real de parámetros activos del modelo, el costo de inferencia y el perfil de sobrecarga de tokens siguen siendo desconocidos—críticos para la planificación de costo por tarea en producción.