aiexpert
Inicio / Noticias / Nota
Research · 15 ago 2026, 02:33 · 5 fuentes

Alibaba lanza Qwen3.8-27B bajo Apache 2.0; modelo denso compite con Opus 4.6 Max en tareas de agentes, se ejecuta en MacBook de 32GB

Alibaba lanzó Qwen3.8-27B el 14 de agosto bajo licencia Apache 2.0, un modelo de visión-lenguaje denso de 27 mil millones de parámetros junto con una variante de mezcla de expertos de 2,4 billones de parámetros. El modelo de 27B aporta desempeño de modelo cerrado a hardware local: según los benchmarks de Alibaba, iguala o supera a Opus 4.6 Max de Anthropic en múltiples tareas de codificación y agentes. En CoWorkBench (trabajo de oficina de largo horizonte), Qwen3.8-27B puntúa 70,7 vs. Opus 4.6 Max en 68,2. En LiveCodeBench v6 (codificación de agentes), puntúa 90,3 vs. Opus 4.6 Max en 88,8. El modelo logra esto con 27 mil millones de parámetros con arquitectura de atención híbrida que combina capas lineales rápidas y bloques de autoatención completos.

El modelo de 27B se ejecuta en hardware de consumo con cuantización modesta: una versión de 4 bits es aproximadamente 16,1 GB, cabe en un MacBook Pro de 32 GB o Mac Studio. La versión sin cuantizar es 55,6 GB. Alibaba envió los pesos abiertos inmediatamente en HuggingFace con licencia Apache 2.0, lo que significa que el uso comercial, redistribución e integración de productos no requieren términos de licencia adicionales. El modelo admite nativamente 262K tokens de contexto, extensibles a 1M mediante YaRN. Las cuantizaciones comunitarias para llama.cpp, Ollama y LM Studio estaban disponibles en el primer día, con versiones de 4 bits reportadas para ejecutarse en GPU de consumo con tan solo 17 GB de VRAM.

Para arquitectos que deciden dónde ejecutar cargas de trabajo de agentes, esto invierte una compensación clave: Qwen3.8-27B prueba que el desempeño de tareas de agentes (que incluye uso de computadora, ejecución de tareas de largo horizonte y razonamiento de múltiples pasos) ya no es una ventaja de modelo cerrado. Los equipos ahora pueden evaluar si implementar una copia única del modelo localmente en hardware interno o delegar en API administradas. La licencia Apache 2.0 elimina fricción legal para insertar en productos o fine-tuning en datos propietarios. La brecha de velocidad (latencia de inferencia y throughput de tokens por segundo varían según el framework) y la economía de la ventana de contexto todavía favorecen las API administradas para escenarios de throughput muy alto, pero la brecha de 70,7 vs. 68,2 en trabajo de agentes sugiere que la implementación local ahora es competitiva para muchas cargas de trabajo de producción.

Fuentes

Todo lo que sostiene esta nota
  1. 01 Primary source thenewstack.io
  2. 02 thenewstack.io thenewstack.io
  3. 03 warp2search.net warp2search.net
  4. 04 officechai.com officechai.com
  5. 05 en.kocpc.com.tw en.kocpc.com.tw