aiexpert
Inicio / Noticias / Nota
Research · 13 ago 2026, 08:32 · 1 fuente

SpaceXAI lanza Grok 4.6 con puntuación de Inteligencia AA de 61, precios de $2/$6; Grok 4.7 (2.1T) esperado en semanas

SpaceXAI lanzó Grok 4.6 el 12 de agosto de 2026, un modelo de 1,5 billones de parámetros construido para tareas agentivas de larga duración y trabajo visual/interactivo. El benchmark titular es que Grok 4.6 coincide con GPT-5.6 Sol Max en 61 en el Índice de Inteligencia de Análisis Artificial (un compuesto de 9 benchmarks). El modelo anota 1753 ELO en GDPVal-AA v2 (trabajo de conocimiento) y lidera en CursorBench 3.2 (69,9%) y FrontierCode. La fijación de precios es de $2 por millón de tokens de entrada, $6 por millón de tokens de salida—aproximadamente 60% más barato que Claude Opus 5 ($5/$25) o GPT-5.6 Sol ($5/$30).

Grok 4.6 se entrena para flujos de trabajo agentivos de múltiples pasos: investigación, análisis de base de código, CAD, desarrollo web, optimización de kernel. xAI aplicó un entrenamiento suplementario más largo que Grok 4.5, datos generados por modelos curados para razonamiento, y usó Grok 4.5 para regenerar trayectorias SFT en dominios (STEM, ingeniería de software, trabajo de conocimiento), filtrando trazas problemáticas con comprobaciones basadas en modelos. RL se aplicó en tareas agentivas que incluyen entornos específicos del dominio. xAI informa un comportamiento mejorado de autoverificación y verificación en trayectorias más largas, y primeros pases visuales/interactivos más fuertes.

La estrategia de lanzamiento se dirige a desarrolladores en Cursor (el editor de código nativo de IA) con crédito de uso 2x durante la primera semana. Grok 4.6 está vivo en Cursor, Grok Build y la API; disponible a través de OpenRouter, Vercel y Cloudflare. Elon Musk confirmó que Grok 4.7—un modelo de 2,1 billones de parámetros más grande—ya está en entrenamiento, se espera en semanas; xAI está señalando un ciclo de lanzamiento de 2-3 semanas.

Para constructores de agentes y arquitectos de plataforma: Grok 4.6 compite en costo y eficiencia de paso agentivo (aparentemente ~53 pasos vs ~103 para Claude Opus 5 en tareas de múltiples pasos), no rendimiento bruto. La base de 1,5T reutilizada de 4.5 mantiene la latencia y la sobrecarga de tokens bajas. La verificación independiente (LMSYS Chatbot Arena) está pendiente; trate la paridad del Índice de Inteligencia de AA como provisional. Observe si la estrategia de distribución de Cursor se traduce en cambios de adopción significativos, y si se mantiene el cronograma agresivo de Grok 4.7.

Fuentes

Todo lo que sostiene esta nota
  1. 01 Primary source x.ai