
Resumen
Grok 4.6 es real. Obtiene 61 puntos en el Artificial Analysis Intelligence Index, empatando con GPT-5.6 Sol y quedando dos puntos por detrás de Claude Opus 5, mientras cobra $2/$6 por millón de tokens frente a los $5/$30 de Sol. En relación precio-inteligencia es la mejor oferta de la frontera ahora mismo, y no creo que sea ni de lejos disputable.
Pero la propia tabla de evaluación de xAI tiene diez filas, y el marketing solo lee las que gana. Grok 4.6 pierde en DeepSWE por 7,1 puntos y en Terminal-Bench v3.0 por 8,6 puntos, ambas frente a GPT-5.6 Sol. Donde realmente gana es en trabajo de conocimiento: el mejor de la tabla en GDPVal-AA, AA-Briefcase y la evaluación legal Harvey. Este es un modelo de trabajo de conocimiento que se anunció como un modelo de código.
La fila que nadie imprimió es la que más me importa. Artificial Analysis midió su tasa de no alucinación en 65,7%. Construyo agentes de IA en eesel, y he visto lo que hace ese tercio cuando llega a un cliente real. Una base de conocimiento que dice "damos soporte a todos los modelos" se convierte en una IA que le dice con total confianza a un conductor que damos soporte a su coche. Mejores benchmarks no arreglan eso. Un límite de recuperación y una puerta de confianza sí.
Elige tu carga de trabajo y luego lee el veredicto
Lo más útil que puedo darte no es otra tabla de benchmarks. Es la respuesta a "¿esto me aplica a mí?". El veredicto de Grok 4.6 cambia por completo según lo que estés construyendo.
Lo que realmente cambió desde Grok 4.5
xAI lanzó Grok 4.6 el 12 de agosto de 2026, unas cinco semanas después de Grok 4.5. Cinco semanas es un ritmo rápido, y se nota en lo que cambió y lo que no.
La historia del entrenamiento es inusualmente sincera. xAI dice que ejecutó una fase de entrenamiento suplementario más larga que la de 4.5, y luego usó el propio Grok 4.5 para regenerar las trayectorias de SFT a través de niveles de razonamiento y entornos de agentes, filtrando trazas malas con comprobaciones basadas en modelos. En otras palabras, el modelo anterior enseñó a este, y la etapa de RL se dirigió a tareas agénticas: optimización de kernels, desarrollo web, diseño asistido por ordenador.
La ficha técnica apenas se movió. Según la página del modelo grok-4.6, el contexto se mantiene en 500.000 tokens, el modelo acepta texto e imagen como entrada y produce texto, con llamadas a funciones, salidas estructuradas y razonamiento. Los límites de tasa son 150 solicitudes por segundo y 50M de tokens por minuto, en us-east-1 y us-west-2.
Lo que sí se movió fueron las puntuaciones. Artificial Analysis lo sitúa en 61 puntos en el Intelligence Index, 5 puntos más que Grok 4.5 y 23 más que Grok 4.3. Cinco puntos en cinco semanas es un salto generacional real, no un simple cambio de número de versión.
Leer bien la tabla de evaluación

A continuación está la propia tabla de xAI. La encuentro más reveladora que el post del blog que la envuelve. El negrita es el ganador de cada fila.
| Evaluación | Grok 4.6 High | Grok 4.5 High | GPT-5.6 Sol Max | Fable 5 Max |
|---|---|---|---|---|
| AA Intelligence Index | 61 | 56 | 61 | 62 |
| GDPVal-AA v2 | 1753 | 1526 | 1728 | 1741 |
| CursorBench v3.2 | 69,9% | 66,7% | 67,2% | 70,5% |
| DeepSWE v1.1 | 65,9% | 54% | 73% | 70% |
| FrontierCode v1.1 (Extended) | 61,3% | 56,6% | 60,6% | 63,6% |
| APEX-Agents | 57,5% | 47,1% | 56,7% | 59,2% |
| Terminal-Bench v3.0 | 26% | 15,7% | 34,6% | 34,1% |
| APEX-SWE | 56,4% | 53,6% | — | 58,8% |
| AA-Briefcase | 1577 | 1313 | 1502 | 1574 |
| Harvey LAB (Vals) | 15,8% | 12,9% | 2,5% | 11,3% |
Cuatro cosas destacan.
Grok 4.6 gana en las filas de trabajo de conocimiento y pierde en las de ingeniería de software. Se lleva GDPVal-AA, AA-Briefcase y Harvey LAB de forma directa. Pierde en DeepSWE por 7,1 puntos y en Terminal-Bench por 8,6. Para un post de lanzamiento titulado en torno a la codificación agéntica, es una forma curiosa.
El número de Harvey es la celda más extraña de la tabla. Grok 4.6 obtiene 15,8% en el benchmark de análisis legal frente al 2,5% de GPT-5.6 Sol. Una brecha de 6 veces en un solo eval suele significar que el eval mide algo muy específico, o que un modelo se ajustó para ese tipo concreto de tarea. Yo no construiría un producto legal sobre una sola fila, pero vale la pena saberlo.
Terminal-Bench tiene dos números de versión activos y no coinciden en absoluto. La ficha de xAI reporta 26% en v3.0. Artificial Analysis reporta 88,4% en v2.1 y lo llama en línea con los modelos líderes. Ambos son ciertos. v3.0 es la revisión más difícil. Si ves una cifra de Terminal-Bench citada sin versión, no te está diciendo nada.
Los saltos de 4.5 a 4.6 son mayores justo donde viven los agentes. DeepSWE pasó de 54% a 65,9%. APEX-Agents de 47,1% a 57,5%. AA-Briefcase de 1313 a 1577. Sea lo que sea que hizo la etapa de RL agéntica, funcionó en las tareas que se ejecutan durante muchos pasos.
Una fila más de la tabla que no está en el gráfico de xAI. Artificial Analysis mide 𝜏³-Banking, un eval de atención al cliente multiturno con uso de herramientas, y Grok 4.6 obtiene 50,7%. Eso lo coloca entre los dos primeros junto a Qwen3.8 Max con 51,3%. Volveré a esa cifra, porque estar entre los dos primeros resulta significar menos de lo que parece.
Velocidad y coste, medidos en lugar de proclamados
Aquí es donde Grok 4.6 hace su argumento más fuerte, y en realidad no es un argumento de benchmark.
El precio de lista no cambia respecto a Grok 4.5: $2,00 por 1M de entrada, $0,50 en caché, $6,00 de salida, según la página de precios de xAI. Al superar los 200k tokens de prompt, todas las tarifas se duplican a $4,00 / $1,00 / $12,00. Mantener el precio estable a lo largo de una generación es inusual en la frontera, y Artificial Analysis lo dice explícitamente.
La comparación que importa es con modelos a dos puntos del índice. Claude Opus 5 cuesta $5/$25. GPT-5.6 Sol cuesta $5/$30. Grok 4.6 empata con Sol a una quinta parte de la tarifa de salida, y la tarifa de salida domina el coste en trabajo con mucho razonamiento.
Medido en lugar de listado, en la página de Grok 4.6 de OpenRouter, el panorama se mantiene:
| Medida | xAI estándar | xAI (ZDR) |
|---|---|---|
| Entrada efectiva pagada | $0,7249/M | $0,7812/M |
| Salida efectiva pagada | $6,125/M | $6,116/M |
| Tasa de aciertos de caché | 90,3% | 88,0% |
| Rendimiento (media 3 días) | 94 tok/s | 92 tok/s |
| Latencia (media 3 días) | 0,62s | 0,96s |
| Tasa de error en llamadas a herramientas | 0,08% | 0,02% |
| Tasa de error en salidas estructuradas | 4,00% | 0,00% |
Dos de esas merecen una segunda mirada. El precio efectivo de entrada es $0,72, no $2, porque el tráfico real acierta en caché el 90% de las veces. Y la tasa de error de salidas estructuradas del 4,00% en el endpoint estándar frente al 0,00% en el endpoint ZDR es una diferencia operativa real, no un artefacto de redondeo. Si estás fijando esquemas JSON para llamadas a herramientas, prueba ambos.
Artificial Analysis situó la factura de todo el índice en $1.068,47 para evaluar Grok 4.6, lo que da $0,84 por tarea, lo mismo que Kimi K3 con una inteligencia ligeramente menor. Generó 72M de tokens haciéndolo, frente a una mediana de 71M, así que es un poco más verboso pero no de forma exagerada.
La única línea que se movió en contra de los compradores es la entrada en caché, y la comunidad lo detectó en cuestión de horas:
"Seems the cache read pricing almost doubled from $0.30 in Grok 4.5 to $0.50 in Grok 4.6. In my experience in heavy coding sessions most pricing is just cache read and cache write like 80% of my token bill."
Es una observación justa y la aritmética es correcta. Es un aumento del 67% en la partida que domina las sesiones largas de agentes. También sigue siendo una entrada en caché de $0,50 en un modelo que empata con GPT-5.6 Sol, así que yo lo llamaría un retroceso real dentro de un trato que sigue siendo excelente. Nuestra guía de precios de xAI tiene la escala completa.
Lo que dicen quienes realmente lo están probando
Los benchmarks son un dato de entrada. A continuación, cómo fue el primer día de uso real. Elegí informes con números en lugar de impresiones.
El dato más útil que encontré fue una comparación directa a través de la misma función en la misma base de código:
"Tested both DS v4 pro 0813 and Grok 4.6 (all from openrouter) on Codex cli. Worked on a same new feature development on my project. Deepseek 4 pro: Worked for 12m 02s, cost $0.12, has bug. Grok 4.6: Worked for 3m 18s, cost $1.41, no bug."
Eso es 3,6 veces más rápido y 11,75 veces más caro, con un resultado funcional frente a uno roto. Es una sola prueba de una persona, así que trátalo como una señal y no como un hallazgo, pero captura el trade-off real frente a un modelo barato de pesos abiertos como DeepSeek V4 Flash mejor que cualquier puntuación de índice.
El tema de la velocidad se repitió:
"I used to be a Claude user. Since trying Grok 4.5 and especially Grok 4.6, I don't want to go back to Claude any more (I have early access to 4.6). Grok is 3x+ faster than Claude and I can't tell the diff in engineering work quality. As an engineer, speed is important to me."
Y un ingeniero describió el cambio de flujo de trabajo con precisión, que es el tipo de detalle que me hace confiar en un informe:
"My go-to workflow was Sol for planning and Grok for building. But my in my first tests with Grok 4.6, I found it quite good and I'll start using it for both; assuming it's as good at is shows at benchmarks it's unbeatable at cost/time."
También hubo escepticismo, y en su mayoría giró en torno a si el índice mide lo correcto:
"I haven't tried so it's pure speculation based on benchmarks, but I'd assume Grok 4.6 is around Opus 4.8 in real world use, but clearly below Opus 5."
Es una suposición razonable. La paridad en el índice y la paridad en el uso real son afirmaciones distintas, y la respuesta honesta un día después del lanzamiento es que nadie tiene aún suficientes horas de uso. Lo que sí puedo decir es que el argumento del precio por unidad de inteligencia no depende de resolver ese debate.
La fila que el post de lanzamiento dejó fuera

La tabla de evaluación de xAI tiene diez filas y ninguna trata sobre equivocarse. Artificial Analysis mide precisamente eso, y esas son las cifras que yo pondría en lo más alto de la página si estuviera escribiendo el post de lanzamiento.
Precisión de AA-Omniscience: 48,2%. Tasa de no alucinación: 65,7%.
Lee la segunda con cuidado, porque es fácil malinterpretarla como "alucina el 34% de las veces". Es la tasa de evitar una alucinación entre las respuestas que no fueron correctas. Así que cuando Grok 4.6 no sabe algo, lo dice unas dos de cada tres veces, e inventa una respuesta la otra vez. El benchmark existe precisamente porque negarse a responder no debería penalizarse igual que estar confiadamente equivocado.
Para un agente de código, una respuesta equivocada la atrapa una prueba. Para un agente de cara al cliente, una respuesta equivocada se envía.
Construyo agentes de IA en eesel, y he visto este exacto patrón de fallo en producción más de una vez. Uno en el que pienso a menudo: un equipo europeo de telemática de vehículos que usa Zendesk, con unos 200 tickets al mes y creciendo hacia 2.000, descubrió que su agente confirmaba alegremente soporte para marcas de coche que no estaban en ninguna parte de su base de datos. La IA no había fallado. Su centro de ayuda decía "damos soporte a todos los modelos", y el modelo lo creyó. Su ingeniero resumió las primeras semanas como prueba y error, que es la descripción más honesta que he escuchado sobre desplegar un modelo en bruto.
Eso es una tasa de no alucinación del 65,7% encontrándose con una base de conocimiento escrita para humanos. Nada en el entrenamiento de Grok 4.6 lo arregla. Lo que lo arregla es acotar de dónde puede extraer información el modelo, y controlar qué se le permite enviar.
Entonces, ¿deberías poner Grok 4.6 detrás de una cola de soporte?
Pregunta justa. La respuesta honesta tiene dos partes, y apuntan en direcciones distintas.
Como motor, es una elección legítimamente buena. 50,7% en 𝜏³-Banking es top dos entre todo lo que ha probado Artificial Analysis, y 𝜏³-Banking es el benchmark público más cercano a lo que realmente hace un agente de soporte: multiturno, con uso de herramientas, de cara al cliente. Una tasa de error en llamadas a herramientas del 0,08% y 94 tok/s significan que no se atascará a mitad de conversación. A $2/$6, la economía unitaria de la automatización de tickets de soporte se ve bien.
Como producto, no lo es. Estar entre los dos primeros en atención al cliente significa que resuelve aproximadamente la mitad de esas conversaciones. La otra mitad es donde vive el trabajo real: saber cuándo parar, cuándo pasar a un humano, qué macro disparar, qué búsqueda de pedido ejecutar, y qué nunca prometer. Nada de eso es una capacidad del modelo. Es diseño de escalado, alcance de recuperación, y un umbral de puntuación de confianza que ajustaste con tu propio historial.
Digo esto como alguien cuyo equipo pierde negocios exactamente por este razonamiento. Varios clientes de eesel se han ido a construir directamente sobre una API de modelo de frontera, y es la alternativa competitiva más común que vemos de equipos técnicos. A veces funciona. Lo que normalmente los hace volver no es la calidad del modelo, es el segundo mes: nadie quiere hacerse cargo de las reglas de triaje de tickets, la deriva de la voz de marca, los permisos de la base de conocimiento, y una rotación de guardia para un chatbot.
Si estás eligiendo un modelo esta semana, Grok 4.6 pertenece a la lista corta junto a Claude Opus 5 y GPT-5.6. Si estás decidiendo cómo responder a los clientes, el modelo es la decisión menos interesante que tomarás.
¿Quieres un modelo de frontera en tu helpdesk sin el segundo mes?

Esta es la parte que una API en bruto no puede darte. Antes de que eesel responda un solo ticket en vivo, reproduce tu agente sobre tus propios tickets históricos y te muestra lo que habría dicho, con tus datos, con tu base de conocimiento y sus lagunas incluidas. Así, la pregunta del 65,7% deja de ser un benchmark y se convierte en un número que realmente mediste, en tu cola, antes de que un cliente lo viera jamás. Conecta un helpdesk, observa la simulación, y luego decide. Prueba eesel, gratis.
Veredicto
Cómpralo si estás ejecutando sesiones agénticas largas de trabajo de conocimiento, investigación, análisis o tareas cargadas de documentos, y el coste importa. Las mejores puntuaciones de la tabla en GDPVal-AA y AA-Briefcase a $2/$6, terminando tareas en la mitad de turnos que Claude Opus 5, es una combinación difícil de rebatir. Cómpralo también si la pura velocidad cambia tu flujo de trabajo. Varios ingenieros reportaron de forma independiente 3x, y uno midió 3m 18s frente a 12m 02s en la misma tarea.
Sáltalo si tu carga de trabajo es ingeniería de software autónoma u operaciones intensivas en terminal. DeepSWE 65,9% frente al 73% de Sol, y Terminal-Bench v3.0 en 26% frente a 34,6%, no son decisiones ajustadas, y son las propias cifras publicadas por xAI.
Ten cuidado si va a estar de cara al cliente. Es uno de los dos mejores modelos en el benchmark de atención al cliente, y aun así falla en la mitad de esas conversaciones, con una tasa de no alucinación del 65,7% por debajo. Eso no es un problema de Grok, todo modelo de frontera tiene su propia versión de esta fila. Es una razón por la que la capa de helpdesk importa más que la elección del modelo.
Mi valoración general: la mejor relación precio-inteligencia de la frontera a agosto de 2026, mal etiquetado como un lanzamiento de código cuando su verdadera fortaleza es el trabajo de conocimiento. Cinco puntos de ganancia en el índice en cinco semanas con precios estables es la historia, y el aumento en la tasa de caché es el asterisco.
Si quieres el conjunto de comparación más completo, empieza con alternativas a Grok 4.5 y lee después la reseña de Claude Opus 5.
Para la matemática de tokens por sí sola, la escala de precios de xAI profundiza más que esta reseña.
Preguntas frecuentes
¿Es bueno Grok 4.6? ¿A qué conclusión llega esta reseña de Grok 4.6?
¿Cómo se compara Grok 4.6 con Grok 4.5?
¿Cuánto cuesta ejecutar Grok 4.6?
¿Alucina Grok 4.6?
¿Es bueno Grok 4.6 para atención al cliente?
¿Dónde puedo usar Grok 4.6?
¿Cuál es la ventana de contexto de Grok 4.6?
¿Qué alternativas debería comparar con Grok 4.6?

Article by
Alicia Kirana Utomo
Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.







