
Por qué alguien abandona un modelo tan barato
Grok 4.6 no es un modelo débil. Obtiene 61 puntos en el Artificial Analysis Intelligence Index, a la par de GPT-5.6 Sol y un punto por detrás de Claude Fable 5, mientras cobra una quinta parte de la tarifa de salida de Sol. Sobre el papel, el motivo para cambiar apenas existe.
Después lo pones en producción y chocas con uno de cuatro muros.
El precipicio de 200k retarifica toda la solicitud. Este es el que sorprende a la gente. La página de precios de xAI lo dice claramente al pie de la tabla: los modelos con precios de contexto largo cobran las tarifas largas por todos los tokens de una solicitud una vez que el prompt cruza el umbral. Así, un prompt de 199k cuesta 0,40 $ de entrada, y uno de 201k cuesta 0,80 $, no 0,398 $ más un poco. La ventana de contexto anunciada de 500k es real, pero solo los primeros 200k tienen el precio que sugiere el marketing. La tabla de tarifas completa está en nuestro desglose de precios de Grok 4.6.

Hay siete medidores, no uno. La búsqueda web, la búsqueda en X y la ejecución de código cuestan 5 $ por cada 1.000 llamadas. La búsqueda en archivos adjuntos cuesta 10 $ por cada 1.000. La búsqueda en colecciones, la de recuperación, cuesta 2,50 $ por cada 1.000. Luego el almacenamiento de archivos a 0,025 $ por GiB al día, el almacenamiento de colecciones a 0,10 $, y las descargas a 0,20 $ por GiB. Un agente que busca en cada turno lleva una segunda factura junto a la de tokens, por encima de la línea por token que todo el mundo presupuesta.
El lote no cubre al buque insignia. El descuento del 20% por lotes de xAI se aplica a grok-4.3 y a las tres variantes grok-4.20. Grok 4.6, 4.5 y grok-build-0.1 no reciben nada. Para un backfill nocturno, el 4.3, dos generaciones más antiguo, en lote sale a la mitad de la tarifa del buque insignia.
No se puede comprar a través de tu nube. Azure AI Foundry llega como máximo a Grok-4.3, y Bedrock está en la misma generación. Si tu empresa contrata modelos a través de un marketplace en la nube, Grok 4.6 directamente no está en el menú, y ningún argumento de benchmark cambia eso. La panorámica más amplia está en nuestra guía de precios de xAI.
"Cambiamos a un sistema que funciona bien a mitad de coste. Pero a largo plazo simplemente construiremos el nuestro, lo cual es tan posible ahora con la IA."
Ese es un cliente de mercado medio que perdimos, y el instinto tiene razón más a menudo de lo que los proveedores admiten. La pregunta siempre es cuál es la limitación que realmente estás resolviendo. Si todavía estás en la generación anterior, empieza por alternativas a Grok 4.5.
Las 7 alternativas de un vistazo
Las tarifas de abajo son los precios de lista publicados por los propios proveedores por 1M de tokens, verificados el 13 de agosto de 2026. La columna que hace el trabajo importante es la cuarta.
| Modelo | Entrada | Salida | Penalización por prompt largo | Lectura de caché | Contexto | Lotes | Pesos abiertos | En AWS / Azure / GCP | Índice AA |
|---|---|---|---|---|---|---|---|---|---|
| Grok 4.6 (actual) | 2,00 $ | 6,00 $ | 2x todos los tokens ≥200k | 0,50 $ | 500k | No | No | No | 61 |
| Claude Opus 5 | 5,00 $ | 25,00 $ | Ninguna | 0,50 $ | 1M | 50% | No | Sí | 63 |
| Claude Fable 5 | 10,00 $ | 50,00 $ | Ninguna | 1,00 $ | 1M | 50% | No | Sí | 62 |
| Claude Sonnet 5 | 2,00 $ | 10,00 $ | Ninguna | 0,20 $ | 1M | 50% | No | Sí | - |
| GPT-5.6 Sol | 5,00 $ | 30,00 $ | 2x ≥200k | 0,50 $ | Nivel largo | Sí | No | Sí (Bedrock) | 61 |
| GPT-5.6 Terra | 2,00 $ | 12,00 $ | 2x ≥200k | 0,20 $ | Nivel largo | Sí | No | Sí (Bedrock) | - |
| GPT-5.6 Luna | 0,20 $ | 1,20 $ | 2x ≥200k | 0,02 $ | Nivel largo | Sí | No | Sí (Bedrock) | - |
| Gemini 3.6 Flash | 1,50 $ | 7,50 $ | Ninguna publicada | 0,15 $ | 1M | 50% | No | Sí (Vertex) | - |
| Kimi K3 | 3,00 $ | 15,00 $ | Ninguna | 0,30 $ | 1M | No | Sí | No | 57 |
| Qwen3.8 Max | 2,00 $ | 6,00 $ | Ninguna | 0,25 $ | 1M | No | Todavía no | No | No listado |
| DeepSeek V4 Flash | 0,14 $ | 0,28 $ | Ninguna | 0,0028 $ | 1M | No | Sí (MIT) | No | 50 a máximo esfuerzo |
Dos filas merecen una pausa. Qwen3.8 Max cobra exactamente lo mismo que Grok 4.6, 2 $ y 6 $, sin precipicio y con el doble de ventana, lo que lo convierte en lo más parecido a un reemplazo directo solo por precio. Y Claude Sonnet 5 iguala la tarifa de entrada de Grok mientras cobra 10 $ de salida en lugar de 6 $, comprando una ventana plana de 1M por la diferencia.
Cómo elegí estos modelos
Todos los modelos aquí debían estar disponibles hoy con carácter general, tener precio público por token, y ser accesibles con una clave de API normal. Eso descarta modelos en preview restringido y cualquiera que sea solo bajo cotización. Después leí la propia página de precios de cada proveedor en lugar de un sitio comparativo, porque las reglas de contexto largo y medidores de herramientas son exactamente los detalles que se pierden en un resumen de terceros.
No los he clasificado por benchmark. Cinco puntos de índice no van a decidir tu arquitectura. La forma de la factura y la vía de contratación sí lo harán.
1. Claude Opus 5 - el mejor si los prompts largos son el problema

Qué es. El buque insignia de Anthropic, lanzado el 24 de julio de 2026, y actualmente primero en el Artificial Analysis Intelligence Index con 63.
Dónde supera a Grok 4.6. En el comportamiento de contexto largo, sin ambigüedad. La documentación de precios de Anthropic indica que Claude 4.6 y posteriores incluyen la ventana completa de 1M al precio estándar, y detalla la consecuencia: una solicitud de 900k tokens se cobra a la misma tarifa por token que una de 9k. Los descuentos de caché y lotes también se aplican en toda esa ventana. También funciona en Bedrock y Vertex, lo que resuelve la barrera de contratación de un solo golpe.
Dónde no. El precio de lista es 2,5 veces la entrada de Grok y aproximadamente 4 veces su salida, y la brecha real es mayor. Pruebas de la comunidad situaron a Opus 5 en aproximadamente el doble de tokens de salida que Opus 4.8 con el mismo esfuerzo, y el coste independiente por tarea en el índice AA salió a 2,03 $ frente a los 0,84 $ de Grok 4.6. También ejecuta muchos más turnos: 103 por tarea frente a los 55 de Opus 4.8.
Precios. 5,00 $ de entrada, 0,50 $ de lectura de caché, 25,00 $ de salida. El lote lo reduce a la mitad. El modo rápido lo duplica. Nuestra página de precios de Claude Opus 5 tiene el detalle completo, y Opus 5 frente a Sonnet 5 cubre el hermano más económico.
Veredicto. El cambio correcto cuando tus prompts realmente son largos, cuando necesitas los marketplaces de la nube, o cuando que una tarea falle es más caro que una tarea que cuesta más. Lee la reseña de Claude Opus 5 antes de asumir que el liderato en el índice se traduce a tu carga de trabajo.
2. Claude Fable 5 - el mejor si quieres la cima de la tabla de evaluación
Qué es. El modelo más caro de Anthropic, y el que realmente supera a Grok 4.6 en la mayoría de la propia tabla comparativa publicada por xAI.
Dónde supera a Grok 4.6. En la tabla de lanzamiento de xAI, Fable 5 se lleva CursorBench, FrontierCode, APEX-Agents, APEX-SWE y el Índice AA sin discusión. Eso son cinco de diez filas que van al competidor en el propio marketing del titular. Lleva la misma ventana plana de 1M que el resto de la línea Claude.
Dónde no. 10 $ de entrada y 50 $ de salida son más de ocho veces la tarifa de salida de Grok. En AA-Briefcase y GDPVal-AA, Grok 4.6 realmente gana, así que no es una barrida limpia en ninguna dirección.
Precios. 10,00 $ de entrada, 1,00 $ de lectura de caché, 50,00 $ de salida, 50% de descuento por lotes. Anthropic también lista un Claude Mythos 5 a la misma tarifa con disponibilidad limitada.
Veredicto. Recurre a él cuando una respuesta equivocada sale cara y el volumen es bajo. Con volumen alto la aritmética se vuelve brutal rápido, algo que la comparativa Opus 5 frente a Fable 5 cubre en detalle.
3. GPT-5.6 - el mejor si quieres tres puntos de precio de un proveedor

Qué es. Una familia, tres niveles. Sol arriba, Terra en el medio, Luna abajo, todos detrás de la misma superficie de API.
Dónde supera a Grok 4.6. Sol gana las dos evaluaciones en las que Grok peor sale parado: DeepSWE 73% frente a 65,9%, y Terminal-Bench 34,6% frente a 26%. Si tu carga de trabajo es ingeniería de software autónoma, ese es el cambio. La escalonada también significa que puedes enrutar los turnos baratos a GPT-5.6 Terra o Luna sin cambiar de SDK.
Dónde no. Lleva el mismo precipicio. La página de precios de OpenAI publica una columna de contexto largo para los tres niveles, así que Sol pasa de 5 $ a 10 $ de entrada y de 30 $ a 45 $ de salida en prompts largos. Cambiar de Grok a GPT-5.6 para escapar del umbral de 200k mueve el problema en lugar de resolverlo. Los endpoints de residencia de datos añaden un recargo del 10% para modelos lanzados a partir del 5 de marzo de 2026, y el procesamiento prioritario se renombró como modo Fast el 30 de julio de 2026.
Precios. Sol 5,00 $/30,00 $, Terra 2,00 $/12,00 $, Luna 0,20 $/1,20 $, todo por 1M. Consulta nuestro desglose de precios de GPT-5.6 para el resto de la familia.
Veredicto. El mejor cambio equivalente entre modelos de frontera si el código es el trabajo. Comprueba los precios de GPT-5.6 Sol frente a la distribución de longitud de tus propios prompts antes de comprometerte, porque el precipicio está en el mismo sitio. La reseña de GPT-5.6 tiene el detalle de las evaluaciones, y OpenAI frente a Anthropic compara las dos superficies de API.
4. Gemini 3.6 Flash - la mejor relación coste-capacidad si puedes vivir con Google

Qué es. El caballo de batalla de Google desde el 21 de julio de 2026, orientado a la velocidad con calidad cercana a la frontera.
Dónde supera a Grok 4.6. Entrada más barata a 1,50 $, una ventana de 1M sin nivel de contexto largo publicado, un nivel gratuito real para prototipar, y una fecha de corte de conocimiento de marzo de 2026. También ofrece uso de ordenador de forma nativa y gana las filas de contexto largo y uso de ordenador en la propia tabla comparativa de Google.
Dónde no. La salida cuesta 7,50 $ frente a los 6,00 $ de Grok, así que en trabajo intensivo en salida es más caro, no más barato. El grounding de búsqueda cuesta 14 $ por cada 1.000 solicitudes, casi el triple del medidor de búsqueda de xAI, aunque Google incluye 5.000 gratis al mes compartidas entre los modelos Gemini 3.x. En el nivel gratuito tu contenido se usa para mejorar los productos de Google; en el de pago no.
Precios. 1,50 $ de entrada, 0,15 $ de lectura de caché, 7,50 $ de salida. El lote cuesta la mitad. Detalle completo en precios de Gemini 3.6 Flash.
Veredicto. La opción de mejor valor si tus prompts son largos y tus salidas cortas, lo que describe la mayor parte del trabajo de soporte intensivo en recuperación. La reseña de Gemini 3.6 Flash tiene el detalle de los benchmarks, y el resumen de Gemini 3.6 Flash cubre lo que se lanzó junto a él.
5. DeepSeek V4 Flash - el mejor si la tarifa en sí es el problema

Qué es. Un modelo de mezcla de expertos con 284 mil millones de parámetros totales, 13 mil millones activos, con pesos abiertos con licencia MIT, en beta pública desde el 31 de julio de 2026.
Dónde supera a Grok 4.6. En precio, por un orden de magnitud, a 0,14 $ de entrada y 0,28 $ de salida. Los aciertos de caché son 0,0028 $. También ofrece un endpoint en formato Anthropic junto al formato OpenAI, lo que acorta bastante una migración, y los pesos MIT significan que puedes trasladarlo todo internamente si la relación con el proveedor sale mal.
Dónde no. La configuración barata y la buena son ejecuciones distintas. La propia tabla cruzada de modos de DeepSeek muestra HLE en 8,1 sin pensamiento frente a 34,8 a máximo esfuerzo, y los tokens de razonamiento se cobran a la tarifa de salida. Artificial Analysis midió una tasa de alucinación de AA-Omniscience del 84% y necesitó 210M de tokens de salida para ejecutar el índice frente a una mediana de 100M en su clase. Nuestra guía sobre cómo prevenir alucinaciones cubre qué significa eso de cara al cliente. También hay un recargo pendiente del 2x en horas punta, anunciado sin fecha de inicio.
Con datos de clientes, hay que ser preciso. Los términos de la API de pago de DeepSeek guardan silencio sobre el uso para entrenamiento en lugar de permitirlo, no hay DPA publicado ni opción de retención cero, y los datos están bajo jurisdicción de la RPC. Esa es una pregunta de contratación real, no zanjada.
Precios. 0,14 $ entrada sin acierto de caché, 0,0028 $ entrada con acierto de caché, 0,28 $ salida. Consulta precios de DeepSeek V4 Flash.
Veredicto. La elección obvia para clasificación, enrutamiento, resumen y otros turnos de alto volumen y bajo riesgo. La reseña de DeepSeek V4 Flash cubre dónde se nota realmente la brecha de calidad.
6. Kimi K3 - el mejor modelo de pesos abiertos a escala de frontera

Qué es. El buque insignia de Moonshot AI: 2,8 billones de parámetros totales, 104 mil millones activos, 1M de contexto, visión nativa, lanzado el 16 de julio de 2026.
Dónde supera a Grok 4.6. Pesos abiertos realmente lanzados, en la fecha prometida, y el índice safetensors confirma la cifra de 2,8 billones desde fuera del comunicado de prensa. Ofrece entrada nativa de imagen y vídeo, y una ventana plana de 1M.
Dónde no. 3 $ de entrada y 15 $ de salida están por encima de Grok en ambos lados, así que esto no es una jugada de coste. El razonamiento no se puede desactivar en ningún nivel de esfuerzo, y los niveles se cobran a la misma tarifa, así que reasoning_effort es un control de latencia más que de coste. Con esfuerzo bajo obtiene 47 puntos en el índice a 0,24 $ por tarea, lo que es a la vez más débil y más caro que DeepSeek V4 Flash. No se aceptan URLs públicas de imagen, solo base64 o un ID de archivo.
Precios. 3,00 $ entrada, 0,30 $ acierto de caché, 15,00 $ salida. Los niveles para consumidores van de gratis a 199 $. Consulta precios de Kimi K3.
Veredicto. Elígelo cuando quieras pesos abiertos a escala de frontera y visión en un solo modelo, y puedas asumir la tarifa. La reseña de Kimi K3 tiene la comparación de benchmarks frente a Grok, y Flash frente a K3 resuelve la cuestión de presupuesto entre las dos opciones de pesos abiertos.
7. Qwen3.8 Max - lo más parecido a un reemplazo directo

Qué es. El buque insignia de Alibaba, disponible con carácter general desde el 2 de agosto de 2026: 2,4 billones de parámetros totales, 95 mil millones activos, 1M de contexto.
Dónde supera a Grok 4.6. Precio de referencia idéntico a 2 $ de entrada y 6 $ de salida, con el doble de ventana de contexto y sin penalización por prompt largo. En LMArena es fuerte: Texto #5, Visión #2, WebDev #4. Ofrece razonamiento xhigh activado por defecto, con el pensamiento preservado.
Dónde no. No está en absoluto en el ranking de Artificial Analysis, así que cualquier "puntuación de inteligencia independiente" que veas citada para él describe en realidad otro modelo Qwen. Los compuestos automatizados y la preferencia humana apuntan en direcciones opuestas aquí, así que un veredicto de un solo número sería deshonesto en cualquier dirección. Los pesos se prometieron en la disponibilidad general y siguen sin publicarse. No hay descuento por lotes ni vía de marketplace en la nube.
Precios. 2,00 $ entrada, 0,25 $ lectura de caché implícita, 6,00 $ salida, según Qwen Cloud. Detalle en precios de Qwen3.8 Max, y las vías prácticas en cómo acceder a Qwen3.8 Max.
Veredicto. El cambio a hacer si el precipicio de 200k es tu única queja y quieres mantener la misma línea de presupuesto. Compáralo directamente en Qwen3.8 Max frente a Kimi K3 antes de decidir.
Lo que realmente pagas, frente a lo que dice la tarifa
Hay una capa más que merece la pena conocer antes de migrar nada. OpenRouter publica el precio medio ponderado que realmente pagan sus clientes, junto al precio de lista, y para Grok 4.6 los dos no coinciden.

| Medida | Lista | Medido en OpenRouter |
|---|---|---|
| Entrada por 1M | 2,00 $ | 0,7748 $ |
| Salida por 1M | 6,00 $ | 6,249 $ |
| Proveedores | - | SpaceXAI y SpaceXAI (ZDR) |
| Rendimiento (P50) | - | 53 y 55 tok/s |
| Latencia (P50) | - | 1,23 s y 0,84 s |
| Disponibilidad | - | 99,96% y 100% |
La entrada queda 61% por debajo de la lista, porque el caché hace un trabajo enorme en el tráfico real. La salida queda ligeramente por encima de la lista, porque una parte de ese tráfico supera los 200k y paga 12 $. Ambos efectos son invisibles en la tarifa de lista, y ambos se han movido desde la última vez que lo comprobé hace unos días, cuando la entrada marcaba 0,7448 $.
La lección se generaliza más allá de Grok. Antes de migrar por precio, calcula tu propia tasa de aciertos de caché y tu propia distribución de longitud de prompts. Un modelo con una etiqueta peor y una mejor historia de caché puede ser más barato en la práctica, y un cambio hecho solo con precios de lista es una suposición disfrazada de análisis.
¿Importa siquiera el modelo para el soporte?
Menos de lo que sugiere la lista corta, algo incómodo de escribir en un artículo que acaba de dedicar 2.000 palabras a esa lista corta.
Grok 4.6 es uno de los dos mejores modelos en el benchmark de atención al cliente multi-turno, con 50,7%. Léelo tal cual: el mejor modelo disponible falla en la mitad de esas conversaciones. Cambiar a Opus 5 por dos puntos de índice no toca ese patrón de fallo, y tampoco lo hace ninguna arquitectura libre de escalado. La mitad que sale mal, sale mal en saber cuándo parar, cuándo pasar a un humano, qué macro disparar, y qué no prometer nunca. Nada de eso es una capacidad del modelo.
Digo esto como alguien que construye la capa por encima del modelo. Los clientes de eesel a veces se van a construir directamente sobre una API de frontera en bruto, y es la alternativa competitiva más común que vemos en equipos técnicos. A veces funciona. Lo que suele traerlos de vuelta no es la calidad del modelo, y rara vez es la calidad de la recuperación tampoco. Es el segundo mes.
Nadie quiere ser dueño de las reglas de triaje de tickets, la deriva de la voz de marca, los permisos en la base de conocimiento, un umbral de puntuación de confianza, y una rotación de guardia para un chatbot.
El comprador que mencioné al principio, el que consumió 200 interacciones en un día de prueba, no estaba haciendo una pregunta de modelo. Preguntaba cuánto cuestan 9.000 al mes y si las respuestas serían correctas. Ninguna tarifa de lista responde a ninguna de las dos mitades, por eso el coste por resolución es el número que merece la pena modelar.
¿Elegir entre Grok 4.6 y sus alternativas para una cola de soporte?

Aquí está la parte que una API en bruto no puede darte. Antes de que eesel responda a un solo ticket en vivo, reproduce tu agente sobre tus propios tickets pasados y muestra lo que habría dicho, con tus datos, incluyendo los huecos de tu base de conocimiento. Así que "qué modelo" deja de ser un argumento de benchmark y se convierte en una tasa de resolución medida en tu propia cola, antes de que un cliente viera una sola respuesta. Conecta un helpdesk, observa la simulación, y luego elige el modelo. Prueba eesel, gratis.
Veredicto
Quédate en Grok 4.6 si tus prompts se mantienen cómodamente por debajo de 200k, no estás bloqueado por la contratación en la nube, y tu tráfico cachea bien. Empatar con GPT-5.6 Sol en el índice a una quinta parte de su tarifa de salida es una posición sólida, y ningún modelo de esta lista lo domina estrictamente.
Cambia a Claude Opus 5 si los prompts largos, la contratación de Bedrock o Vertex, o la calidad líder en el índice es la limitación vinculante. Pagarás aproximadamente 2,4 veces más por tarea.
Cambia a Qwen3.8 Max si el precipicio es tu única queja. Los mismos 2 $ y 6 $, el doble de ventana, sin penalización, a costa de una puntuación de referencia independiente.
Cambia a DeepSeek V4 Flash para la mitad de tu tráfico de alto volumen y bajo riesgo, y enruta los turnos difíciles a otro sitio. A 0,14 $ y 0,28 $ puedes permitirte equivocarte en el enrutamiento.
Cambia a GPT-5.6 si la codificación autónoma es la carga de trabajo, sabiendo que el precipicio de contexto largo viene contigo.
Y decidas lo que decidas, mídelo con tus propios tickets antes de que llegue a un cliente. El mejor agente de IA para una cola rara vez es el que está en la cima del índice, y la capa del helpdesk mueve la tasa de resolución más que el cambio de modelo. Consulta IA para atención al cliente para el panorama completo.
Preguntas frecuentes
¿Cuáles son las mejores alternativas a Grok 4.6 ahora mismo?
¿Existe una alternativa más barata a Grok 4.6?
¿Por qué se duplican los precios de Grok 4.6 en prompts largos?
¿Qué alternativa a Grok 4.6 tiene la ventana de contexto más grande?
¿Puedo ejecutar Grok 4.6 en AWS o Azure?
¿Las alternativas a Grok 4.6 también cobran por búsqueda web?
¿Es mejor Grok 4.6 o Claude Opus 5 para atención al cliente?
¿Debería cambiar de Grok 4.6 en absoluto?

Article by
Alicia Kirana Utomo
Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.







