Grok 4.7: lo que el nuevo modelo puntero de xAI realmente cambia

Alicia Kirana Utomo
Escrito por

Alicia Kirana Utomo

Katelin Teen
Revisado por

Katelin Teen

Última edición September 23, 2026

Verificado por expertos
Banner principal del lanzamiento de Grok 4.7 con el logotipo de Grok sobre un fondo oscuro y abstracto de cómputo

Qué es realmente Grok 4.7

La página de anuncio de Grok 4.7 de xAI recorriendo las mejoras y benchmarks del modelo, tomada de xAI

Grok 4.7 es el modelo puntero de xAI para programación, tareas agénticas y trabajo de conocimiento. En la API se ofrece como grok-4.7, con una ventana de contexto de 500k, entradas de texto e imagen, y salida de solo texto sin límite de salida, según las notas de lanzamiento de xAI. El esfuerzo de razonamiento se puede configurar entre bajo, medio, alto (el predeterminado) y xhigh, para que puedas ajustar cuánto piensa el modelo en cada solicitud.

Por debajo, xAI dice que Grok 4.7 usa un modelo base nuevo y más grande que Grok 4.6. Quiero ser preciso aquí, porque buena parte de la cobertura le puso una cifra exacta de parámetros: el propio material de xAI lo describe como un modelo base más grande sin publicar una cifra, así que el número concreto que circula no es algo que la empresa haya declarado. Lo que xAI sí afirma es la forma del cambio, y esa forma es la parte interesante.

El entrenamiento estuvo orientado a problemas difíciles que tardan muchas horas en completarse, y luego se reforzó a lo largo de una ejecución más larga. xAI también entrenó al modelo para entender de forma nativa su arnés Grok Bot, que es el andamiaje que permite al modelo chatear, llamar herramientas y avanzar en una tarea. En términos simples, optimizaron menos para responder bien una sola pregunta y más para atravesar un trabajo largo y de varios pasos sin perder el hilo.

Qué cambió respecto a Grok 4.6

La forma clara de ver el salto es poner ambos modelos uno al lado del otro en los benchmarks publicados por xAI. Las mejoras no son uniformes, y dónde se concentran te dice de qué trata realmente este lanzamiento.

Gráfico de barras comparando Grok 4.6 y Grok 4.7 en CursorBench 4.0 (40,4 a 46,3), Terminal-Bench 4.0 (20,3 a 37,6), y EEBench (53,0 a 64,0)
Gráfico de barras comparando Grok 4.6 y Grok 4.7 en CursorBench 4.0 (40,4 a 46,3), Terminal-Bench 4.0 (20,3 a 37,6), y EEBench (53,0 a 64,0)

El movimiento individual más grande está en Terminal-Bench 4.0, que mide trabajo de varias horas en una terminal real: Grok 4.6 obtuvo 20,3 % y Grok 4.7 casi lo duplica hasta 37,6 %. Ese es exactamente el tipo de tarea de largo horizonte para la que se construyó la ejecución de RL más larga, y es donde el lanzamiento se gana su lugar. La programación y la ingeniería siguen la misma historia: CursorBench 4.0 sube de 40,4 % a 46,3 %, y EEBench (ingeniería eléctrica) salta de 53,0 % a 64,0 %.

Aquí está la tabla más completa, con GPT-5.6 Sol y Fable 5.1 al lado para que las cifras tengan contexto. Todas las cifras de Grok 4.7 están en esfuerzo xHigh, Grok 4.6 en High.

BenchmarkGrok 4.7Grok 4.6GPT-5.6 SolFable 5.1
Precio de entrada / 1M$2$2$4$10
Precio de salida / 1M$6$6$20$50
CursorBench 4.0 (programación)46,3 %40,4 %41,7 %51,8 %
DeepSWE v1.171,0 %*65,2 %72,7 %70,0 %
Terminal-Bench 4.037,6 %20,3 %37,3 %57,9 %
EEBench (ingeniería eléctrica)64,0 %53,0 %39,4 %56,4 %
AA Briefcase v1.1 (Elo)1.6571.5461.4871.678
Harvey Legal Agent19,6 %15,8 %2,5 %6,7 %
HealthBench Professional56,7 %48,5 %60,5 %62,1 %

*La puntuación de DeepSWE de Grok 4.7 se mide con esfuerzo alto. Cifras del anuncio de Grok 4.7 de xAI.

Dos advertencias honestas antes de que alguien lea esto como una victoria total. Fable 5.1 sigue encabezando la tabla en CursorBench, Terminal-Bench y razonamiento clínico, así que si solo te importa la puntuación máxima y el costo no es problema, va por delante. Y en HealthBench Professional, tanto GPT-5.6 Sol (60,5 %) como Fable 5.1 (62,1 %) superan el 56,7 % de Grok 4.7. La historia de Grok 4.7 no es "el mejor en todo". Es "muy cerca del mejor, por una fracción del precio".

Precios de Grok 4.7 y el recargo Fast

El precio es donde este modelo se pone interesante, así que vale la pena detallarlo en lugar de limitarse a agitar una cifra "desde".

NivelEntrada / 1MEntrada en caché / 1MSalida / 1M
grok-4.7, prompt bajo 200k tokens$2,00$0,50$6,00
grok-4.7, prompt de 200k o más$4,00$1,00$12,00
Grok 4.7 Fast (solo Cursor y Grok Build)2x las tarifas anteriores2x2x

El primer detalle a tener en cuenta es el nivel de contexto largo. Una vez que una solicitud supera los 200k tokens de prompt, las tarifas más altas se aplican a cada token de la solicitud completa, no solo al excedente por encima de 200k. Así que un prompt de 210k tokens se factura por completo a 4 $ / 12 $, no en su mayoría a 2 $ / 6 $. Para bucles de agentes largos que acumulan contexto poco a poco, ese salto es real, y es la razón por la que xAI lanzó una API de compactación de contexto para reducir las conversaciones antes de que se desborden.

El segundo es la variante Fast. Grok 4.7 Fast es el mismo modelo servido al doble de velocidad de salida por el doble de precio por token, y solo está disponible dentro de Cursor y Grok Build, no en la API pública. Es un intercambio de latencia por dinero, útil cuando ves el código transmitirse en tiempo real y cada segundo cuenta, y prescindible para trabajo por lotes o en segundo plano donde la velocidad no importa.

Luego están los medidores que la mayoría de los artículos pasan por alto. En la API, la página de precios de xAI enumera las llamadas a herramientas por separado: la búsqueda web, la búsqueda en X y la ejecución de código cuestan 5 $ por cada 1.000 llamadas, la búsqueda en archivos adjuntos cuesta 10 $ por cada 1.000, y la búsqueda de colecciones estilo RAG cuesta 2,50 $ por cada 1.000. Priority Processing duplica todas las tarifas por token. Ninguno de estos rubros arruina el presupuesto, pero si estás modelando el costo de un agente que busca y ejecuta constantemente, el precio por token no es toda la factura.

La conclusión: Grok 4.7 está fijado en precio para funcionar a gran volumen. Esa es una posición deliberada, y es la razón más clara para elegirlo sobre un modelo puntero más caro para cualquier cosa que funcione en bucle.

Dónde se ubica Grok 4.7 frente a GPT-5.6 Sol y Fable 5.1

Si trazas la capacidad frente al costo, Grok 4.7 cae en un rincón que se está llenando de competencia pero que sigue siendo valioso: puntuaciones sólidas, precio bajo.

Gráfico de posicionamiento de puntuación de programación frente a costo, con Grok 4.7 en el rincón de bajo costo y alta puntuación, Grok 4.6 por debajo, GPT-5.6 Sol a mayor costo, y Fable 5.1 en el costo y la puntuación más altos
Gráfico de posicionamiento de puntuación de programación frente a costo, con Grok 4.7 en el rincón de bajo costo y alta puntuación, Grok 4.6 por debajo, GPT-5.6 Sol a mayor costo, y Fable 5.1 en el costo y la puntuación más altos

Frente a GPT-5.6 Sol, Grok 4.7 es la mejor opción en la mayoría del trabajo agéntico y de ingeniería: supera a Sol en CursorBench, EEBench, Terminal-Bench, el benchmark legal de Harvey y AA Briefcase, a la mitad del precio de entrada y menos de un tercio del precio de salida. Sol mantiene una ventaja real en razonamiento clínico y una estrecha en DeepSWE, así que no es un barrido total, pero la diferencia de precio hace de Grok 4.7 la opción por defecto para trabajo agéntico sensible al costo.

Frente a Fable 5.1, la lectura honesta es que Fable sigue siendo el modelo más fuerte en programación pura y trabajo de terminal de largo horizonte, y su Elo de conocimiento profesional GDPval de 1.735 supera el 1.695 de Grok 4.7. Pero Fable cobra 10 $ / 50 $ por millón de tokens, de cinco a ocho veces las tarifas de Grok. Así que la pregunta no es "cuál es más inteligente" (a menudo Fable), sino "cuánto estás dispuesto a pagar por cada punto adicional". Para muchas cargas de trabajo en producción, Grok 4.7 es la respuesta que mantiene la factura razonable.

Seguridad y ciberseguridad

xAI le dio un peso real a la seguridad en este ciclo, y es una de las partes más concretas del lanzamiento. Grok 4.7 se construyó con una pila de salvaguardas completamente nueva, y xAI lo llama el modelo más sólido que ha probado en rechazos y resistencia a jailbreaks.

Los detalles son lo que hace verificable esa afirmación. En HackerBench v0.3, el benchmark de xAI para tareas cibernéticas de riesgo, Grok 4.7 deja pasar solo el 3,3 % de los prompts de doble uso riesgosos mientras que, según xAI, rara vez bloquea trabajo legítimo de seguridad. También encabeza el benchmark de bioseguridad de LatchBio con un 62,4 %. La propuesta es un modelo que se mantiene útil para trabajo real de seguridad e investigación sin ser una herramienta fácil para la versión peligrosa de la misma tarea, y xAI ha comenzado a dar a socios de ciberseguridad seleccionados acceso solo por invitación a las capacidades de red-team del modelo para investigación de defensa. Los benchmarks son del propio proveedor, así que hay que tratarlos como punto de partida, pero la dirección es clara.

Para quién es realmente Grok 4.7

Después de analizar las cifras, aquí es donde llego. Grok 4.7 es una opción sólida si escribes código, construyes agentes, o lanzas cualquier cosa en la API donde el costo de los tokens se acumula. La combinación de puntuaciones cercanas a la frontera y los precios de Grok 4.6 es la razón principal para prestarle atención, y las mejoras de largo horizonte significan que aguanta mejor que 4.6 en trabajos que duran un tiempo.

Usuarios reales confirman el ángulo de "ejecutarlo constantemente". Un suscriptor intensivo de Grok describió cómo lo integró en tareas cotidianas y aun así nunca alcanzó los límites:

Hacker News

"Tengo un bot de Grok que supervisa mi correo cada 15 minutos y archiva cosas por mí. Tengo otro bot que supervisa resultados de análisis de sangre... y nunca me acerco siquiera a agotar mi cuota."

Donde ajustaría las expectativas es en código profundo y complicado. Los modelos punteros están todos mejorando en resolver un script de una sola vez, y eso es real, pero no es lo mismo que sostener una base de código grande. Como lo puso un desarrollador en el mismo hilo:

Hacker News

"Los modelos cada vez son mejores resolviendo todo de una vez. Eso es útil en muchas situaciones, como scripts pequeños y puntuales... Pero para el trabajo de código en sí, no me ayuda mucho."

Esa es una lectura justa de cualquier modelo de esta categoría, Grok 4.7 incluido. Úsalo para el volumen de trabajo de dificultad media donde su precio gana, y recurre al modelo más caro solo para las tareas que realmente necesitan esos últimos puntos.

Un modelo puntero es el motor, no el empleado

Aquí está el replanteamiento que prometí en el TL;DR, porque es lo que la mayoría de los artículos de "qué modelo debería usar" se saltan.

Grok 4.7 es infraestructura. Es un motor brillante que alquilas por token, y llega sin saber nada sobre tu empresa, tus tickets, tu tono o tus herramientas. Para convertirlo en algo que haga un trabajo real, alguien tiene que construir el arnés: conectar el conocimiento, cablear las integraciones, escribir las barreras de seguridad, manejar la escalación y mantener todo funcionando. Eso es un proyecto real, no un simple interruptor de configuración.

A la izquierda, una tarjeta de modelo etiquetada capacidad en bruto, facturada por token, tú construyes el arnés; a la derecha, una tarjeta de compañero de equipo etiquetada contratado para un trabajo, llega con habilidades e integraciones, conoce el contexto de tu empresa
A la izquierda, una tarjeta de modelo etiquetada capacidad en bruto, facturada por token, tú construyes el arnés; a la derecha, una tarjeta de compañero de equipo etiquetada contratado para un trabajo, llega con habilidades e integraciones, conoce el contexto de tu empresa

Esa brecha es toda la idea detrás de eesel. En lugar de entregarte un modelo y un arnés vacío, eesel es una plataforma de compañeros de equipo de IA donde contratas compañeros listos para trabajar para un puesto específico. La plantilla actual es un compañero de equipo de IA para helpdesk que se une a tu cola de soporte y un redactor de blog con IA que investiga y redacta publicaciones extensas. Cada uno llega ya con las habilidades, integraciones y contexto de empresa que su rol necesita, funcionando por debajo sobre modelos punteros para que obtengas la capacidad sin tener que ser dueño de la infraestructura.

El compañero de equipo redactor de blog con IA de eesel redactando una publicación mientras un agente ejecuta pasos de investigación, banner y verificación en el panel lateral
El compañero de equipo redactor de blog con IA de eesel redactando una publicación mientras un agente ejecuta pasos de investigación, banner y verificación en el panel lateral

Y si te gustó Grok 4.7 porque vives en una terminal, eesel también te alcanza ahí. La CLI de eesel opera el mismo compañero de equipo y espacio de trabajo que el panel, pero desde la línea de comandos: una persona puede ejecutarla, los scripts pueden automatizarla, y agentes de código como Claude Code, Codex y Cursor pueden manejarla. Puedes inspeccionar las instrucciones de un compañero de equipo, enviar un mensaje de prueba, leer de vuelta el resultado JSON y la actividad, y proponer un cambio acotado para que un responsable lo apruebe, todo sin salir de tu shell. Es el mismo patrón de "operar el agente de forma programática" que hace atractiva a una API de modelo en bruto, pero dirigido a un empleado que ya conoce el trabajo. Puedes probar eesel gratis.

Preguntas frecuentes

¿Qué es Grok 4.7?

Grok 4.7 es el modelo puntero de xAI para programación, tareas agénticas y trabajo de conocimiento, lanzado el 21 de septiembre de 2026. Funciona sobre un modelo base nuevo y más grande que Grok 4.6, mantiene la ventana de contexto de 500k y se ofrece en la API de xAI como grok-4.7. Es el mismo tipo de motor de modelo en bruto sobre el que se construye un producto como un compañero de equipo de IA.

¿Cuánto cuesta Grok 4.7?

El precio de Grok 4.7 es de 2 $ por millón de tokens de entrada, 0,50 $ de entrada en caché y 6 $ de salida por debajo de 200k tokens de prompt, duplicándose a 4 $ / 1 $ / 12 $ cuando una solicitud supera los 200k, según la página de precios de xAI. Eso coincide exactamente con Grok 4.6, así que la actualización añade capacidad sin subir el precio.

¿Cuál es la diferencia entre Grok 4.7 y Grok 4.6?

Grok 4.7 usa un modelo base más grande y una ejecución de aprendizaje por refuerzo más larga, orientada a tareas de varias horas, y logra las mayores mejoras en benchmarks agénticos de larga duración como Terminal-Bench 4.0. Ambos comparten la ventana de contexto de 500k y los mismos precios por token.

¿Es bueno Grok 4.7 para programar?

Sí, la programación es su principal fortaleza. Obtiene un 46,3 % en CursorBench 4.0 y supera a Grok 4.6 en todos los benchmarks de software publicados por xAI, y se ofrece dentro de Cursor y Grok Build. Para trabajo de código más profundo, los equipos a menudo lo siguen combinando con un modelo más caro para las tareas más difíciles.

¿Cómo accedo a Grok 4.7?

Puedes llamar a Grok 4.7 a través de la API de xAI como grok-4.7, usarlo gratis en Grok Build, o acceder a él dentro de Cursor. Si lo que quieres es que esa inteligencia haga un trabajo definido en lugar de tokens en bruto, una plataforma de compañeros de equipo de IA como eesel empaqueta un modelo puntero con las habilidades, integraciones y contexto de la empresa para un rol real.

¿Es Grok 4.7 mejor que GPT-5.6 Sol o Fable 5.1?

Depende de qué valores más. Grok 4.7 supera a GPT-5.6 Sol en la mayoría de los benchmarks de programación y agénticos por una fracción del precio, mientras que Fable 5.1 sigue liderando en programación punta y trabajo de terminal, pero cuesta de cinco a ocho veces más por token. Para trabajo sensible al costo y de alto volumen, Grok 4.7 suele ser la mejor opción.

¿Qué es Grok 4.7 Fast?

Grok 4.7 Fast es el mismo modelo servido al doble de velocidad de salida por el doble de precio por token, disponible solo dentro de Cursor y Grok Build, no en la API pública. Vale la pena cuando la baja latencia importa, como ver el código transmitirse en tiempo real, y es prescindible para trabajos por lotes o en segundo plano.

Share this article

Alicia Kirana Utomo

Article by

Alicia Kirana Utomo

Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.

Related Posts

All posts →
Banner principal de la reseña de Grok 4.7 con el logo de Grok sobre un fondo oscuro y abstracto de cómputo
Trending

Reseña de Grok 4.7: ¿el modelo económico de xAI es realmente bueno?

Una reseña práctica de Grok 4.7: en qué destaca, dónde todavía pierde frente a Fable 5.1 y GPT-5.6 Sol, los precios reales, el recargo de la variante Fast y quién debería usarlo realmente.

Rama Adi NugrahaRama Adi NugrahaSep 23, 2026
Banner principal de alternativas a Grok 4.7 con el logotipo de Grok sobre un fondo abstracto oscuro de cómputo
Trending

Alternativas a Grok 4.7: 6 modelos que vale la pena comparar en 2026

Las mejores alternativas a Grok 4.7 en 2026, comparadas por precio, contexto, pesos abiertos y en qué es realmente buena cada una, además de cómo saber si de verdad necesitas un modelo.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieSep 23, 2026
Banner principal de precios de Grok 4.7 con el logotipo de Grok y una tabla de costes de tokens de la API
Trending

Precios de Grok 4.7: costes de tokens de la API, niveles y el recargo Fast

Un desglose completo de los precios de Grok 4.7: las tarifas de $2 / $6 por token, el precipicio de contexto largo en 200k, los medidores de llamadas a herramientas que la mayoría de modelos de coste pasan por alto, el recargo Fast, dónde se puede comprar realmente y cómo se compara con GPT-6 Sol y Fable 5.1.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieSep 23, 2026
Ilustración abstracta de un agente de IA conectado a una pila de sistemas mediante API
Guides

Integración de API para agentes de IA: qué estás realmente conectando

Una integración de API para agentes de IA nunca es un solo endpoint. Aquí está la superficie real del trabajo, por qué los triggers se comen la mitad del esfuerzo y cómo delimitar el alcance antes de empezar.

Rama Adi NugrahaRama Adi NugrahaSep 8, 2026
Una persona demostrando un flujo de trabajo en su Mac mientras Codex lo graba como una habilidad reutilizable y un agente de IA lo reproduce
Guides

Grabación y reproducción de OpenAI Codex, explicado

Qué hace realmente la grabación y reproducción de OpenAI Codex: demuestra un flujo de trabajo en tu Mac una vez, y Codex lo convierte en una habilidad reutilizable. Cómo funciona, sus límites y dónde encaja.

Alicia Kirana UtomoAlicia Kirana UtomoJun 22, 2026
Texto alternativo de la imagen
Guides

Una reseña detallada de Claude Cowork: Características, precios y limitaciones

Claude Cowork de Anthropic lleva las capacidades de los agentes de IA al escritorio, permitiendo a los usuarios automatizar tareas mediante la gestión de archivos y la navegación web. Esta reseña explora sus características, rendimiento y limitaciones.

Katelin TeenKatelin TeenFeb 6, 2026
Texto alternativo de la imagen
Guides

Nuestra reseña completa de GPT 5.3 Codex: Una nueva era para la IA agéntica

Una reseña profunda de GPT 5.3 Codex. Analizamos las nuevas capacidades agénticas, el rendimiento en pruebas de referencia, los precios y las limitaciones como la falta de acceso a la API.

Stevia PutriStevia PutriFeb 6, 2026
Texto alternativo de la imagen
Guides

Guía completa para la integración de Claude AI

Descubra cómo una integración de Claude AI puede transformar los flujos de trabajo de su empresa. Esta guía cubre los métodos clave para conectar Claude a sus herramientas, desde conectores sencillos hasta soluciones de API personalizadas, junto con casos de uso comunes y consideraciones importantes.

Stevia PutriStevia PutriJan 9, 2026
Grok Imagine: La descripción general completa para creadores y empresas
Guides

Grok Imagine (2026): Generador de imágenes y video XAI analizado

De una instrucción de voz a un video viral en segundos, esa es la promesa de Grok Imagine. En esta guía, desglosamos todo lo que necesita saber sobre el nuevo y potente generador accesible de xAI.

Kenneth PanganKenneth PanganOct 10, 2025

Listo para contratar tu companero de IA?

Configuracion en minutos. Sin tarjeta de credito requerida.

Comienza gratis