Grok 4.7 llegó el 21 de septiembre de 2026, y lo primero que notó la gente fue lo que no cambió: el precio. Tras un lanzamiento que se retrasó respecto a las fechas objetivo anteriores, xAI (ahora con la marca SpaceXAI) mantuvo las tarifas de Grok 4.6, de 2 dólares por millón de tokens de entrada y 6 dólares por millón de tokens de salida, y también mantuvo la ventana de contexto de 500.000 tokens. Lo que cambió es cuánto trabaja el modelo en cada tarea, y ahí está la clave del costo real.
Esta página reúne en un solo lugar la fecha de lanzamiento, cada nivel de precio, los límites de la ventana de contexto, las puntuaciones de benchmark que publicó xAI y las cifras que midieron los evaluadores independientes. Cuando las fuentes no coinciden, verás ambas cifras. Una puntuación del proveedor es una afirmación hasta que otra persona la repite, así que cada número de abajo indica quién lo produjo.
💡 Lectura rápida: los mismos precios por token que Grok 4.6, la misma ventana de 500K, puntuaciones más altas en los siete benchmarks de xAI y unos 2,25 veces más tokens de salida por tarea. La cifra que hay que vigilar es la factura por tarea, no la tarifa por token.
Fecha de lanzamiento de Grok 4.7
Qué se lanzó el 21 de septiembre
xAI publicó Grok 4.7 el 21 de septiembre de 2026, anunciado desde la cuenta de SpaceXAI hacia las 16:17 UTC. Su predecesor, Grok 4.6, llegó el 12 de agosto de 2026, así que solo 40 días separan a los dos modelos, aunque los informes describen la versión 4.7 como posterior a fechas objetivo anteriores. Los datos básicos caben en una tabla.
| Detalle | Grok 4.7 |
|---|
| Fecha de lanzamiento | 21 de septiembre de 2026 |
| Modelo anterior | Grok 4.6, 12 de agosto de 2026 |
| ID del modelo en la API | grok-4.7 |
| Entrada | Texto e imágenes |
| Salida | Texto |
| Esfuerzo de razonamiento | low, medium, high (por defecto), xhigh |
| Fecha de corte del conocimiento | mayo o junio de 2026, según las fuentes |
Un integrador señala que la grafía con guion grok-4-7 se rechaza, así que usa el ID con punto en las llamadas a la API. En el plano técnico, xAI describe un modelo base más grande con un entrenamiento de refuerzo extendido en tareas que duran horas, además de mejores hábitos para revisar su propio trabajo y gestionar contextos largos.

Dónde puedes usarlo
Grok 4.7 llegó a los desarrolladores por varias vías el primer día:
- API de xAI: disponible desde el lanzamiento con el ID
grok-4.7.
- Cursor: lo añadió de inmediato, incluida una variante de pago más rápida.
- Grok Build: el arnés de programación propio de xAI, donde se hicieron varias de las pruebas de benchmark publicadas.
- GitHub Copilot: lo fue activando de forma gradual tras el lanzamiento.
- OpenRouter y Vercel AI Gateway: ambos lo listaron para el enrutamiento.
- Plataformas en la nube: Bedrock, Model Garden y Foundry tardaron más que la API de xAI en incorporarlo al lanzamiento.
Los límites de tasa publicados son 150 solicitudes por segundo y 50 millones de tokens por minuto, lo bastante generosos como para que la mayoría de los equipos agoten su presupuesto mucho antes de tocar el tope.
Precio de Grok 4.7 por millón de tokens
Tarifas estándar y de prompts largos
El precio es idéntico al de Grok 4.6. La tarifa depende de la longitud de tu prompt, y en cuanto se supera el umbral, toda la solicitud se factura al nivel más alto, no solo los tokens adicionales.
| Tamaño del prompt | Entrada | Entrada en caché | Salida |
|---|
| Menos de 200K tokens | 2,00 $ | 0,50 $ | 6,00 $ |
| 200K tokens o más | 4,00 $ | 1,00 $ | 12,00 $ |
Todos los precios son por millón de tokens. La entrada en caché cuesta una cuarta parte de la tarifa de entrada estándar, lo que hace mucho más barato reutilizar prompts de sistema y contexto de proyecto compartido.
También hay una variante rápida disponible solo dentro de Cursor y Grok Build, no a través de la API pública. Se describe como el doble de velocidad de salida al doble de precio, así que cuenta con el doble de las tarifas estándar si la eliges.

Facturas reales para prompts reales
Las tarifas dicen poco hasta que las aplicas. La tabla de abajo supone una respuesta de 5.000 tokens de salida y sin caché.
| Tamaño del prompt | Costo de entrada | Costo de salida | Total |
|---|
| 50K tokens | 0,10 $ | 0,03 $ | 0,13 $ |
| 150K tokens | 0,30 $ | 0,03 $ | 0,33 $ |
| 199K tokens | 0,40 $ | 0,03 $ | 0,43 $ |
| 201K tokens | 0,80 $ | 0,06 $ | 0,86 $ |
| 400K tokens | 1,60 $ | 0,06 $ | 1,66 $ |
Fíjate en las filas del medio. Añadir solo 2.000 tokens a un prompt hace que la factura pase de 0,43 $ a 0,86 $, una duplicación causada únicamente por cruzar el umbral.
💡 Consejo: si tu prompt se acerca a los 200K tokens, recórtalo o divide el trabajo en dos llamadas. La entrada en caché al nivel inferior suele salir más barata que una solicitud demasiado grande.
La ventana de contexto de 500K
Lo que pueden contener 500.000 tokens
Grok 4.7 acepta 500.000 tokens en una sola solicitud, igual que Grok 4.6, así que esto no es una mejora. Una regla práctica habitual es que un token equivale a unos tres cuartos de una palabra en inglés. Eso sitúa la ventana en torno a 375.000 palabras, o unas 1.500 páginas de texto plano. En la práctica puede contener:
- Un repositorio de código de tamaño medio con sus pruebas y su documentación
- Varios contratos largos o artículos de investigación a la vez
- Una semana completa de tickets de soporte para buscar patrones
- Una sesión muy larga de agente con la salida de herramientas aún en memoria
Tómalo como estimaciones. El código, las tablas y los textos que no están en inglés usan más tokens por palabra que la prosa corriente, así que la capacidad real cambia según tu contenido.
Cuando los prompts largos cuestan el doble
La ventana es grande, pero lo que limita es el nivel de precio. Todo lo que llegue a 200K tokens o más pasa a las tarifas de 4 $ de entrada y 12 $ de salida para toda la solicitud. Un prompt completo de 500K con una respuesta de 5.000 tokens cuesta unos 2,06 $ a esas tarifas, frente a 0,33 $ de un prompt de 150K.

Una ventana más grande tampoco garantiza una mejor recuperación de información. xAI afirma que la versión 4.7 gestiona mejor el contexto largo y revisa su propio trabajo en tareas de varias horas, pero son afirmaciones de lanzamiento, así que conviene probar la recuperación con tus propios documentos antes de enviar medio millón de tokens en producción.
Benchmarks publicados por xAI
Puntuaciones de programación y terminal
xAI publicó una tabla de siete benchmarks, y Grok 4.7 superó a Grok 4.6 en todos ellos. Las filas de programación muestran el mayor avance.
| Benchmark | Grok 4.6 | Grok 4.7 | Configuración de Grok 4.7 |
|---|
| CursorBench 4.0 | 40,4% | 46,3% | xhigh |
| DeepSWE v1.1 | 65,2% | 71,0% | high |
| Terminal-Bench 4.0 | 20,3% | 38,0% | xhigh, arnés Grok Build |
| SWE-Marathon v1.1 | 31,9% | 46,0% | high |
Terminal-Bench 4.0 es el titular, una mejora de unos 17 puntos, y un medio indica que la puntuación de 4.7 es 37,6% en lugar de 38,0%. SWE-Marathon también subió más de 14 puntos, lo que encaja con el foco en trabajo largo de varias horas.
Hay un detalle que merece atención. La tabla de lanzamiento compara Grok 4.6 con esfuerzo high frente a Grok 4.7 con xhigh en CursorBench, así que esa comparación no es equivalente. Más esfuerzo significa más tokens de razonamiento, un punto que vuelve en la sección de costos de abajo.
Puntuaciones de trabajo intelectual
Fuera de la programación, el panorama es más modesto pero sigue siendo positivo.
| Benchmark | Grok 4.6 | Grok 4.7 |
|---|
| EEBench | 53,0% | 64,0% |
| HealthBench Professional | 48,5% | 56,7% |
| Benchmark legal de Harvey | 15,8% | 19,6% |
La puntuación legal recuerda lo exigentes que son estas pruebas. Incluso tras una mejora de casi cuatro puntos, Grok 4.7 se queda por debajo del 20% en el benchmark de Harvey, así que la redacción jurídica todavía necesita revisión humana.

💡 Advertencia: todas las puntuaciones de esta sección provienen de los propios materiales de xAI. Los sitios de terceros que las republicaron indican claramente que no verificaron los números.
Lo que encontraron las pruebas independientes
Índices de terceros
Un rastreador independiente de clasificaciones midió Grok 4.7 el día del lanzamiento y encontró mejoras menores de las que sugiere la tabla del proveedor:
- Intelligence Index: una puntuación de 46, en el puesto 16 de 655 modelos rastreados, 2 puntos más que Grok 4.6.
- Coding Agent Index: 9 puntos más que Grok 4.6.
- Cyber Index (28 de septiembre): 56%, empatado en primer lugar entre 17 modelos.
- VulcanBench (4 de octubre): Grok 4.7 quedó entre los tres primeros, por delante del nivel 5.1 Max de la familia Claude Fable 5.
El patrón es constante. El modelo es claramente mejor en programación agéntica y en trabajo de seguridad, mientras que el razonamiento general apenas se movió. Eso encaja con un modelo ajustado mediante entrenamiento en tareas largas y no con uno pensado para chat.
El problema del apetito de tokens
Aquí está la trampa. El mismo rastreador registró unos 81.000 tokens de salida por tarea para Grok 4.7, frente a 36.000 para Grok 4.6, una proporción de aproximadamente 2,25. Otros evaluadores vieron lo mismo: con xhigh, el modelo nuevo escribe más del doble de salida que 4.6 con high.
| Métrica | Grok 4.6 | Grok 4.7 |
|---|
| Tokens de salida por tarea | 36.000 | 81.000 |
| Costo de salida por tarea a 6 $ por millón | 0,22 $ | 0,49 $ |
| Precio por token | 6 $ por millón | 6 $ por millón |
Solo costo de salida, antes de entrada y caché. La tabla de tarifas no cambió, pero el costo por tarea terminada se duplicó aproximadamente. Un modelo barato que habla el doble no es un modelo barato.

Puedes mantener ese apetito bajo control con unos hábitos:
- Limita la longitud de la salida con un límite máximo de tokens razonable en cada llamada.
- Usa esfuerzo low o medium en los pasos sencillos de un bucle de agente, y reserva xhigh para el paso que lo necesite.
- Guarda en caché el contexto compartido para que la tarifa de entrada de 0,50 $ se aplique a tu prompt de sistema y a los archivos del proyecto.
- Envía las tareas cortas a Grok 4.6 o a un modelo más pequeño, y manda a 4.7 solo los trabajos largos y con muchas herramientas.
- Registra los tokens por tarea terminada, no por solicitud, para que los reintentos y las respuestas extensas aparezcan en tus cifras.
Quedan dos afirmaciones sin confirmar. xAI no dio ningún recuento de parámetros, y una cifra de 2,1 billones que mencionó Elon Musk no tiene respaldo en los materiales de lanzamiento. Musk también mencionó datos complementarios de SpaceX, que no aparecen en los documentos oficiales. Hasta que xAI publique detalles, trata ambas como rumores.
Grok 4.7 frente a sus rivales
Grok 4.7 frente a Grok 4.6
| Característica | Grok 4.6 | Grok 4.7 |
|---|
| Lanzamiento | 12 de agosto de 2026 | 21 de septiembre de 2026 |
| Precio de entrada | 2 $ por millón | 2 $ por millón |
| Precio de salida | 6 $ por millón | 6 $ por millón |
| Ventana de contexto | 500K | 500K |
| Niveles de esfuerzo | de low a xhigh | de low a xhigh |
| Tokens de salida por tarea | 36.000 | 81.000 |
| Terminal-Bench 4.0 | 20,3% | unos 38% |
La recomendación de las comparativas que revisé es simple. Actualiza para programación agéntica, automatización de terminal y trabajo con repositorios grandes. Quédate con 4.6 para respuestas cortas, clasificación y chat, donde la verbosidad extra solo suma costo. Un reparto aproximado sería este:
- Cambia ya: agentes de programación, refactorizaciones de varios archivos, automatización de shell, triaje de seguridad
- Prueba primero: tareas legales, de salud y financieras, donde las puntuaciones absolutas bajas exigen revisión
- Quédate como estás: preguntas y respuestas cortas, resúmenes, respuestas de soporte, todo lo que se cobra por mensaje

Fable 5.1 Max y otros rivales
Frente a la familia Claude Fable 5, en concreto el nivel 5.1 Max, la tabla propia de xAI sitúa a Grok 4.7 por delante en dos de siete benchmarks y por detrás en las filas de programación. El resultado de VulcanBench apunta en la dirección contraria, así que el resumen honesto es que los dos se reparten victorias según la prueba.
Las cifras directas con otros laboratorios siguen siendo escasas. Si estás eligiendo entre Grok 4.7, GPT 5.6 Sol y Gemini 3.5 Flash, pasa los mismos diez prompts reales por cada uno y compara tanto la calidad como los tokens totales usados.

Cómo elegir un nivel de esfuerzo de razonamiento
Grok 4.7 ofrece cuatro configuraciones: low, medium, high y xhigh, con high como valor por defecto. Como los tokens de salida determinan tu factura, el esfuerzo es un control de costo tanto como de calidad.
- Low: búsquedas rápidas y tareas de formato
- Medium: redacción cotidiana y pequeños cambios de código
- High: el valor por defecto, un buen punto de partida para la mayoría de trabajos con agentes
- Xhigh: tareas difíciles de varios pasos en las que una respuesta errónea cuesta más que los tokens extra
Empieza en high, mide los tokens por tarea terminada y pasa a xhigh solo en los trabajos que fallan sin él.

Prueba la familia Grok en PicassoIA
Grok 4.7 no aparece en PicassoIA en el momento de escribir esto, pero su predecesor Grok 4 sí, y funciona directamente desde un campo de texto, sin acceso a la API ni configuración. Es una forma rápida de hacerte una idea del estilo de razonamiento de xAI antes de comprometer gasto en la API.
Cómo usar Grok 4 en PicassoIA
- Abre la página de Grok 4 en la colección de modelos de lenguaje grandes.
- Escribe tu pregunta en el campo Prompt. Los problemas de varios pasos y las comparaciones son lo que mejor le sale.
- Deja Temperature en el valor por defecto de 0,1 para trabajo factual, y súbelo un poco para lluvia de ideas.
- Revisa Max Tokens. El valor por defecto es 2.048, así que súbelo si las respuestas largas se cortan.
- Deja Top P en 1 y ambas penalizaciones en 0, salvo que la respuesta se repita.
- Ejecuta el prompt y luego pega el mismo texto en otro modelo para compararlo.
Para ese último paso, Claude Sonnet 5, GPT 5.6 Sol y Gemini 3.5 Flash son buenos rivales, y vale la pena echar un vistazo a la página de Kimi K2.6 para prompts de programación al estilo de agente.
Crea tus propias imágenes a continuación
Leer sobre modelos es la mitad del trabajo. La otra mitad es crear algo con ellos, y ahí es donde PicassoIA se gana su lugar. Redacta un guion, una descripción de producto o el esquema de un artículo con un modelo de lenguaje, y luego convierte la misma idea en imágenes en pocos clics.

Para resultados fotorrealistas, empieza con Seedream 4.5, GPT Image 2, Flux 2 Pro o Nano Banana Pro. Describe el sujeto, la luz y el objetivo, por ejemplo "85mm, soft window light, film grain", y compara dos modelos con el mismo prompt. Cuando una imagen fija te parezca bien, la colección de texto a video puede convertirla en un clip corto.
Explora todos los modelos en picassoia.com/en/all-models, elige uno, escribe tu primer prompt y mira lo que puedes crear hoy.