Grok 4.7: fecha de lanzamiento, precio, ventana de contexto y benchmarks

Grok 4.7 llegó el 21 de septiembre de 2026 con los mismos precios de token de 2 y 6 dólares que Grok 4.6, una ventana de contexto de 500.000 tokens y puntuaciones más altas en programación. Consulta los datos del lanzamiento, los niveles de precio, los benchmarks que publicó xAI y lo que encontraron las pruebas independientes sobre el costo por tarea.

Grok 4.7: fecha de lanzamiento, precio, ventana de contexto y benchmarks
Cristian Da Conceicao
Fundador de Picasso IA

Grok 4.7 llegó el 21 de septiembre de 2026, y lo primero que notó la gente fue lo que no cambió: el precio. Tras un lanzamiento que se retrasó respecto a las fechas objetivo anteriores, xAI (ahora con la marca SpaceXAI) mantuvo las tarifas de Grok 4.6, de 2 dólares por millón de tokens de entrada y 6 dólares por millón de tokens de salida, y también mantuvo la ventana de contexto de 500.000 tokens. Lo que cambió es cuánto trabaja el modelo en cada tarea, y ahí está la clave del costo real.

Esta página reúne en un solo lugar la fecha de lanzamiento, cada nivel de precio, los límites de la ventana de contexto, las puntuaciones de benchmark que publicó xAI y las cifras que midieron los evaluadores independientes. Cuando las fuentes no coinciden, verás ambas cifras. Una puntuación del proveedor es una afirmación hasta que otra persona la repite, así que cada número de abajo indica quién lo produjo.

💡 Lectura rápida: los mismos precios por token que Grok 4.6, la misma ventana de 500K, puntuaciones más altas en los siete benchmarks de xAI y unos 2,25 veces más tokens de salida por tarea. La cifra que hay que vigilar es la factura por tarea, no la tarifa por token.

Fecha de lanzamiento de Grok 4.7

Qué se lanzó el 21 de septiembre

xAI publicó Grok 4.7 el 21 de septiembre de 2026, anunciado desde la cuenta de SpaceXAI hacia las 16:17 UTC. Su predecesor, Grok 4.6, llegó el 12 de agosto de 2026, así que solo 40 días separan a los dos modelos, aunque los informes describen la versión 4.7 como posterior a fechas objetivo anteriores. Los datos básicos caben en una tabla.

DetalleGrok 4.7
Fecha de lanzamiento21 de septiembre de 2026
Modelo anteriorGrok 4.6, 12 de agosto de 2026
ID del modelo en la APIgrok-4.7
EntradaTexto e imágenes
SalidaTexto
Esfuerzo de razonamientolow, medium, high (por defecto), xhigh
Fecha de corte del conocimientomayo o junio de 2026, según las fuentes

Un integrador señala que la grafía con guion grok-4-7 se rechaza, así que usa el ID con punto en las llamadas a la API. En el plano técnico, xAI describe un modelo base más grande con un entrenamiento de refuerzo extendido en tareas que duran horas, además de mejores hábitos para revisar su propio trabajo y gestionar contextos largos.

Calendario de pared con una fecha de finales de septiembre marcada en rojo sobre un escritorio

Dónde puedes usarlo

Grok 4.7 llegó a los desarrolladores por varias vías el primer día:

  • API de xAI: disponible desde el lanzamiento con el ID grok-4.7.
  • Cursor: lo añadió de inmediato, incluida una variante de pago más rápida.
  • Grok Build: el arnés de programación propio de xAI, donde se hicieron varias de las pruebas de benchmark publicadas.
  • GitHub Copilot: lo fue activando de forma gradual tras el lanzamiento.
  • OpenRouter y Vercel AI Gateway: ambos lo listaron para el enrutamiento.
  • Plataformas en la nube: Bedrock, Model Garden y Foundry tardaron más que la API de xAI en incorporarlo al lanzamiento.

Los límites de tasa publicados son 150 solicitudes por segundo y 50 millones de tokens por minuto, lo bastante generosos como para que la mayoría de los equipos agoten su presupuesto mucho antes de tocar el tope.

Precio de Grok 4.7 por millón de tokens

Tarifas estándar y de prompts largos

El precio es idéntico al de Grok 4.6. La tarifa depende de la longitud de tu prompt, y en cuanto se supera el umbral, toda la solicitud se factura al nivel más alto, no solo los tokens adicionales.

Tamaño del promptEntradaEntrada en cachéSalida
Menos de 200K tokens2,00 $0,50 $6,00 $
200K tokens o más4,00 $1,00 $12,00 $

Todos los precios son por millón de tokens. La entrada en caché cuesta una cuarta parte de la tarifa de entrada estándar, lo que hace mucho más barato reutilizar prompts de sistema y contexto de proyecto compartido.

También hay una variante rápida disponible solo dentro de Cursor y Grok Build, no a través de la API pública. Se describe como el doble de velocidad de salida al doble de precio, así que cuenta con el doble de las tarifas estándar si la eliges.

Vista cenital de facturas impresas, una calculadora y un cuaderno de números sobre una mesa de roble

Facturas reales para prompts reales

Las tarifas dicen poco hasta que las aplicas. La tabla de abajo supone una respuesta de 5.000 tokens de salida y sin caché.

Tamaño del promptCosto de entradaCosto de salidaTotal
50K tokens0,10 $0,03 $0,13 $
150K tokens0,30 $0,03 $0,33 $
199K tokens0,40 $0,03 $0,43 $
201K tokens0,80 $0,06 $0,86 $
400K tokens1,60 $0,06 $1,66 $

Fíjate en las filas del medio. Añadir solo 2.000 tokens a un prompt hace que la factura pase de 0,43 $ a 0,86 $, una duplicación causada únicamente por cruzar el umbral.

💡 Consejo: si tu prompt se acerca a los 200K tokens, recórtalo o divide el trabajo en dos llamadas. La entrada en caché al nivel inferior suele salir más barata que una solicitud demasiado grande.

La ventana de contexto de 500K

Lo que pueden contener 500.000 tokens

Grok 4.7 acepta 500.000 tokens en una sola solicitud, igual que Grok 4.6, así que esto no es una mejora. Una regla práctica habitual es que un token equivale a unos tres cuartos de una palabra en inglés. Eso sitúa la ventana en torno a 375.000 palabras, o unas 1.500 páginas de texto plano. En la práctica puede contener:

  • Un repositorio de código de tamaño medio con sus pruebas y su documentación
  • Varios contratos largos o artículos de investigación a la vez
  • Una semana completa de tickets de soporte para buscar patrones
  • Una sesión muy larga de agente con la salida de herramientas aún en memoria

Tómalo como estimaciones. El código, las tablas y los textos que no están en inglés usan más tokens por palabra que la prosa corriente, así que la capacidad real cambia según tu contenido.

Cuando los prompts largos cuestan el doble

La ventana es grande, pero lo que limita es el nivel de precio. Todo lo que llegue a 200K tokens o más pasa a las tarifas de 4 $ de entrada y 12 $ de salida para toda la solicitud. Un prompt completo de 500K con una respuesta de 5.000 tokens cuesta unos 2,06 $ a esas tarifas, frente a 0,33 $ de un prompt de 150K.

Vista aérea de un rollo de papel muy largo desplegado sobre una mesa de lectura de biblioteca

Una ventana más grande tampoco garantiza una mejor recuperación de información. xAI afirma que la versión 4.7 gestiona mejor el contexto largo y revisa su propio trabajo en tareas de varias horas, pero son afirmaciones de lanzamiento, así que conviene probar la recuperación con tus propios documentos antes de enviar medio millón de tokens en producción.

Benchmarks publicados por xAI

Puntuaciones de programación y terminal

xAI publicó una tabla de siete benchmarks, y Grok 4.7 superó a Grok 4.6 en todos ellos. Las filas de programación muestran el mayor avance.

BenchmarkGrok 4.6Grok 4.7Configuración de Grok 4.7
CursorBench 4.040,4%46,3%xhigh
DeepSWE v1.165,2%71,0%high
Terminal-Bench 4.020,3%38,0%xhigh, arnés Grok Build
SWE-Marathon v1.131,9%46,0%high

Terminal-Bench 4.0 es el titular, una mejora de unos 17 puntos, y un medio indica que la puntuación de 4.7 es 37,6% en lugar de 38,0%. SWE-Marathon también subió más de 14 puntos, lo que encaja con el foco en trabajo largo de varias horas.

Hay un detalle que merece atención. La tabla de lanzamiento compara Grok 4.6 con esfuerzo high frente a Grok 4.7 con xhigh en CursorBench, así que esa comparación no es equivalente. Más esfuerzo significa más tokens de razonamiento, un punto que vuelve en la sección de costos de abajo.

Puntuaciones de trabajo intelectual

Fuera de la programación, el panorama es más modesto pero sigue siendo positivo.

BenchmarkGrok 4.6Grok 4.7
EEBench53,0%64,0%
HealthBench Professional48,5%56,7%
Benchmark legal de Harvey15,8%19,6%

La puntuación legal recuerda lo exigentes que son estas pruebas. Incluso tras una mejora de casi cuatro puntos, Grok 4.7 se queda por debajo del 20% en el benchmark de Harvey, así que la redacción jurídica todavía necesita revisión humana.

Mano señalando con un bolígrafo gráficos de barras impresos clavados en un tablero de corcho

💡 Advertencia: todas las puntuaciones de esta sección provienen de los propios materiales de xAI. Los sitios de terceros que las republicaron indican claramente que no verificaron los números.

Lo que encontraron las pruebas independientes

Índices de terceros

Un rastreador independiente de clasificaciones midió Grok 4.7 el día del lanzamiento y encontró mejoras menores de las que sugiere la tabla del proveedor:

  • Intelligence Index: una puntuación de 46, en el puesto 16 de 655 modelos rastreados, 2 puntos más que Grok 4.6.
  • Coding Agent Index: 9 puntos más que Grok 4.6.
  • Cyber Index (28 de septiembre): 56%, empatado en primer lugar entre 17 modelos.
  • VulcanBench (4 de octubre): Grok 4.7 quedó entre los tres primeros, por delante del nivel 5.1 Max de la familia Claude Fable 5.

El patrón es constante. El modelo es claramente mejor en programación agéntica y en trabajo de seguridad, mientras que el razonamiento general apenas se movió. Eso encaja con un modelo ajustado mediante entrenamiento en tareas largas y no con uno pensado para chat.

El problema del apetito de tokens

Aquí está la trampa. El mismo rastreador registró unos 81.000 tokens de salida por tarea para Grok 4.7, frente a 36.000 para Grok 4.6, una proporción de aproximadamente 2,25. Otros evaluadores vieron lo mismo: con xhigh, el modelo nuevo escribe más del doble de salida que 4.6 con high.

MétricaGrok 4.6Grok 4.7
Tokens de salida por tarea36.00081.000
Costo de salida por tarea a 6 $ por millón0,22 $0,49 $
Precio por token6 $ por millón6 $ por millón

Solo costo de salida, antes de entrada y caché. La tabla de tarifas no cambió, pero el costo por tarea terminada se duplicó aproximadamente. Un modelo barato que habla el doble no es un modelo barato.

Primer plano de un taxímetro amarillo con los números cambiando durante un trayecto bajo la lluvia

Puedes mantener ese apetito bajo control con unos hábitos:

  • Limita la longitud de la salida con un límite máximo de tokens razonable en cada llamada.
  • Usa esfuerzo low o medium en los pasos sencillos de un bucle de agente, y reserva xhigh para el paso que lo necesite.
  • Guarda en caché el contexto compartido para que la tarifa de entrada de 0,50 $ se aplique a tu prompt de sistema y a los archivos del proyecto.
  • Envía las tareas cortas a Grok 4.6 o a un modelo más pequeño, y manda a 4.7 solo los trabajos largos y con muchas herramientas.
  • Registra los tokens por tarea terminada, no por solicitud, para que los reintentos y las respuestas extensas aparezcan en tus cifras.

Quedan dos afirmaciones sin confirmar. xAI no dio ningún recuento de parámetros, y una cifra de 2,1 billones que mencionó Elon Musk no tiene respaldo en los materiales de lanzamiento. Musk también mencionó datos complementarios de SpaceX, que no aparecen en los documentos oficiales. Hasta que xAI publique detalles, trata ambas como rumores.

Grok 4.7 frente a sus rivales

Grok 4.7 frente a Grok 4.6

CaracterísticaGrok 4.6Grok 4.7
Lanzamiento12 de agosto de 202621 de septiembre de 2026
Precio de entrada2 $ por millón2 $ por millón
Precio de salida6 $ por millón6 $ por millón
Ventana de contexto500K500K
Niveles de esfuerzode low a xhighde low a xhigh
Tokens de salida por tarea36.00081.000
Terminal-Bench 4.020,3%unos 38%

La recomendación de las comparativas que revisé es simple. Actualiza para programación agéntica, automatización de terminal y trabajo con repositorios grandes. Quédate con 4.6 para respuestas cortas, clasificación y chat, donde la verbosidad extra solo suma costo. Un reparto aproximado sería este:

  • Cambia ya: agentes de programación, refactorizaciones de varios archivos, automatización de shell, triaje de seguridad
  • Prueba primero: tareas legales, de salud y financieras, donde las puntuaciones absolutas bajas exigen revisión
  • Quédate como estás: preguntas y respuestas cortas, resúmenes, respuestas de soporte, todo lo que se cobra por mensaje

Desarrollador escribiendo de noche con dos monitores mostrando código y una lámpara cálida sobre el escritorio

Fable 5.1 Max y otros rivales

Frente a la familia Claude Fable 5, en concreto el nivel 5.1 Max, la tabla propia de xAI sitúa a Grok 4.7 por delante en dos de siete benchmarks y por detrás en las filas de programación. El resultado de VulcanBench apunta en la dirección contraria, así que el resumen honesto es que los dos se reparten victorias según la prueba.

Las cifras directas con otros laboratorios siguen siendo escasas. Si estás eligiendo entre Grok 4.7, GPT 5.6 Sol y Gemini 3.5 Flash, pasa los mismos diez prompts reales por cada uno y compara tanto la calidad como los tokens totales usados.

Cuatro velocistas agachados en los tacos de salida de una pista de atletismo al amanecer

Cómo elegir un nivel de esfuerzo de razonamiento

Grok 4.7 ofrece cuatro configuraciones: low, medium, high y xhigh, con high como valor por defecto. Como los tokens de salida determinan tu factura, el esfuerzo es un control de costo tanto como de calidad.

  1. Low: búsquedas rápidas y tareas de formato
  2. Medium: redacción cotidiana y pequeños cambios de código
  3. High: el valor por defecto, un buen punto de partida para la mayoría de trabajos con agentes
  4. Xhigh: tareas difíciles de varios pasos en las que una respuesta errónea cuesta más que los tokens extra

Empieza en high, mide los tokens por tarea terminada y pasa a xhigh solo en los trabajos que fallan sin él.

Mano deslizando uno de cuatro controles en una consola de mezcla analógica

Prueba la familia Grok en PicassoIA

Grok 4.7 no aparece en PicassoIA en el momento de escribir esto, pero su predecesor Grok 4 sí, y funciona directamente desde un campo de texto, sin acceso a la API ni configuración. Es una forma rápida de hacerte una idea del estilo de razonamiento de xAI antes de comprometer gasto en la API.

Cómo usar Grok 4 en PicassoIA

  1. Abre la página de Grok 4 en la colección de modelos de lenguaje grandes.
  2. Escribe tu pregunta en el campo Prompt. Los problemas de varios pasos y las comparaciones son lo que mejor le sale.
  3. Deja Temperature en el valor por defecto de 0,1 para trabajo factual, y súbelo un poco para lluvia de ideas.
  4. Revisa Max Tokens. El valor por defecto es 2.048, así que súbelo si las respuestas largas se cortan.
  5. Deja Top P en 1 y ambas penalizaciones en 0, salvo que la respuesta se repita.
  6. Ejecuta el prompt y luego pega el mismo texto en otro modelo para compararlo.

Para ese último paso, Claude Sonnet 5, GPT 5.6 Sol y Gemini 3.5 Flash son buenos rivales, y vale la pena echar un vistazo a la página de Kimi K2.6 para prompts de programación al estilo de agente.

Crea tus propias imágenes a continuación

Leer sobre modelos es la mitad del trabajo. La otra mitad es crear algo con ellos, y ahí es donde PicassoIA se gana su lugar. Redacta un guion, una descripción de producto o el esquema de un artículo con un modelo de lenguaje, y luego convierte la misma idea en imágenes en pocos clics.

Diseñador colocando copias fotográficas en un tablero de inspiración sobre una mesa larga de estudio

Para resultados fotorrealistas, empieza con Seedream 4.5, GPT Image 2, Flux 2 Pro o Nano Banana Pro. Describe el sujeto, la luz y el objetivo, por ejemplo "85mm, soft window light, film grain", y compara dos modelos con el mismo prompt. Cuando una imagen fija te parezca bien, la colección de texto a video puede convertirla en un clip corto.

Explora todos los modelos en picassoia.com/en/all-models, elige uno, escribe tu primer prompt y mira lo que puedes crear hoy.

Compartir este artículo

Elige tu idioma