Grok 4.7 salió el 21 de septiembre de 2026. Claude Opus 5.5 llegó un día después. Uno cobra 2 $ por millón de tokens de entrada y 6 $ por millón de tokens de salida. El otro cobra 4 $ y 20 $. Una página de precios muestra esa diferencia en dos segundos, pero no puede decirte si el gasto extra se traduce en mejores resultados para tus tareas. Este desglose pone en paralelo las cifras del proveedor, las pruebas independientes de Vals AI y un índice público de inteligencia, junto con ambas tarifas, y las convierte en un cálculo de costos sencillo que puedes comprobar tú mismo.

La respuesta corta
Claude Opus 5.5 es el modelo más sólido en la mayoría de las pruebas, y Grok 4.7 es mucho más barato. En el duelo directo de Vals AI, Opus 5.5 quedó por delante en 20 de 22 benchmarks compartidos, mientras que Grok 4.7 lideró en 2. En el Intelligence Index independiente (versión 4.3.2), Opus 5.5 obtiene 58 puntos y ocupa el primer lugar entre 225 modelos. Grok 4.7 obtiene 46 y ocupa el puesto 29, lo que sigue estando muy por encima de la mediana de 26 de los modelos comparables.
| Especificación | Grok 4.7 | Claude Opus 5.5 |
|---|
| Fecha de lanzamiento | 21 de septiembre de 2026 | 22 de septiembre de 2026 |
| Precio de entrada (por 1M de tokens) | 2,00 $ | 4,00 $ |
| Precio de salida (por 1M de tokens) | 6,00 $ | 20,00 $ |
| Ventana de contexto | 500K tokens | 1M de tokens |
| Salida máxima | No publicada | 128K tokens |
| Intelligence Index | 46 | 58 |
| Velocidad de salida | 72,6 tokens por segundo | 95,3 tokens por segundo |
| Tipos de entrada | Texto (no se informa entrada de imágenes) | Texto e imágenes |
El acceso también es distinto. Grok 4.7 está disponible a través de la API de Grok, Cursor y un nivel gratuito en Grok Build, pero no hay un nivel gratuito de API. Opus 5.5 funciona en la API de Claude, Amazon Bedrock, Google Cloud y Microsoft Foundry, con una fecha de corte de conocimiento de junio de 2026. Su razonamiento es adaptativo y está siempre activo, con cinco niveles de esfuerzo: low, medium, high, xhigh y max.
💡 Regla práctica: Grok 4.7 alcanza cerca del 82 % de la puntuación del índice Vals de Opus 5.5 (54,95 frente a 66,97) por aproximadamente un tercio a menos de la mitad de la factura. Si una respuesta incorrecta te cuesta una hora de corrección, el sobrecosto de Opus suele amortizarse. Si estás resumiendo, redactando o etiquetando en volumen, Grok es el gasto más inteligente.
Precio por millón de tokens
Tarifas de entrada y salida
Ambos modelos cobran por token, y las tablas de precios se parecen hasta que lees la línea de salida.
| Tipo de precio (por 1M de tokens) | Grok 4.7 | Claude Opus 5.5 |
|---|
| Entrada | 2,00 $ | 4,00 $ |
| Lectura de entrada en caché | 0,50 $ | 0,20 $ |
| Salida | 6,00 $ | 20,00 $ |
| Entrada / salida por lotes | No listado | 2 $ / 10 $ |
| Prompts de más de 200K tokens | 4 $ de entrada, 1 $ en caché, 12 $ de salida | No figura ningún nivel para prompts largos |
La diferencia está en la salida. La entrada cuesta 2 veces más en Opus 5.5, pero la salida cuesta 3,3 veces más. Las lecturas en caché van en sentido contrario: Opus 5.5 cobra 0,20 $ frente a los 0,50 $ de Grok, lo que lo convierte en la opción más barata para los agentes que releen constantemente el mismo contexto largo.

Caché y prompts largos
Las tarifas estrella de Grok 4.7, 2 $ y 6 $, solo se aplican mientras tu prompt no supere los 200 000 tokens. A partir de ahí, cada tarifa se duplica: 4 $ de entrada, 1 $ en caché y 12 $ de salida. Como su ventana de contexto es de 500K, la zona barata abarca solo el primer 40 % de ella.
Opus 5.5 tiene un precio un 20 % inferior al de Opus 5, con escrituras en caché a 5 $ por cinco minutos o 8 $ por una hora. Existe una vista previa de modo rápido en la API de Claude a 8 $ de entrada y 40 $ de salida. Una trampa: cambiar el nivel de esfuerzo a mitad de una sesión invalida la caché de prompts, así que las lecturas baratas en caché se convierten en entrada a precio completo sin que te des cuenta. Elige un nivel de esfuerzo y mantenlo.
Cuánto cuesta una carga de trabajo real
Precios de lista para tres cargas de trabajo diarias, sin descuentos por caché ni por lotes:
| Carga de trabajo diaria | Grok 4.7 | Claude Opus 5.5 | Sobrecosto de Opus |
|---|
| Resúmenes de soporte: 10M de entrada, 1M de salida | 26 $ | 60 $ | 2,3 veces |
| Agente de programación: 5M de entrada, 5M de salida | 40 $ | 120 $ | 3,0 veces |
| Redacción de informes: 1M de entrada, 3M de salida | 20 $ | 64 $ | 3,2 veces |
Cuanto más dependa tu carga de trabajo de la salida, más se amplía la diferencia. Vals AI midió ejecuciones reales en lugar de fórmulas. Ejecutar el índice Vals costó 32,14 $ en Opus 5.5 y 12,12 $ en Grok 4.7, unas 2,7 veces más. La prueba Finance Agent costó 9,22 $ frente a 2,72 $. ProofBench quedó casi igualado, con 0,96 $ frente a 0,79 $.

La verbosidad tampoco salva la factura de Grok. La ejecución del Intelligence Index independiente registró 240M de tokens de salida de Grok 4.7, frente a una mediana de 81M para modelos comparables. Opus 5.5 produjo 260M. Ambos hablan mucho, así que la diferencia de precio por token se traslada casi directamente a tu factura.
Benchmarks lado a lado
Toma cada cifra de abajo junto con su fuente. Algunas puntuaciones las informa el proveedor, otras proceden de pruebas independientes, y el mismo modelo puede quedar en posiciones muy distintas según quién haga la prueba.
Programación y trabajo en terminal
En programación, los dos modelos se separan con más claridad.
| Benchmark | Grok 4.7 | Claude Opus 5.5 |
|---|
| Terminal-Bench 4.0 (informado por el proveedor) | 38,0 % | 66,4 % |
| Terminal-Bench 4.0 (Vals AI) | 28,79 % | 65,15 % |
| CursorBench 4.0 | 46,3 % | 57,8 % |
| Code Migration (Vals AI) | 44,82 % | 66,65 % |
| IOI (Vals AI) | 57,72 % | 95,06 % |
| Vibe Code Bench v1.1 (Vals AI) | 86,17 % | 90,29 % |
| SRE Bench (Vals AI) | 3,82 % | 33,59 % |
Promediando las pruebas de programación de Vals AI, Opus 5.5 obtiene 67,13 % y Grok 4.7 obtiene 43,60 %. El resultado más cerrado es Vibe Code Bench, con 86,17 % frente a 90,29 %. Grok 4.7 también registra 71,0 % en DeepSWE v1.1 con esfuerzo alto, una prueba para la que no encontré ninguna cifra de Opus 5.5. Opus 5.5 suma 54,4 % en FrontierCode v1.1, 1,1 puntos por delante de GPT-6 Astra.

Razonamiento y trabajo de conocimiento
La brecha en razonamiento es igual de visible. En el índice Vals, Opus 5.5 obtiene 66,97 % frente al 54,95 % de Grok. ProofBench v1.1, que Vals AI clasifica en matemáticas, es el resultado más desequilibrado de la tabla: 100 % frente a 26 %. Las pruebas de ciencia siguen el mismo patrón, con Opus 5.5 promediando 58,65 % y Grok 4.7 promediando 34,83 %.
Las tablas de lanzamiento de Opus 5.5 añaden algunos resultados más: 67,7 % en Humanity's Last Exam con herramientas, un Elo de 1846 en GDPval-AA v2.1 para trabajo del conocimiento, 81,8 % en OSWorld 2.0, que mide el uso del equipo, y 89,0 % en Chartography para la lectura de gráficos. Las notas de lanzamiento de Grok 4.7 se apoyan en otras pruebas: 64,0 % en EEBench para ingeniería eléctrica y 56,7 % en HealthBench Professional.

Dónde gana Grok 4.7
Las dos victorias de Grok en la comparación de Vals AI son concretas:
- Harvey's Legal Agent: 12,50 % para Grok 4.7 frente a 3,75 % para Opus 5.5. Ambas puntuaciones son bajas, así que tómalo como una pista sobre una prueba muy difícil.
- CyberBench v1.1: 69,46 % frente a 55,36 %, una diferencia de 14 puntos.
Grok también supera ligeramente el promedio de la categoría legal (29,81 % frente a 27,12 %), aunque Opus 5.5 gana en Legal Research Bench, 50,48 % frente a 47,12 %. En salud el empate es casi total: 70,61 % para Opus y 69,47 % para Grok.
Contexto, velocidad y límites de salida

500K frente a 1M de tokens
El listado independiente del Intelligence Index sitúa la ventana de Grok 4.7 en 500 000 tokens, unas 750 páginas de texto. La documentación de lanzamiento de Grok no incluye esa cifra, así que compruébala con tu proveedor antes de construir sobre ella. Opus 5.5 ofrece 1 millón de tokens, unas 1500 páginas, con hasta 128K tokens de salida por respuesta. Los trabajos por lotes pueden llegar a 300K tokens de salida con un encabezado beta.
Recuerda el doble precio de Grok a partir de 200K. Un trabajo que envíe 400K tokens de contratos a Grok cae en el nivel más caro, mientras que no se lista ningún nivel para prompts largos en Opus 5.5.

Velocidad y verbosidad
En velocidad de salida pura, Opus 5.5 transmite a 95,3 tokens por segundo y Grok 4.7 a 72,6, por debajo de la mediana de 78,5 de los modelos comparables. El tiempo hasta el primer token es un asunto más enredado. El mismo índice sitúa a Grok 4.7 en 73,9 segundos con su ajuste de razonamiento xhigh. La cifra de Opus 5.5 con esfuerzo max es de 731 segundos, lo que parece un valor atípico, así que no me fiaría de ella.
El tiempo real de tareas completas fue en ambos sentidos en las pruebas de Vals AI. Grok 4.7 terminó el índice Vals en 35 minutos frente a 1 hora y 19 minutos de Opus, y la prueba Finance Agent en 15 minutos frente a 33. Opus ganó en ProofBench, con 5 minutos y 51 segundos frente a los 12 minutos y 47 segundos de Grok. Qué modelo termina primero depende de la tarea.
Cuál encaja con tu trabajo

Elige Grok 4.7 cuando
- Procesas grandes volúmenes de texto y la factura es la principal limitación.
- Tus prompts se mantienen por debajo de 200K tokens, donde rigen las tarifas de 2 $ y 6 $.
- El trabajo son tareas de agentes legales o pruebas de seguridad, donde logró sus dos victorias.
- Puedes aceptar un techo más bajo en ejecuciones largas de programación agéntica.
Elige Opus 5.5 cuando
- Ejecutas agentes, tareas de terminal o migraciones de código en las que un paso fallido es caro.
- Introduces documentos largos de más de 500K tokens, o necesitas entrada de imágenes.
- Dependes del caché de prompts, ya que las lecturas en caché cuestan 0,20 $ por millón.
- Quieres la puntuación más alta del Intelligence Index y puedes presupuestarla.
Muchos equipos acabarán usando los dos. Envía el trabajo masivo, como etiquetado, primeros borradores de resúmenes y extracción rutinaria, a Grok 4.7, y escala los casos difíciles a Opus 5.5: ejecuciones largas de agentes, demostraciones y migraciones. Un test fallido o una puntuación de confianza baja puede activar el traspaso. Haciendo un cálculo rápido, enviar el 75 % del trabajo del índice Vals a Grok y el 25 % a Opus costaría unos 17 $ en lugar de 32,14 $.
💡 Revisa antes de cambiar: Opus 5.5 rechaza varios ajustes en los que se apoyaban las integraciones más antiguas de Claude. Desactivar el razonamiento devuelve un error 400, forzar el uso de herramientas (tool_choice configurado en any o una herramienta con nombre) devuelve errores, y la herramienta computer_20251124 más antigua se rechaza. Anthropic además redirige la mayoría de las solicitudes de ciberseguridad a Opus 4.8, así que prueba el trabajo de seguridad directamente en lugar de asumir que funciona.
Por qué los benchmarks engañan
Fíjate en la puntuación de Grok 4.7 en Terminal-Bench 4.0. El proveedor informa 38,0 %. Vals AI midió 28,79 %. La ejecución del Intelligence Index independiente midió 26 %. Mismo modelo, mismo nombre de benchmark, una diferencia de 12 puntos según la configuración de la prueba, el ajuste de esfuerzo y quién la ejecutó.
Opus 5.5 también tiene sus matices. Su esfuerzo por defecto es medium, pero las puntuaciones destacadas proceden de esfuerzo xhigh o max, que cuestan más y tardan más. El índice independiente además compara Opus con esfuerzo max frente a Grok con xhigh, así que los dos están en ajustes distintos. La propia Anthropic advierte de que los márgenes de los benchmarks se han vuelto un predictor menos fiable de las diferencias reales en este nivel de capacidad.
Así que haz tu propia prueba. Lleva una tarde:
- Elige 20 prompts reales de tu carga de trabajo real, no ejemplos de juguete.
- Ejecuta cada uno en ambos modelos con el nivel de esfuerzo que usarías en producción.
- Registra el costo por tarea, los reintentos y el tiempo real transcurrido.
- Puntúa las respuestas a ciegas, sin saber qué modelo escribió cada una.
- Calcula el costo por respuesta aceptada, no el costo por token.
Prueba modelos similares en Picasso IA
Ni Grok 4.7 ni Claude Opus 5.5 aparecen en el catálogo de Picasso IA en el momento de escribir esto. Las opciones más cercanas están disponibles hoy, y puedes usarlas sin credenciales de API ni configuración.
Modelos disponibles ahora
| Modelo | Fortaleza | Enlace |
|---|
| Grok 4 | Razonamiento paso a paso en preguntas de varias partes | Grok 4 |
| Claude Opus 4.7 | Código, lectura de imágenes, conversaciones largas | Claude Opus 4.7 |
| Claude Fable 5 | Tareas complejas de programación | Claude Fable 5 |
| Claude Sonnet 5 | Trabajo automatizado de programación | Claude Sonnet 5 |
Otras opciones para una prueba de tres modelos son GPT 5.6 Sol, Gemini 3.1 Pro y Kimi K2.6.
Usa Claude Opus 4.7 en Picasso IA
- Abre la página de Claude Opus 4.7.
- Escribe tu pregunta o pega tu código en el campo Prompt. Es la única entrada obligatoria.
- Añade un System Prompt si quieres un rol fijo, como "Eres un revisor de código".
- Deja Max Tokens en 8.192 para respuestas largas, o bájalo para respuestas cortas.
- Sube una captura de pantalla o un diagrama si tu pregunta depende de ello. Las imágenes se escalan a 0,5 megapíxeles por defecto para ahorrar tiempo.
- Ejecuta el modelo y sigue refinando con prompts de seguimiento.
Usa Grok 4 en Picasso IA
- Abre la página de Grok 4.
- Escribe tu pregunta en Prompt. Grok 4 rinde mejor en problemas de varios pasos.
- Deja Temperature en el valor por defecto de 0,1 para respuestas enfocadas, o súbelo para generar ideas.
- Sube Max Tokens por encima del valor por defecto de 2.048 si las respuestas se cortan.
- Ajusta Presence Penalty y Frequency Penalty solo cuando la salida empiece a repetirse.
💡 Consejo: Envía el mismo prompt a ambos modelos y pega las respuestas una al lado de la otra. Diez minutos de eso te dicen más que otra tabla de benchmarks.
Crea tus propias imágenes en Picasso IA

Deja que el modelo escriba tus prompts
Un buen modelo de lenguaje también es un buen redactor de prompts. Pídele a Claude Opus 4.7 o a Grok 4 que redacte tus prompts de imagen y de video, y luego pega los resultados en un generador:
Escribe cinco prompts fotorrealistas de imagen para una entrada de blog que compare dos modelos de IA. Cada prompt necesita un sujeto, una ubicación, la dirección de la luz, un ángulo de cámara y un objetivo. Mantén cada prompt por debajo de 70 palabras.
La estructura importa: sujeto, escenario, luz, cámara, objetivo. Ese orden le da a los modelos de imagen los detalles que necesitan para producir resultados nítidos y naturales.
Modelos de imagen y video para probar
Para imágenes, prueba Seedream 4.5, GPT Image 2, Flux 2 Pro o Nano Banana Pro. Para clips cortos, Seedance 2.0, Veo 3.1 y Kling v3 Video convierten un prompt o una imagen fija en movimiento.
Ahora te toca a ti. Abre Picasso IA, pídele a un modelo de lenguaje tres prompts y pásalos por un modelo de imagen. Elige tu resultado favorito, anímalo con un modelo de video y compara cómo cada modelo interpreta tus instrucciones. La forma más rápida de saber qué modelo te conviene es poner tu propio prompt delante de ellos.