Grok 4.7 est sorti le 21 septembre 2026. Claude Opus 5.5 l’a suivi un jour plus tard. Le premier facture 2 $ par million de tokens d’entrée et 6 $ par million de tokens de sortie. L’autre facture 4 $ et 20 $. Une page de tarifs montre cet écart en deux secondes, mais elle ne peut pas vous dire si la dépense supplémentaire produit un meilleur travail sur vos tâches. Cette analyse place côte à côte les chiffres des fournisseurs, les exécutions indépendantes de Vals AI, un indice d’intelligence public et les deux grilles tarifaires, puis les transforme en calcul de coût simple que vous pouvez vérifier vous-même.

En bref
Claude Opus 5.5 est le modèle le plus performant sur la plupart des tests, et Grok 4.7 est nettement moins cher. Dans le face à face de Vals AI, Opus 5.5 finit devant sur 20 des 22 benchmarks communs, tandis que Grok 4.7 prend la tête sur 2. Sur l’Intelligence Index indépendant (version 4.3.2), Opus 5.5 obtient 58 et se classe premier sur 225 modèles. Grok 4.7 obtient 46 et se classe 29e, ce qui reste bien au-dessus de la médiane de 26 pour les modèles comparables.
| Caractéristique | Grok 4.7 | Claude Opus 5.5 |
|---|
| Date de sortie | 21 septembre 2026 | 22 septembre 2026 |
| Prix en entrée (par million de tokens) | 2,00 $ | 4,00 $ |
| Prix en sortie (par million de tokens) | 6,00 $ | 20,00 $ |
| Fenêtre de contexte | 500K tokens | 1M tokens |
| Sortie maximale | Non communiquée | 128K tokens |
| Intelligence Index | 46 | 58 |
| Vitesse de sortie | 72,6 tokens par seconde | 95,3 tokens par seconde |
| Types d’entrée | Texte (aucune entrée d’image signalée) | Texte et images |
L’accès diffère aussi. Grok 4.7 est disponible via l’API Grok, Cursor et une offre gratuite dans Grok Build, mais il n’existe pas de palier gratuit d’API. Opus 5.5 fonctionne sur l’API Claude, Amazon Bedrock, Google Cloud et Microsoft Foundry, avec une date de coupure des connaissances en juin 2026. Sa réflexion est adaptative et toujours active, avec cinq niveaux d’effort : low, medium, high, xhigh et max.
💡 Règle empirique : Grok 4.7 atteint environ 82 % du score Vals Index d’Opus 5.5 (54,95 contre 66,97) pour une facture d’environ un tiers à moins de la moitié de celle d’Opus. Si une mauvaise réponse vous coûte une heure de nettoyage, la prime d’Opus se rentabilise en général. Si vous résumez, rédigez ou taguez en volume, Grok est le choix le plus judicieux.
Prix par million de tokens
Tarifs en entrée et en sortie
Les deux modèles facturent au token, et les grilles se ressemblent jusqu’à ce qu’on lise la ligne de sortie.
| Type de prix (par million de tokens) | Grok 4.7 | Claude Opus 5.5 |
|---|
| Entrée | 2,00 $ | 4,00 $ |
| Lecture d’entrée en cache | 0,50 $ | 0,20 $ |
| Sortie | 6,00 $ | 20,00 $ |
| Entrée / sortie par lots | Non indiqué | 2 $ / 10 $ |
| Prompts de plus de 200K tokens | 4 $ en entrée, 1 $ en cache, 12 $ en sortie | Aucun palier pour les prompts longs indiqué |
C’est sur la sortie que se creuse l’écart. L’entrée coûte 2 fois plus cher sur Opus 5.5, mais la sortie coûte 3,3 fois plus cher. Les lectures en cache vont dans l’autre sens : Opus 5.5 facture 0,20 $ contre 0,50 $ pour Grok, ce qui en fait le choix le moins cher pour les agents qui relisent sans cesse le même long contexte.

Cache et prompts longs
Les tarifs phares de Grok 4.7, 2 $ et 6 $, ne s’appliquent que tant que votre prompt reste à 200 000 tokens ou moins. Au-delà, chaque tarif double : 4 $ en entrée, 1 $ en cache et 12 $ en sortie. Comme sa fenêtre de contexte est de 500K, la zone bon marché ne couvre que les 40 % premiers.
Opus 5.5 est facturé 20 % de moins qu’Opus 5, avec des écritures en cache à 5 $ pour cinq minutes ou 8 $ pour une heure. Un aperçu du mode rapide est disponible sur l’API Claude à 8 $ en entrée et 40 $ en sortie. Piège à éviter : changer le niveau d’effort au milieu d’une session invalide le cache de prompt, si bien que des lectures de cache bon marché deviennent discrètement de l’entrée au plein tarif. Choisissez un niveau d’effort et gardez-le.
Le coût d’une charge réelle
Prix catalogue pour trois charges quotidiennes, sans remise de cache ni de lot :
| Charge quotidienne | Grok 4.7 | Claude Opus 5.5 | Surcoût d’Opus |
|---|
| Résumés de support : 10 M en entrée, 1 M en sortie | 26 $ | 60 $ | 2,3x |
| Agent de codage : 5 M en entrée, 5 M en sortie | 40 $ | 120 $ | 3,0x |
| Rédaction de rapports : 1 M en entrée, 3 M en sortie | 20 $ | 64 $ | 3,2x |
Plus votre charge penche vers la sortie, plus l’écart se creuse. Vals AI a mesuré de vraies exécutions plutôt que des formules. Faire tourner le Vals Index a coûté 32,14 $ sur Opus 5.5 et 12,12 $ sur Grok 4.7, soit environ 2,7 fois plus. Le test Finance Agent a coûté 9,22 $ contre 2,72 $. ProofBench est presque à égalité, avec 0,96 $ contre 0,79 $.

La verbosité ne sauvera pas non plus la facture de Grok. L’exécution indépendante de l’Intelligence Index a enregistré 240M de tokens de sortie pour Grok 4.7, contre une médiane de 81M pour les modèles comparables. Opus 5.5 en a produit 260M. Les deux sont bavards, si bien que l’écart de prix par token se répercute presque entièrement sur votre facture.
Benchmarks côte à côte
Lisez chaque chiffre ci-dessous avec sa source. Certains scores sont publiés par le fournisseur, d’autres proviennent d’exécutions indépendantes, et un même modèle peut obtenir des résultats très différents selon qui a lancé le test.
Codage et travail en terminal
C’est en codage que les deux modèles se distinguent le plus nettement.
| Benchmark | Grok 4.7 | Claude Opus 5.5 |
|---|
| Terminal-Bench 4.0 (publié par le fournisseur) | 38,0 % | 66,4 % |
| Terminal-Bench 4.0 (Vals AI) | 28,79 % | 65,15 % |
| CursorBench 4.0 | 46,3 % | 57,8 % |
| Migration de code (Vals AI) | 44,82 % | 66,65 % |
| IOI (Vals AI) | 57,72 % | 95,06 % |
| Vibe Code Bench v1.1 (Vals AI) | 86,17 % | 90,29 % |
| SRE Bench (Vals AI) | 3,82 % | 33,59 % |
Sur l’ensemble des tests de codage de Vals AI, Opus 5.5 obtient 67,13 % et Grok 4.7 43,60 %. Le seul résultat serré est Vibe Code Bench, avec 86,17 % contre 90,29 %. Grok 4.7 affiche aussi 71,0 % sur DeepSWE v1.1 au niveau d’effort élevé, un test pour lequel je n’ai trouvé aucun chiffre pour Opus 5.5. Opus 5.5 ajoute 54,4 % sur FrontierCode v1.1, soit 1,1 point devant GPT-6 Astra.

Raisonnement et travail intellectuel
L’écart en raisonnement est tout aussi visible. Sur le Vals Index, Opus 5.5 obtient 66,97 % contre 54,95 % pour Grok. ProofBench v1.1, que Vals AI classe dans les mathématiques, est le résultat le plus déséquilibré du tableau : 100 % contre 26 %. Les tests scientifiques suivent le même schéma, avec une moyenne de 58,65 % pour Opus 5.5 et de 34,83 % pour Grok 4.7.
Les tableaux de lancement d’Opus 5.5 ajoutent quelques résultats : 67,7 % sur Humanity’s Last Exam avec outils, un Elo de 1 846 sur GDPval-AA v2.1 pour le travail intellectuel, 81,8 % sur OSWorld 2.0 pour l’utilisation de l’ordinateur, et 89,0 % sur Chartography pour la lecture de graphiques. Les notes de lancement de Grok 4.7 s’appuient sur d’autres tests : 64,0 % sur EEBench pour le génie électrique et 56,7 % sur HealthBench Professional.

Les victoires de Grok 4.7
Les deux victoires de Grok dans la comparaison Vals AI sont précises :
- Harvey’s Legal Agent : 12,50 % pour Grok 4.7 contre 3,75 % pour Opus 5.5. Les deux scores sont faibles, donc considérez-le comme une avance sur un test très difficile.
- CyberBench v1.1 : 69,46 % contre 55,36 %, soit un écart de 14 points.
Grok devance aussi de peu la moyenne de la catégorie juridique (29,81 % contre 27,12 %), bien qu’Opus 5.5 remporte Legal Research Bench avec 50,48 % contre 47,12 %. La santé est presque à égalité, avec 70,61 % pour Opus et 69,47 % pour Grok.
Contexte, vitesse et limites de sortie

500K contre 1M tokens
La fiche de l’Intelligence Index indépendant fixe la fenêtre de Grok 4.7 à 500 000 tokens, soit environ 750 pages de texte. La documentation de lancement de Grok ne donne pas ce chiffre, donc vérifiez-le auprès de votre fournisseur avant de construire autour. Opus 5.5 offre 1 million de tokens, soit environ 1 500 pages, avec jusqu’à 128K tokens de sortie par réponse. Les tâches par lots peuvent aller jusqu’à 300K tokens de sortie avec un en-tête bêta.
Rappelez-vous que le tarif de Grok double à partir de 200K. Une tâche qui envoie 400K tokens de contrats à Grok tombe dans le palier supérieur, alors qu’aucun palier pour les prompts longs n’est indiqué pour Opus 5.5.

Vitesse et verbosité
Sur la vitesse brute de sortie, Opus 5.5 diffuse à 95,3 tokens par seconde et Grok 4.7 à 72,6, ce qui se situe sous la médiane de 78,5 pour les modèles comparables. Le temps jusqu’au premier token raconte une histoire plus confuse. Le même indice donne 73,9 secondes pour Grok 4.7 à son réglage de raisonnement xhigh. Son chiffre pour Opus 5.5 au niveau d’effort max est de 731 secondes, ce qui ressemble à une valeur aberrante, donc je ne m’y fierais pas.
Le temps réel des tâches complètes a varié d’un cas à l’autre dans les exécutions Vals AI. Grok 4.7 a terminé le Vals Index en 35 minutes contre 1 heure 19 minutes pour Opus, et le test Finance Agent en 15 minutes contre 33. Opus a remporté ProofBench, en 5 minutes 51 secondes contre 12 minutes 47 secondes pour Grok. Le modèle qui finit en premier dépend de la tâche.
Lequel convient à votre travail

Choisissez Grok 4.7 si
- Vous traitez de gros volumes de texte et la facture est la principale contrainte.
- Vos prompts restent sous 200K tokens, seuil où les tarifs de 2 $ et 6 $ s’appliquent.
- Il s’agit de tâches d’agents juridiques ou de tests de sécurité, où il a remporté ses deux victoires.
- Vous acceptez un plafond plus bas sur les longues tâches de codage agentiques.
Choisissez Opus 5.5 si
- Vous exécutez des agents, des tâches de terminal ou des migrations de code où une étape ratée coûte cher.
- Vous injectez de longs documents au-delà de 500K tokens, ou vous avez besoin d’une entrée image.
- Vous vous appuyez sur le prompt caching, car les lectures de cache coûtent 0,20 $ par million.
- Vous voulez le meilleur score à l’Intelligence Index et pouvez le budgéter.
Beaucoup d’équipes finiront par utiliser les deux. Confiez le travail en volume, comme le tagging, les premières ébauches de résumés et l’extraction courante, à Grok 4.7, puis transmettez les cas difficiles à Opus 5.5 : longues exécutions d’agents, démonstrations et migrations. Un test échoué ou un score de confiance faible peut déclencher le passage de relais. Sur un calcul approximatif, envoyer 75 % du travail du Vals Index à Grok et 25 % à Opus coûterait environ 17 $ au lieu de 32,14 $.
💡 Vérifiez avant de changer : Opus 5.5 rejette plusieurs réglages sur lesquels s’appuyaient les anciennes intégrations de Claude. Désactiver la réflexion renvoie une erreur 400, l’usage forcé d’un outil (tool_choice réglé sur any ou sur un outil nommé) renvoie des erreurs, et l’ancien outil computer_20251124 est rejeté. Anthropic redirige aussi la plupart des demandes de cybersécurité vers Opus 4.8, donc testez directement vos travaux de sécurité au lieu de le supposer.
Pourquoi les benchmarks induisent en erreur
Regardez le score de Grok 4.7 sur Terminal-Bench 4.0. Le fournisseur annonce 38,0 %. Vals AI a mesuré 28,79 %. L’exécution indépendante de l’Intelligence Index a mesuré 26 %. Même modèle, même nom de benchmark, un écart de 12 points selon le harnais, le réglage d’effort et la personne qui a lancé le test.
Opus 5.5 a aussi ses réserves. Son effort par défaut est medium, mais les scores phares proviennent des niveaux xhigh ou max, qui coûtent plus cher et prennent plus de temps. L’index indépendant compare aussi Opus au niveau max à Grok au niveau xhigh, si bien que les deux se trouvent sur des réglages différents. Anthropic lui-même met en garde : à ce niveau de capacité, les écarts sur les benchmarks sont devenus un indicateur moins fiable des différences réelles.
Faites donc votre propre test. Cela prend un après-midi :
- Choisissez 20 prompts réels issus de votre charge de travail, pas des exemples de jouet.
- Lancez chacun sur les deux modèles au niveau d’effort que vous utiliseriez en production.
- Notez le coût par tâche, les nouvelles tentatives et le temps réel écoulé.
- Évaluez les sorties à l’aveugle, sans savoir quel modèle a écrit quoi.
- Calculez le coût par réponse acceptée, et non le coût par token.
Essayez des modèles similaires sur Picasso IA
Ni Grok 4.7 ni Claude Opus 5.5 ne figurent dans le catalogue de Picasso IA à la date de rédaction. Les options les plus proches sont disponibles aujourd’hui, et vous pouvez les utiliser sans identifiants d’API ni configuration.
Modèles disponibles dès maintenant
| Modèle | Point fort | Lien |
|---|
| Grok 4 | Raisonnement pas à pas sur des questions en plusieurs parties | Grok 4 |
| Claude Opus 4.7 | Code, lecture d’images, longues conversations | Claude Opus 4.7 |
| Claude Fable 5 | Tâches de codage complexes | Claude Fable 5 |
| Claude Sonnet 5 | Travail de codage automatisé | Claude Sonnet 5 |
D’autres options pour un test à trois incluent GPT 5.6 Sol, Gemini 3.1 Pro et Kimi K2.6.
Utiliser Claude Opus 4.7 sur Picasso IA
- Ouvrez la page Claude Opus 4.7.
- Saisissez votre question ou collez votre code dans le champ Prompt. C’est la seule entrée obligatoire.
- Ajoutez un System Prompt si vous voulez un rôle fixe, comme « Vous êtes un relecteur de code ».
- Laissez Max Tokens à 8 192 pour les réponses longues, ou baissez-le pour les réponses courtes.
- Importez une capture d’écran ou un schéma si votre question en dépend. Les images sont redimensionnées à 0,5 mégapixel par défaut pour gagner du temps.
- Lancez-le, puis continuez à l’affiner avec des prompts de suivi.
Utiliser Grok 4 sur Picasso IA
- Ouvrez la page Grok 4.
- Écrivez votre question dans Prompt. Les problèmes en plusieurs étapes sont ceux où Grok 4 excelle le plus.
- Gardez Temperature à la valeur par défaut de 0,1 pour des réponses ciblées, ou augmentez-la pour le brainstorming.
- Augmentez Max Tokens au-delà de la valeur par défaut de 2 048 si les réponses sont coupées.
- Ajustez Presence Penalty et Frequency Penalty seulement lorsque la sortie commence à se répéter.
💡 Astuce : Envoyez le même prompt aux deux modèles et collez les réponses côte à côte. Dix minutes de ce test vous en apprendront plus qu’un autre tableau de benchmarks.
Créez vos propres images sur Picasso IA

Laissez le modèle écrire vos prompts
Un bon grand modèle de langage est aussi un bon rédacteur de prompts. Demandez à Claude Opus 4.7 ou à Grok 4 de rédiger vos prompts d’image et de vidéo, puis collez les résultats dans un générateur :
Rédigez cinq prompts d’image photoréalistes pour un article de blog comparant deux modèles d’IA. Chaque prompt doit préciser un sujet, un lieu, la direction de la lumière, un angle de caméra et un objectif. Gardez chaque prompt sous 70 mots.
La structure compte : sujet, décor, lumière, caméra, objectif. Cet ordre donne aux modèles d’image les détails dont ils ont besoin pour produire des résultats nets et naturels.
Modèles d’image et de vidéo à essayer
Pour les images, essayez Seedream 4.5, GPT Image 2, Flux 2 Pro ou Nano Banana Pro. Pour les courts clips, Seedance 2.0, Veo 3.1 et Kling v3 Video transforment un prompt ou une image fixe en mouvement.
À vous de jouer. Ouvrez Picasso IA, demandez à un modèle de langage trois prompts, et passez-les dans un modèle d’image. Choisissez votre résultat préféré, animez-le avec un modèle vidéo, et comparez la façon dont chaque modèle lit vos consignes. Le moyen le plus rapide de savoir quel modèle vous convient est de lui soumettre votre propre prompt.