Grok 4.7 : date de sortie, prix, fenêtre de contexte et benchmarks

Grok 4.7 est sorti le 21 septembre 2026 avec les mêmes tarifs de tokens que Grok 4.6, soit 2 $ et 6 $, une fenêtre de contexte de 500 000 tokens et des scores de codage plus élevés. Découvrez les faits de sortie, les paliers de prix, les benchmarks publiés par xAI et ce que les tests indépendants ont mesuré sur le coût par tâche.

Grok 4.7 : date de sortie, prix, fenêtre de contexte et benchmarks
Cristian Da Conceicao
Fondateur de Picasso IA

Grok 4.7 est sorti le 21 septembre 2026, et la première chose remarquée a été ce qui n’a pas changé : le prix. Après un lancement repoussé par rapport aux dates cibles initiales, xAI (désormais rebaptisée SpaceXAI) a conservé les tarifs de Grok 4.6, soit 2 $ par million de tokens en entrée et 6 $ par million de tokens en sortie, ainsi que la fenêtre de contexte de 500 000 tokens. Ce qui a changé, c’est l’effort que le modèle fournit sur chaque tâche, et c’est là que se joue la véritable question du coût.

Cette page réunit au même endroit la date de sortie, chaque palier de prix, les limites de la fenêtre de contexte, les scores de benchmarks publiés par xAI et les chiffres mesurés par les testeurs indépendants. Lorsque les sources divergent, vous verrez les deux valeurs. Un score publié par le fournisseur reste une affirmation tant qu’un tiers ne l’a pas reproduit : chaque chiffre ci-dessous indique donc qui l’a produit.

💡 Lecture rapide : mêmes tarifs de tokens que Grok 4.6, même fenêtre de 500K, scores plus élevés sur les sept benchmarks de xAI, et environ 2,25 fois plus de tokens de sortie par tâche. C’est le coût par tâche qu’il faut surveiller, pas le tarif par token.

Date de sortie de Grok 4.7

Ce qui a été lancé le 21 septembre

xAI a publié Grok 4.7 le 21 septembre 2026, annoncé depuis le compte SpaceXAI vers 16 h 17 UTC. Son prédécesseur, Grok 4.6, est sorti le 12 août 2026 : seulement 40 jours séparent donc les deux modèles, même si certaines sources décrivent 4.7 comme plus tardif que les dates cibles précédentes. Les informations de base tiennent dans un seul tableau.

DétailGrok 4.7
Date de sortie21 septembre 2026
Modèle précédentGrok 4.6, 12 août 2026
ID de modèle APIgrok-4.7
EntréeTexte et images
SortieTexte
Effort de raisonnementlow, medium, high (par défaut), xhigh
Date limite des connaissancesmai ou juin 2026, selon les sources

Un intégrateur signale que l’orthographe avec tiret grok-4-7 est rejetée : utilisez donc l’ID avec point dans vos appels API. Sur le plan technique, xAI décrit un modèle de base plus grand, avec un entraînement par renforcement prolongé sur des tâches qui durent des heures, ainsi que de meilleures habitudes pour vérifier son propre travail et gérer les longs contextes.

Calendrier mural avec une date de fin septembre entourée au marqueur rouge sur un bureau

Où l’utiliser

Grok 4.7 est arrivé chez les développeurs par plusieurs canaux dès le premier jour :

  • API xAI : disponible dès le lancement sous l’ID grok-4.7.
  • Cursor : ajouté immédiatement, y compris une variante payante plus rapide.
  • Grok Build : le harnais de codage propre à xAI, sur lequel plusieurs des tests de benchmarks publiés ont été réalisés.
  • GitHub Copilot : déployé progressivement après le lancement.
  • OpenRouter et Vercel AI Gateway : les deux l’ont référencé pour le routage.
  • Plateformes cloud : Bedrock, Model Garden et Foundry ont accusé du retard par rapport à l’API xAI au lancement.

Les limites de débit annoncées sont de 150 requêtes par seconde et de 50 millions de tokens par minute, ce qui est assez généreux pour que la plupart des équipes atteignent leur budget bien avant le plafond.

Prix de Grok 4.7 par million de tokens

Tarifs standard et pour les longs prompts

La grille tarifaire est identique à celle de Grok 4.6. Le tarif dépend de la longueur de votre prompt : dès que vous franchissez le seuil, la requête entière est facturée au palier supérieur, et pas seulement les tokens supplémentaires.

Taille du promptEntréeEntrée en cacheSortie
Moins de 200K tokens2,00 $0,50 $6,00 $
200K tokens et plus4,00 $1,00 $12,00 $

Tous les prix sont exprimés par million de tokens. L’entrée en cache coûte un quart du tarif d’entrée standard, ce qui rend les prompts système répétés et le contexte de projet partagé nettement moins chers.

Il existe aussi une variante rapide, disponible uniquement dans Cursor et Grok Build, et non via l’API publique. Elle est décrite comme deux fois plus rapide en sortie, à deux fois le prix : comptez donc le double des tarifs standard si vous la choisissez.

Vue aérienne de factures imprimées, d’une calculatrice et d’un carnet de chiffres sur une table en chêne

Factures réelles pour des prompts réels

Les tarifs ne disent pas grand-chose tant qu’on ne les applique pas. Le tableau ci-dessous suppose une réponse de 5 000 tokens de sortie et aucune mise en cache.

Taille du promptCoût en entréeCoût en sortieTotal
50K tokens0,10 $0,03 $0,13 $
150K tokens0,30 $0,03 $0,33 $
199K tokens0,40 $0,03 $0,43 $
201K tokens0,80 $0,06 $0,86 $
400K tokens1,60 $0,06 $1,66 $

Regardez les lignes du milieu. Ajouter seulement 2 000 tokens à un prompt fait passer la facture de 0,43 $ à 0,86 $, un doublement causé uniquement par le franchissement du seuil.

💡 Astuce : si votre prompt se situe près de 200K tokens, réduisez-le ou répartissez le travail en deux appels. L’entrée en cache au palier inférieur coûte généralement moins cher qu’une seule requête surdimensionnée.

La fenêtre de contexte de 500K

Ce que contiennent 500 000 tokens

Grok 4.7 accepte 500 000 tokens dans une seule requête, exactement comme Grok 4.6 : ce n’est donc pas une amélioration. Une règle empirique courante veut qu’un token corresponde à environ les trois quarts d’un mot anglais. La fenêtre représente alors près de 375 000 mots, soit à peu près 1 500 pages de texte brut. En pratique, elle peut contenir :

  • Un dépôt de code de taille moyenne, avec ses tests et sa documentation
  • Plusieurs longs contrats ou articles de recherche en même temps
  • Une semaine complète de tickets de support pour une recherche de tendances
  • Une très longue session d’agent, avec les sorties d’outils encore en mémoire

Considérez ces valeurs comme des estimations. Le code, les tableaux et les textes non anglais consomment davantage de tokens par mot que la prose ordinaire : la capacité réelle varie donc selon votre contenu.

Quand les longs prompts coûtent le double

La fenêtre est grande, mais c’est le palier tarifaire qui vous contraint. Tout prompt égal ou supérieur à 200K tokens passe au tarif de 4 $ en entrée et 12 $ en sortie pour la requête entière. Un prompt complet de 500K avec une réponse de 5 000 tokens coûte environ 2,06 $ à ces tarifs, contre 0,33 $ pour un prompt de 150K.

Vue aérienne d’un très long rouleau de papier déroulé sur une table de lecture de bibliothèque

Une fenêtre plus grande ne garantit pas non plus une meilleure restitution. xAI affirme que 4.7 est meilleur pour gérer les longs contextes et vérifier son propre travail sur des tâches de plusieurs heures, mais ce sont des affirmations de lancement : testez la récupération d’informations sur vos propres documents avant d’envoyer un demi-million de tokens en production.

Benchmarks publiés par xAI

Scores de codage et de terminal

xAI a publié un tableau de sept benchmarks, et Grok 4.7 a battu Grok 4.6 sur chacun d’eux. Les lignes de codage montrent les plus fortes progressions.

BenchmarkGrok 4.6Grok 4.7Réglage de Grok 4.7
CursorBench 4.040,4 %46,3 %xhigh
DeepSWE v1.165,2 %71,0 %high
Terminal-Bench 4.020,3 %38,0 %xhigh, harnais Grok Build
SWE-Marathon v1.131,9 %46,0 %high

Terminal-Bench 4.0 est le chiffre phare, avec un gain d’environ 17 points, et un média indique 37,6 % au lieu de 38,0 % pour le score de 4.7. SWE-Marathon progresse également de plus de 14 points, ce qui correspond à l’accent mis sur les travaux longs de plusieurs heures.

Un détail mérite attention. Le tableau de lancement associe Grok 4.6 à l’effort high et Grok 4.7 à l’effort xhigh sur CursorBench : la comparaison n’est donc pas à conditions égales. Un effort plus élevé signifie davantage de tokens de raisonnement, un point qui revient dans la partie sur les coûts ci-dessous.

Scores sur les tâches de travail intellectuel

En dehors du codage, le tableau est plus modeste, mais reste positif.

BenchmarkGrok 4.6Grok 4.7
EEBench53,0 %64,0 %
HealthBench Professional48,5 %56,7 %
Benchmark juridique Harvey15,8 %19,6 %

Le score juridique rappelle à quel point ces tests sont exigeants. Malgré un gain de près de quatre points, Grok 4.7 reste sous la barre des 20 % sur le benchmark Harvey : la rédaction juridique nécessite donc toujours une relecture humaine.

Main pointant un stylo vers des graphiques à barres imprimés épinglés sur un panneau de liège

💡 Mise en garde : chaque score de cette section provient des propres supports de xAI. Les sites tiers qui les ont republiés indiquent clairement qu’ils n’ont pas vérifié les chiffres.

Ce que les tests indépendants ont trouvé

Indices de performance des tiers

Un suivi de classements indépendant a mesuré Grok 4.7 le jour du lancement et a trouvé des gains plus faibles que ceux suggérés par le tableau du fournisseur :

  • Intelligence Index : un score de 46, classé 16e sur 655 modèles suivis, en hausse de 2 points par rapport à Grok 4.6.
  • Coding Agent Index : en hausse de 9 points par rapport à Grok 4.6.
  • Cyber Index (28 septembre) : 56 %, à égalité en première position parmi 17 modèles.
  • VulcanBench (4 octobre) : Grok 4.7 s’est classé parmi les trois meilleurs, devant le palier 5.1 Max de la famille Claude Fable 5.

Le schéma est cohérent. Le modèle est nettement meilleur en codage agentique et en travail de sécurité, tandis que le raisonnement général n’a que peu progressé. Cela correspond à un modèle optimisé par l’entraînement sur de longues tâches, plutôt qu’à un modèle conçu pour la conversation.

Le problème de l’appétit en tokens

Voilà le piège. Le même suivi a relevé environ 81 000 tokens de sortie par tâche pour Grok 4.7, contre 36 000 pour Grok 4.6, soit un rapport d’environ 2,25. D’autres testeurs ont observé la même chose : en xhigh, le nouveau modèle produit plus de deux fois la sortie de 4.6 en high.

IndicateurGrok 4.6Grok 4.7
Tokens de sortie par tâche36 00081 000
Coût de sortie par tâche à 6 $ par million0,22 $0,49 $
Prix par token6 $ par million6 $ par million

Coût de sortie uniquement, avant l’entrée et la mise en cache. La grille tarifaire n’a pas bougé, mais le coût par tâche terminée a à peu près doublé. Un modèle bon marché qui bavarde deux fois plus n’est pas un modèle bon marché.

Gros plan sur le compteur d’un taxi jaune, avec les chiffres qui défilent pendant un trajet sous la pluie

Vous pouvez garder cet appétit sous contrôle avec quelques habitudes :

  • Limitez la longueur des sorties avec une limite raisonnable de tokens maximum à chaque appel.
  • Utilisez l’effort low ou medium pour les étapes simples d’une boucle d’agent, et réservez xhigh à l’étape qui en a besoin.
  • Mettez en cache le contexte partagé pour que le tarif d’entrée de 0,50 $ s’applique à votre prompt système et à vos fichiers de projet.
  • Orientez les tâches courtes vers Grok 4.6 ou un modèle plus petit, et n’envoyez à 4.7 que les travaux longs et riches en outils.
  • Suivez les tokens par tâche terminée, et non par requête, pour que les nouvelles tentatives et les réponses verbeuses apparaissent dans vos chiffres.

Deux affirmations restent non confirmées. xAI n’a pas communiqué de nombre de paramètres, et un chiffre de 2,1 billions avancé par Elon Musk n’est soutenu par aucun document de lancement. Musk a aussi évoqué des données SpaceX supplémentaires, qui n’apparaissent pas dans les documents officiels. Tant que xAI ne publie pas de détails, considérez ces deux points comme des rumeurs.

Grok 4.7 face à ses concurrents

Grok 4.7 ou Grok 4.6

CaractéristiqueGrok 4.6Grok 4.7
Sortie12 août 202621 septembre 2026
Prix en entrée2 $ par million2 $ par million
Prix en sortie6 $ par million6 $ par million
Fenêtre de contexte500K500K
Niveaux d’effortde low à xhighde low à xhigh
Tokens de sortie par tâche36 00081 000
Terminal-Bench 4.020,3 %environ 38 %

La recommandation issue des comparatifs que j’ai consultés est simple. Passez à 4.7 pour le codage agentique, l’automatisation du terminal et les longs travaux sur des dépôts. Restez sur 4.6 pour les réponses courtes, la classification et la conversation, où la verbosité supplémentaire ne fait qu’ajouter des coûts. Une répartition approximative ressemble à ceci :

  • Basculer maintenant : agents de codage, refactorisations sur plusieurs fichiers, automatisation shell, tri des incidents de sécurité
  • Tester d’abord : tâches juridiques, de santé et de finance, où les scores absolus faibles imposent une relecture
  • Rester en place : questions-réponses courtes, résumés, réponses au support, tout ce qui est facturé au message

Développeur tapant du code la nuit devant deux écrans affichant du code, avec une lampe de bureau chaleureuse

Fable 5.1 Max et autres rivaux

Face à la famille Claude Fable 5, et plus précisément au palier 5.1 Max, le tableau de xAI lui-même montre Grok 4.7 en tête sur deux des sept benchmarks et en retrait sur les lignes de codage. Le résultat sur VulcanBench va dans l’autre sens : le bilan honnête est donc que les deux se partagent les victoires selon le test.

Les comparaisons directes et fiables avec les autres laboratoires restent rares. Si vous hésitez entre Grok 4.7, GPT 5.6 Sol et Gemini 3.5 Flash, soumettez les mêmes dix prompts réels à chacun et comparez à la fois la qualité et le total de tokens utilisés.

Quatre sprinteurs accroupis sur les blocs de départ d’une piste d’athlétisme au lever du soleil

Choisir un niveau d’effort de raisonnement

Grok 4.7 propose quatre réglages : low, medium, high et xhigh, high étant la valeur par défaut. Comme ce sont les tokens de sortie qui déterminent votre facture, l’effort agit autant sur le coût que sur la qualité.

  1. Low : recherches rapides et tâches de mise en forme
  2. Medium : rédaction courante et petites modifications de code
  3. High : la valeur par défaut, un bon point de départ pour la plupart des travaux d’agent
  4. Xhigh : tâches complexes en plusieurs étapes où une mauvaise réponse coûte plus cher que les tokens supplémentaires

Commencez en high, mesurez les tokens par tâche terminée, et passez à xhigh uniquement pour les travaux qui échouent sans lui.

Main faisant glisser l’un des quatre curseurs d’une console de mixage analogique

Essayer la famille Grok sur PicassoIA

Grok 4.7 n’est pas référencé sur PicassoIA au moment de la rédaction, mais son prédécesseur Grok 4 l’est, et il fonctionne directement depuis un champ de saisie, sans accès API ni configuration. C’est une façon rapide de découvrir le style de raisonnement de xAI avant d’engager des dépenses API.

Utiliser Grok 4 sur PicassoIA

  1. Ouvrez la page Grok 4 dans la collection des grands modèles de langage.
  2. Saisissez votre question dans le champ Prompt. Les problèmes en plusieurs étapes et les comparaisons lui conviennent le mieux.
  3. Gardez Temperature à la valeur par défaut de 0,1 pour un travail factuel, et augmentez-la légèrement pour le brainstorming.
  4. Vérifiez Max Tokens. La valeur par défaut est de 2 048 : augmentez-la si les réponses longues sont coupées.
  5. Laissez Top P à 1 et les deux pénalités à 0, sauf si la réponse se répète.
  6. Lancez le prompt, puis collez le même texte dans un autre modèle pour comparer.

Pour cette dernière étape, Claude Sonnet 5, GPT 5.6 Sol et Gemini 3.5 Flash sont de bons rivaux, et la page Kimi K2.6 mérite un coup d’œil pour les prompts de codage de type agent.

Créer vos propres images ensuite

Lire sur les modèles ne représente que la moitié du travail. L’autre moitié consiste à créer quelque chose avec eux, et c’est là que PicassoIA justifie sa place. Rédigez un script, une description de produit ou le plan d’un article de blog avec un grand modèle de langage, puis transformez la même idée en visuels en quelques clics.

Graphiste disposant des tirages photo en planche d’inspiration sur une longue table d’atelier

Pour des résultats photoréalistes, commencez par Seedream 4.5, GPT Image 2, Flux 2 Pro ou Nano Banana Pro. Décrivez le sujet, la lumière et l’objectif, par exemple « 85 mm, lumière douce de fenêtre, grain de film », et comparez deux modèles sur le même prompt. Lorsqu’une image vous convient, la collection texte vers vidéo peut en faire un court clip.

Parcourez tous les modèles sur picassoia.com/en/all-models, choisissez-en un, rédigez votre premier prompt et découvrez ce que vous pouvez créer dès aujourd’hui.

Partager cet article

Choisissez votre langue