RunPod, Vast.ai ou Modal : les GPU les moins chers pour la génération d’IA

RunPod, Vast.ai et Modal tarifient les GPU de trois façons différentes, et le tarif horaire le plus bas ne donne pas toujours l’image la moins chère. Cet article convertit les tarifs publiés en coût pour 1 000 images et en coût par clip vidéo, puis montre où le temps d’inactivité, le stockage et les heures de configuration changent le gagnant.

RunPod, Vast.ai ou Modal : les GPU les moins chers pour la génération d’IA
Cristian Da Conceicao
Fondateur de Picasso IA

Louer un GPU pour générer des images et des vidéos d’IA paraît simple jusqu’à l’arrivée de la facture. Une plateforme annonce $0,34 de l’heure, une autre facture à la seconde, et une troisième loue des machines inoccupées qui peuvent disparaître en plein rendu. Le prix affiché vous dit presque rien du coût réel d’une image terminée ou d’une vidéo de cinq secondes.

Ce comparatif met RunPod, Vast.ai et Modal côte à côte, convertit leurs tarifs en coût pour 1 000 images et en coût par clip vidéo, et montre où chacun fait discrètement fondre votre budget. Chaque chiffre ci-dessous est calculé à partir des tarifs publiés, avec les hypothèses écrites à côté afin que vous puissiez refaire le calcul avec vos propres chiffres.

💡 Verdict rapide : Vast.ai est le moins cher à l’heure de GPU, RunPod offre le meilleur équilibre global, et Modal est l’option la plus fluide lorsque votre trafic est irrégulier et que vous êtes à l’aise en Python.

La réponse courte

Le classement dépend d’une seule question : votre GPU travaille-t-il en continu, ou attend-il ? Un GPU très sollicité favorise les locations horaires bon marché. Un GPU surtout inactif favorise la facturation serverless à la seconde. Tous les chiffres de cet article découlent de cette tension, et elle explique pourquoi la plateforme « la moins chère » change selon la personne qui pose la question.

Vue en contre-plongée d’un long couloir de baies de serveurs dans un centre de données

Prix à l’heure en un coup d’œil

Voici les tarifs de référence des GPU que les gens utilisent réellement pour les modèles de diffusion et de vidéo. Les chiffres de RunPod et Modal proviennent de leurs grilles tarifaires publiques début octobre. Vast.ai est une place de marché où chaque hébergeur fixe son prix ; sa colonne indique donc une fourchette typique et non un tarif fixe.

GPURunPod CommunityRunPod SecureModalVast.ai (typique)
RTX 4090 24 Go$0,34$0,74Non proposé$0,25 à $0,80
L40S 48 Go$0,79$1,09$1,95Variable selon l’hébergeur
A100 80 Go$1,19 à $1,39$1,59$2,50$1,10 à $2,00
H100 80 Go$1,99 à $2,69$2,89 à $3,49$3,95Environ $1,50 à $3,00

Les instances Vast.ai interruptibles descendent encore plus bas. Vast.ai annonce elle-même des tarifs inférieurs de 50 % ou plus à ceux de l’offre à la demande, et des offres spot de RTX 4090 proches de $0,15 de l’heure ont été signalées.

💡 Considérez ces chiffres comme un classement, pas comme un devis. Les prix des GPU évoluent chaque semaine. Consultez le tableau de bord en direct avant de vous engager sur un budget.

Qui gagne selon le besoin

  • Génération d’images par lots : Vast.ai ou RunPod Community. Le tarif horaire est bas et le GPU reste occupé.
  • Génération de vidéos : RunPod H100 ou Vast.ai. Les longs travaux profitent d’une grande mémoire et d’un tarif horaire bas.
  • Trafic API irrégulier : Modal ou RunPod Serverless. Vous ne payez que pendant l’exécution d’une requête.
  • Production avec engagements de disponibilité : RunPod Secure Cloud ou Modal. Moins de surprises qu’une place de marché.
  • Premières expérimentations : Modal, car le crédit gratuit mensuel finance des milliers d’images.

Comment chaque plateforme facture

Trois plateformes, trois modèles mentaux. Choisissez la mauvaise et vous payez des heures pendant lesquelles votre GPU ne fait rien.

RunPod : pods et serverless

RunPod propose deux produits. Les pods sont des machines louées, facturées à la seconde au tarif horaire. Community Cloud est le niveau le moins cher, et Secure Cloud fonctionne dans des centres de données vérifiés, avec des promesses de fiabilité plus fortes. Serverless exécute votre conteneur à la demande, avec des workers flexibles qui descendent à zéro.

Le serverless coûte beaucoup plus cher à l’heure que la même carte en pod. Une RTX 4090 coûte $1,10 de l’heure en serverless, contre $0,34 en pod Community. Cet écart est le prix de ne rien gérer, et il donne une règle simple : un pod n’est avantageux que s’il reste occupé plus d’environ 31 % du temps ($0,34 divisé par $1,10).

Vast.ai : une place de marché de GPU en direct

Vast.ai ne possède pas le matériel. Les hébergeurs mettent leurs machines en vente, fixent leurs propres prix, et vous louez celle qui correspond à vos filtres. La facturation se fait à la seconde, sans minimum, et il existe trois formules : à la demande (garanti, sans interruption), interruptible (50 % ou plus moins cher, peut être repris) et réservé (engagements de 1, 3 ou 6 mois, jusqu’à 50 % de réduction).

Rig multi-GPU à cadre ouvert installé dans un garage

L’avantage est le prix le plus bas des trois. Le compromis, c’est la variabilité. Un hébergeur installé dans un garage et un hébergeur d’un centre de données professionnel apparaissent dans les mêmes résultats de recherche, et les tarifs de bande passante et de stockage sont fixés par hébergeur. Lisez donc l’annonce avant de louer. Pour les lots d’images qui enregistrent chaque résultat au fur et à mesure, une interruption ne coûte presque rien. Pour un rendu vidéo de dix minutes, perdre l’instance à la neuvième minute fait mal.

Modal : le code d’abord, la facturation à la seconde

Modal ne vous remet pas de machine. Vous écrivez des fonctions Python, vous les associez à un type de GPU, et Modal les exécute dans des conteneurs qui démarrent à la demande. La facturation se fait à la seconde : un L40S coûte $0,000542 par seconde ($1,95 de l’heure), un H100 coûte $0,001097 ($3,95 de l’heure), et le plan Starter inclut $30 de crédit gratuit chaque mois.

Chronomètre analogique posé à côté d’une carte graphique

La facturation avec retour automatique à zéro signifie que vous ne payez jamais pour l’inactivité. Elle signifie aussi que vous ne voyez jamais les tarifs horaires bas, car l’équivalent horaire de Modal est le plus élevé des trois. Vous payez une prime pour le confort, et cette prime n’a de sens que si votre GPU restait inactif la plupart de la journée.

Coût réel par image

Les prix horaires sont abstraits. Ce qui compte, c’est le coût d’une image finale.

Le calcul derrière les chiffres

Bureau avec un tableur imprimé, une calculatrice et un stylo rouge

La formule est simple : coût par image = (tarif horaire ÷ 3 600) × secondes par image. Les secondes sont la partie variable. Les hypothèses de travail ici sont une image de 1024 × 1024 générée avec FLUX Dev en 28 étapes : environ 12 secondes sur une RTX 4090, 9 secondes sur un L40S, 4 secondes sur un H100 et 4,5 secondes sur le H100 PCIe, plus lent. Vos temps différeront selon la quantification, la résolution et la pile logicielle. Considérez donc le tableau ci-dessous comme un modèle que vous pouvez recalculer.

Il suppose aussi que le GPU est déjà chargé et occupé. Le temps d’inactivité et le chargement du modèle ont leur propre section plus bas.

Adapter la VRAM à votre modèle

La vitesse n’est que la moitié de l’histoire, car une carte qui ne peut pas contenir le modèle ne peut pas l’exécuter du tout. En gros, une carte de 24 Go comme la RTX 4090 gère confortablement les modèles d’image de type SDXL et FLUX, surtout avec des poids en 8 bits. Une carte de 48 Go comme la L40S vous permet de garder ensemble le modèle d’image, un ControlNet et un upscaler chargés, sans échanger en mémoire. Une A100 ou une H100 de 80 Go est ce que réclament les grands modèles vidéo, car ils conservent en mémoire de longues séquences d’images à la fois.

La mémoire influe sur le prix de deux façons. Acheter plus de VRAM que nécessaire fait fondre le budget : faire tourner un modèle qui en demande 20 Go sur un H100 revient à payer 60 Go qui restent vides. En acheter trop peu fait perdre du temps, car le logiciel décharge les poids dans la RAM système et chaque étape ralentit. Une bonne habitude consiste à louer la plus petite carte qui accueille le modèle avec quelques Go de marge, à benchmarker dix images, puis seulement à monter en gamme.

💡 Test rapide : générez d’abord dix images sur une carte peu chère. Si le temps par image est à 30 % près de ce que vous aviez supposé, le tableau des coûts ci-dessous tiendra.

Coût pour 1 000 images

ConfigurationTarif horaireSecondes par imageCoût pour 1 000 images
Vast.ai 4090, interruptibleenviron $0,1512$0,50
RunPod 4090, pod Community$0,3412$1,13
Vast.ai 4090, à la demandeenviron $0,4012$1,33
RunPod H100 PCIe, pod Community$1,994,5$2,49
RunPod 4090, Serverless$1,1012$3,67
Modal H100$3,954$4,39
Modal L40S$1,959$4,88

Sur un GPU parfaitement occupé, un Vast.ai 4090 interruptible est presque 10 fois moins cher qu’un Modal L40S. C’est le titre, et c’est aussi trompeur. L’utilisation inverse le tableau. Un 4090 Community qui ne travaille que 10 % de la journée coûte en réalité $11,33 pour 1 000 images, soit plus du double des $4,88 de Modal, car vous payez aussi les 90 % restants.

Le crédit gratuit de Modal rend les petits volumes faciles : $30 achètent environ 15 heures de temps L40S, soit à peu près 6 000 images de 9 secondes chacune, chaque mois, sans rien payer.

Coût réel par clip vidéo

Pourquoi la vidéo change le calcul

Les modèles vidéo sont plus lourds. Un clip de cinq secondes en 720p, issu d’un modèle comme Wan 2.7 texte vers vidéo, prend des minutes au lieu de secondes et demande plus de VRAM, ce qui vous fait passer des cartes de 24 Go vers des cartes de 48 Go ou 80 Go. Les hypothèses ici sont 6 minutes par clip sur une carte de classe 4090 ou L40S avec des poids quantifiés, et 3 minutes sur un H100.

Monteur vidéo examinant un clip cinématographique figé sur un grand écran

Les longs rendus changent la donne. Un chargement de modèle de 40 secondes compte à peine lorsque le travail dure 6 minutes, donc les démarrages à froid cessent d’être l’ennemi. Les interruptions deviennent l’ennemi à la place, car une instance perdue gaspille des minutes de travail et non des secondes. Cela déplace l’équilibre vers des pods fiables et loin des annonces interruptibles les moins chères.

Tableau des coûts par clip

ConfigurationMinutes par clipCoût par clipCoût pour 100 clips
RunPod 4090, pod Community6$0,03$3,40
Vast.ai 4090, à la demande6$0,04$4,00
RunPod H100 PCIe, pod Community3$0,10$9,95
RunPod 4090, Serverless6$0,11$11,00
Modal L40S6$0,20$19,51
Modal H1003$0,20$19,75

Même la ligne la plus chère coûte environ vingt centimes par clip. Pour la vidéo, le choix ne se joue pas à quelques centimes près par clip. Il s’agit de savoir si les heures de configuration, la surveillance constante et les rendus ratés vous coûtent plus cher que l’écart entre les lignes du tableau.

Les coûts cachés qui grignotent votre budget

Temps d’inactivité et démarrages à froid

La façon la plus courante de transformer un GPU bon marché en GPU cher est d’oublier de l’arrêter. Un 4090 Community laissé allumé tout le mois coûte environ $248 ($0,34 × 730 heures). Un pod H100 PCIe laissé allumé coûte à peu près $1 453. Ni l’un ni l’autre n’a produit une seule image pendant que vous dormiez.

Gros plan sur les ventilateurs de refroidissement et les ailettes de dissipateur d’un serveur

Le serverless a le problème inverse. Un conteneur neuf doit charger plusieurs Go de poids dans la VRAM avant que la première requête ne s’exécute. Les modèles d’image se chargent en quelques secondes à quelques dizaines de secondes, et les grands modèles vidéo prennent plus de temps. Le temps passé à charger les poids dans votre fonction est facturé comme n’importe quel autre temps de calcul. Gardez donc les conteneurs actifs pendant les heures d’activité, et mettez les poids en cache dans un volume plutôt que de les télécharger à chaque démarrage.

Stockage, sortie de données et temps de configuration

💡 Règle empirique : une heure de votre temps coûte plus qu’une heure de n’importe quel GPU de cette liste.

Les poids des modèles s’additionnent vite. Un modèle d’image, un modèle vidéo et une poignée de LoRA atteignent facilement 100 Go. Le stockage réseau de RunPod coûte de $0,05 à $0,14 par Go et par mois, donc 100 Go reviennent à $5 à $14 par mois, facturés qu’un pod tourne ou non. Les hébergeurs Vast.ai fixent leurs propres tarifs de stockage et de bande passante, donc comparez-les annonce par annonce.

Viennent ensuite les heures de configuration. Installer ComfyUI, faire correspondre les versions de CUDA et déboguer un hébergeur dont le disque est lent peut prendre un après-midi entier. Avec un taux horaire de $50, deux heures de dépannage coûtent $100, ce qui représente le prix de calcul d’environ 88 000 images sur un 4090 Community. Les tarifs horaires bas ne paient que si la machine fonctionne du premier coup.

Quelle plateforme pour quel usage

Créateurs solo et amateurs

Carte graphique posée sur un établi en chêne

Si vous générez quelques centaines d’images par semaine, commencez par le crédit gratuit de Modal et écrivez un seul script. Si vous préférez un flux de travail visuel comme ComfyUI, louez un 4090 Community sur RunPod pour une séance d’une soirée et arrêtez-le une fois terminé. Vast.ai récompense la patience et l’aisance avec la console : triez par prix, vérifiez le score de fiabilité de l’hébergeur, et utilisez les tarifs interruptibles pour les lots qui sauvegardent au fur et à mesure.

Équipes et API de production

Mains gantées tenant une carte accélératrice GPU de serveur

Un produit qui traite des milliers de requêtes avec un trafic irrégulier convient à Modal ou RunPod Serverless, où vous payez à la seconde de travail réel. Une charge stable et prévisible convient aux pods RunPod Secure ou aux engagements réservés de Vast.ai, où le tarif horaire est le plus bas par heure d’utilisation réelle. Pour la vidéo en volume, un H100 l’emporte souvent en matière de débit par dollar, même lorsque son tarif horaire paraît élevé.

Si votre pipeline appelle aussi un grand modèle de langage pour rédiger des prompts, les mêmes plateformes peuvent l’héberger. Mais un modèle de taille complète comme DeepSeek R1 demande un nœud multi-GPU et peut doubler la facture matérielle. Les petits modèles tiennent sur une seule carte de 24 Go.

Quand louer un GPU n’a aucun sens

La location l’emporte lorsque vous avez besoin de quelque chose de sur mesure : entraînement LoRA privé, graphe ComfyUI inhabituel ou modèle que personne n’héberge. Pour le reste, le calcul horaire, le risque d’inactivité et le temps de configuration rendent souvent un service hébergé plus avantageux en pratique.

Trois pigistes comparant des chiffres à une table dans un loft lumineux

PicassoIA exploite ses propres GPU, avec 91 modèles de texte vers image et 87 modèles de texte vers vidéo disponibles, et la génération sur ses propres modèles est gratuite sur les plans Infinite et Wonder. Aucun compteur ne tourne pendant que vous réfléchissez à un prompt, aucun pod à oublier, et aucune erreur CUDA à minuit.

Comment utiliser Flux sur PicassoIA

  1. Ouvrez la page du modèle. Commencez avec FLUX Dev pour une qualité équilibrée, ou FLUX Schnell lorsque vous voulez des brouillons rapidement.
  2. Écrivez un prompt précis. Nommez le sujet, la direction de la lumière et l’objectif, par exemple « 85mm f/1.8, soft window light from the left ».
  3. Choisissez le format. Optez pour 16:9 pour les en-têtes de blog et 1:1 pour les publications sur les réseaux sociaux.
  4. Réglez les étapes et le guidage si affichés. Environ 28 étapes et une valeur de guidage proche de 3,5 constituent un bon point de départ pour FLUX Dev.
  5. Générez et comparez. Lancez le même prompt sur FLUX.2 Pro lorsque vous voulez une finition encore plus soignée.
  6. Affinez le meilleur résultat. Passez-le dans Clarity Pro Upscaler pour une version haute résolution nette.
  7. Animez-le. Transformez la meilleure image en courte vidéo avec Wan 2.7 image vers vidéo ou LTX 2 Fast.

💡 Astuce : gardez un seul modèle de prompt pour chaque image d’une série. Une formulation constante de la lumière et de l’objectif vous donne un ensemble cohérent, sans aucune configuration de GPU.

Essayez par vous-même sur Picasso IA

Vous avez maintenant les chiffres : Vast.ai pour le tarif horaire le plus bas, RunPod pour l’équilibre, Modal pour les rafales facturées à la seconde. Si vous préférez vous passer des pods, des conteneurs et des factures, ouvrez Picasso IA et lancez-y votre prochain lot. Générez quelques images avec FLUX Dev, testez un clip cinématographique avec Seedance 2.0, et comparez les résultats à ceux que vous étiez sur le point de produire en louant un GPU.

Essayez un même prompt sur trois modèles différents, choisissez le rendu qui vous plaît, et économisez le coût d’un pod inactif pour quelque chose de plus amusant. Votre première image n’est qu’à quelques clics.

Partager cet article

Choisissez votre langue