API de génération de vidéos : options gratuites, tarifs et coût
Une API de génération de vidéos facture à la seconde, et l’écart entre 0,05 $ et 0,60 $ par seconde grimpe vite. Cet article fait le point sur les options gratuites, ce que coûtent réellement les paliers à la seconde, la manière dont les reprises gonflent la facture, et une formule simple pour budgétiser votre premier mois de clips.
Une API de génération de vidéos ne vous facture pas au mois. Elle vous facture à la seconde de séquence, et ce seul détail décide si votre projet coûte un déjeuner ou un ordinateur portable. Google annonce Veo 3.1 Lite à 0,05 $ par seconde en 720p et Veo 3.1 à 0,40 $ par seconde, soit un écart de huit fois pour une même durée de clip. Cet article montre quelles options sont réellement gratuites, ce que coûtent les options payantes, et comment calculer votre propre chiffre avant d’écrire la moindre ligne de code.
💡 Les prix évoluent. Les chiffres ci-dessous proviennent de la grille tarifaire de l’API Gemini de Google et de la documentation API de PicassoIA, tous deux vérifiés en octobre 2026. Les fournisseurs modifient leurs tarifs souvent : vérifiez la page en ligne avant de figer un budget.
Ce que fait réellement une API vidéo
Une API vidéo est un point d’accès web qui reçoit un prompt textuel, et parfois une image de départ, puis renvoie un clip terminé. Le piège est le temps. Le rendu de quelques secondes de séquence prend beaucoup plus de temps qu’un appel API classique, c’est pourquoi la plupart des fournisseurs utilisent un fonctionnement asynchrone plutôt que de vous obliger à garder une connexion ouverte.
La boucle requête, interrogation, récupération
La boucle comporte trois étapes :
Créer : vous envoyez une requête POST avec votre prompt et vos réglages. Le fournisseur répond immédiatement avec un identifiant de prédiction et un statut de starting.
Interroger : vous vérifiez cet identifiant à intervalles réguliers jusqu’à ce que le statut devienne succeeded, failed ou canceled.
Récupérer : vous téléchargez le MP4 depuis l’URL renvoyée et vous le stockez dans un espace que vous contrôlez.
L’API de PicassoIA suit ce schéma de type Replicate. L’exemple est rendu sur la page du modèle PicassoIA Video en environ 30 à 80 secondes. Calez donc votre intervalle d’interrogation sur cette plage, plutôt que de solliciter l’endpoint sans arrêt.
Ce que vous payez réellement
Quatre éléments font varier la facture finale :
Secondes de sortie : l’unité de base pour presque tous les fournisseurs, donc un clip de 10 secondes coûte deux fois plus qu’un clip de 5 secondes.
Résolution : le 720p, le 1080p et le 4K se situent généralement à des tarifs différents.
Palier de modèle : les versions lite, fast et flagship d’une même famille peuvent différer d’un facteur huit.
Reprises : chaque prise que vous jetez, vous l’avez tout de même payée.
Les options gratuites qui existent vraiment
Le mot « gratuit » est piégeux sur ce marché. Certaines options sont gratuites à l’utilisation, d’autres sont gratuites au téléchargement, et d’autres ne le sont que pour le premier après-midi. Voici la version courte avant le détail :
La grille tarifaire de l’API Gemini de Google indique que Veo 3.1 n’est pas disponible dans l’offre gratuite. Chaque seconde est donc facturée dès la première requête. D’autres fournisseurs d’API accordent parfois un petit crédit à l’inscription. Considérez ce crédit comme un essai : suffisant pour tester des prompts et mesurer la latence, pas assez pour faire tourner un produit. Les applications grand public qui distribuent des crédits quotidiens n’étendent généralement pas ces crédits aux appels API.
Des poids ouverts que vous hébergez vous-même
Des modèles ouverts comme LTX Video et Wan 2.1 1.3b n’ont aucun frais par seconde, mais ils ne sont pas gratuits pour autant. Vous payez en heures de GPU, en temps de configuration et en maintenance. Une comparaison simple consiste à diviser le prix horaire du GPU par le nombre de clips rendus par heure. Avec un GPU fictif à 1,00 $ de l’heure qui rend 12 clips par heure, chaque clip coûte environ 0,08 $ avant les temps d’inactivité. Cela bat une API hébergée uniquement tant que le GPU reste occupé.
API PicassoIA : prédictions gratuites
PicassoIA documente son API développeur sur https://api.picassoia.com/v1 et indique : « API predictions are currently free. They use no credits. » Quatre modèles sont exposés : PicassoIA Video, Seedance 2.5 Lite avec son audio synchronisé, et deux modèles d’image pour la génération et l’édition. L’authentification se fait par token Bearer commençant par pia_sk_, et un compte peut en détenir jusqu’à deux.
Les limites comptent autant que le prix :
5 prédictions en file d’attente ou en cours par compte, partagées entre tous les tokens et connexions MCP
10 Mo pour le corps de la requête
5 Mo par image envoyée sous forme d’URL de données
4 000 caractères par prompt
💡 Lisez la ligne sur les abonnements. La documentation indique que les comptes du forfait Infinite peuvent utiliser l’API, et que les autres comptes reçoivent une erreur 403 plan_required. La page tarifaire, en revanche, mentionne l’accès à l’API sur Pro+, Elite et Infinite. Ces deux informations ne concordent pas aujourd’hui : vérifiez le forfait dont votre compte a besoin avant de construire quoi que ce soit. Gratuit par prédiction ne signifie pas gratuit quel que soit le forfait.
Comparaison des vrais prix à la seconde
La grille de Google est l’exemple public le plus clair de la manière dont les paliers évoluent, car une même famille de modèles apparaît à trois niveaux de prix. Il s’agit de tarifs à la seconde issus de la page tarifaire de l’API Gemini, avec le coût des clips calculé pour comparaison. Multipliez-les par la durée que vous rendez réellement.
Paliers économiques face aux paliers haut de gamme
Au sein d’une même famille, l’écart est important. Lite face à Standard, cela fait 8 fois plus en 720p et 5 fois plus en 1080p. D’autres familles publient leurs propres tarifs, notamment Seedance 2.5, Kling v3 Video, Wan 2.7 T2V et LTX 2.3 Fast. Les tarifs varient selon le fournisseur et changent souvent : comparez-les avec la formule présentée plus loin dans cet article plutôt que de vous fier à une capture d’écran.
Un palier moins cher n’est pas automatiquement un mauvais choix. Les brouillons, les storyboards et les clips pour les réseaux sociaux nécessitent rarement le modèle haut de gamme, que vous pouvez réserver au rendu final.
Le risque lié au fournisseur a aussi un coût
OpenAI a annoncé que l’API de Sora 2 serait arrêtée le 24 septembre 2026, et que toute personne ayant bâti un produit dessus devait migrer. Un tarif bas ne signifie pas grand-chose si le point d’accès disparaît. Gardez vos prompts et vos réglages indépendants de tout fournisseur, et privilégiez une plateforme qui met plusieurs modèles derrière une même interface.
Un clip face à une journée de tournage
Un clip de 10 secondes au palier lite coûte 0,50 $. Même dix prises ne coûtent que 5,00 $, une broutille à côté d’une location de caméra ou d’une journée de tournage avec une équipe. La comparaison cesse d’être équitable dès que vous avez besoin d’une personne réelle, d’un produit ou d’un lieu précis, car la génération ne fait qu’approcher le résultat, alors que la caméra capture. Utilisez l’API pour le travail de concept, les plans de coupe, les arrière-plans et les courts clips pour les réseaux sociaux, et filmez ce qui doit être exact.
Les coûts cachés derrière le tarif affiché
Le prix affiché est le chiffre le moins élevé que vous verrez jamais. Trois autres coûts se cachent derrière.
Les reprises mangent le budget
Les modèles vidéo ne vous livrent pas un clip parfait du premier coup, si bien que le prix affiché sous-estime le coût réel. Divisez le prix par clip par la part de prises réellement utilisables. À 0,50 $ par clip et un taux de réussite d’un sur quatre, chaque clip utilisable coûte 2,00 $. Une fois une prise réussie, figez son seed pour pouvoir la reproduire, car des modèles comme PicassoIA Video acceptent un seed pour obtenir des résultats reproductibles.
💡 Brouillonnez à petit prix, finalisez une seule fois. Testez vos prompts sur le palier et la résolution les plus bas, puis n’utilisez le tarif plus élevé que pour les prompts qui fonctionnent déjà.
La résolution multiplie vite la facture
La grille de Google illustre l’effet : Veo 3.1 Fast coûte 0,10 $ par seconde en 720p et 0,30 $ par seconde en 4K, soit le triple pour un même prompt. Sur PicassoIA Video, vous pouvez choisir le 480p pour un rendu plus rapide ou le 720p pour une image plus nette. Faites vos brouillons au réglage bas et gardez le réglage élevé pour la passe finale.
Stockage et temps d’ingénierie
Chaque MP4 terminé nécessite du stockage et de la bande passante, et chaque intégration demande quelqu’un pour écrire la boucle d’interrogation, gérer les échecs et surveiller les limites de débit. Pour un petit projet, cela représente quelques soirées. Pour une équipe, c’est une ligne budgétaire. Téléchargez les résultats rapidement et copiez-les sur votre propre stockage plutôt que de compter sur la pérennité d’une URL du fournisseur.
Établir un budget en cinq minutes
Vous n’avez pas besoin d’un tableur pour chiffrer un projet. Il vous faut une formule et une estimation honnête des reprises.
La formule
Coût mensuel = clips utilisables × secondes par clip × prix par seconde × prises par clip utilisable
Prenons 200 clips utilisables de 8 secondes chacun. Cela représente 1 600 secondes de séquences finies. À 0,10 $ par seconde avec toutes les prises utilisables, la facture atteint 160 $. Si vous avez besoin de trois prises par clip utilisable, elle monte à 480 $.
Trois exemples de budgets mensuels
Même charge de travail, trois paliers, avec les tarifs Veo indiqués plus haut :
L’écart entre la ligne la moins chère et la plus chère est de 8 fois avant les reprises, et de 8 fois après, ce qui fait que le palier choisi compte plus que tout autre levier. Quel que soit le palier retenu, lancez un test pilote de 20 clips, mesurez votre nombre réel de prises par clip utilisable, et remplacez mon 3 par votre propre chiffre avant de vous engager.
Comment utiliser PicassoIA Video
PicassoIA propose son propre modèle de génération de vidéos à partir de texte et d’image, PicassoIA Video. C’est donc un endroit pratique pour tester l’ensemble de la boucle. La page du modèle indique un clip fixe de 5 secondes à 24 images par seconde, rendu avec un son synchronisé.
Rédigez le prompt dans l’ordre. Décrivez le sujet et sa pose de départ, puis le mouvement, puis le mouvement de caméra, puis la lumière. Le schéma du modèle indique que les descriptions cinématographiques et chronologiques fonctionnent le mieux.
Ajoutez une image d’entrée si vous voulez une première image précise. Le clip l’utilise comme plan d’ouverture et en reprend le format.
Choisissez une résolution. Le 480p est le plus rapide, le 720p est plus net.
Choisissez un format. Le 16:9 convient au paysage, le 9:16 au vertical, le 1:1 aux publications carrées.
Définissez un seed si vous voulez reproduire une prise plus tard.
Laissez save_audio activé pour un son synchronisé, ou désactivez-le pour un clip muet.
Format de l’image, ignoré lorsqu’une image est fournie
seed
entier
aléatoire
Résultats reproductibles
save_audio
booléen
true
Conserve ou supprime le son généré
💡 Vérifiez le schéma en vigueur. La page du modèle et la référence de l’API n’indiquent pas des plages de résolution et de durée identiques. Lisez le schéma actuel du modèle avant de figer une valeur dans votre code.
L’appeler depuis le code
L’API enveloppe chaque réglage dans un objet input. Créez la prédiction, puis interrogez son identifiant :
curl -s -X POST https://api.picassoia.com/v1/models/picassoia/picassoia-video/predictions \
-H "Authorization: Bearer $PICASSOIA_TOKEN" \
-H "Content-Type: application/json" \
-d '{"input": {"prompt": "A fishing boat rocks on calm water at sunrise, mist lifts off the surface, slow dolly-in, warm low light", "resolution": "480p", "aspect_ratio": "16:9"}}'
curl -s https://api.picassoia.com/v1/predictions/PREDICTION_ID \
-H "Authorization: Bearer $PICASSOIA_TOKEN"
La première réponse renvoie 201 Created avec un id, un statut starting et eta.next_poll_in_seconds. Lorsque le statut affiche succeeded, le champ output contient l’URL de la vidéo.
Les limites qui plafonnent votre débit
L’argent n’est pas le seul plafond. PicassoIA autorise 5 prédictions en file d’attente ou en cours d’exécution simultanément par compte, et ce pool est partagé entre tous les tokens et connexions MCP que vous possédez. Si un rendu prend environ une minute, cinq emplacements vous donnent au maximum 300 clips par heure, quel que soit votre budget.
Anticipez cette limite :
Gérez la file d’attente de votre côté : faites tourner un pool de cinq workers maximum, alimenté depuis une liste de tâches.
Respectez l’indication d’interrogation : attendez le eta.next_poll_in_seconds indiqué par la première réponse entre deux vérifications.
Renvoyez les échecs : un statut failed met fin à cette prédiction, envoyez donc une nouvelle requête au lieu d’interroger à nouveau.
Gardez des charges utiles légères : restez sous 10 Mo par requête et sous 5 Mo par image en URL de données.
Essayez par vous-même sur PicassoIA
Le moyen le moins coûteux de trouver votre propre chiffre est de réaliser quelques clips. Ouvrez PicassoIA Video et rendez un brouillon en 480p d’un plan dont vous avez réellement besoin. Faites ensuite passer la même idée par Seedance 2.5 Lite pour un son synchronisé, et comparez les deux côte à côte.
Une fois qu’un brouillon fonctionne, comptez vos prises, reportez les chiffres dans la formule, et décidez si la voie de l’API gratuite, un palier payant à la seconde ou votre propre GPU correspond à votre volume. PicassoIA réunit sous un même toit le texte vers image, le texte vers vidéo, l’édition d’images et la synchronisation labiale, si bien que vous pouvez tout tester avant de vous engager auprès d’un seul fournisseur.
Créez dès aujourd’hui vos propres images et vidéos avec PicassoIA. Commencez par un seul brouillon, mesurez ce qu’il coûte, et n’augmentez l’échelle qu’une fois que les chiffres tiennent la route.