API vidéo d’OpenRouter : quels modèles vidéo et quels coûts
OpenRouter achemine désormais la génération de vidéos vers Veo 3.1, Seedance 2.5, Wan 3.0, Kling et d’autres, via un seul point de terminaison asynchrone. Cet article indique les tarifs à la seconde, montre ce que coûtent réellement dix clips et explique comment choisir un modèle avant de dépenser des crédits.
Payer la vidéo par IA impliquait autrefois cinq tableaux de bord, cinq pages de facturation et cinq SDK. OpenRouter achemine désormais la génération de vidéos via un seul point de terminaison asynchrone, si bien qu’un seul jeton bearer permet d’accéder à Google, ByteDance, Alibaba, Kling, MiniMax, Runway, xAI et d’autres. Le piège, c’est que chaque modèle tarife ses secondes différemment : un clip à trois centimes la seconde sur un modèle peut coûter soixante centimes sur un autre. Cet article recense les modèles vidéo proposés par OpenRouter à début octobre 2026, ce que chacun facture, le fonctionnement de la facturation et la manière d’empêcher un projet réel de vider vos crédits. Les prix changent souvent : considérez chaque chiffre comme un instantané et consultez la liste des modèles en direct avant de vous engager sur un budget.
Le fonctionnement de l’API
OpenRouter traite la vidéo différemment des appels texte ou image. Un rendu peut prendre plusieurs minutes, donc l’API ne maintient jamais de connexion ouverte. Vous soumettez une tâche, recevez un identifiant, vérifiez son statut, puis téléchargez le fichier une fois prêt. Ce schéma est identique pour chaque modèle, et c’est tout l’intérêt : il suffit de changer une chaîne model pour que le reste de votre code continue de fonctionner.
Soumettre, interroger, télécharger
Quatre points de terminaison font tout le travail :
POST /api/v1/videos soumet une tâche avec un model et un prompt.
GET /api/v1/videos/{jobId} renvoie le statut actuel.
GET /api/v1/videos/{jobId}/content télécharge le fichier terminé.
GET /api/v1/videos/models liste tous les modèles vidéo avec leurs résolutions, durées et tarifs.
La réponse à la soumission comprend un id, un polling_url et un status de pending. Le statut passe ensuite à in_progress et se termine soit par un succès, soit par failed. Lorsqu’une tâche réussit, la réponse ajoute unsigned_urls pour le téléchargement, ainsi qu’un objet usage avec le cost final en USD et un indicateur is_byok. Si l’interrogation vous semble superflue, transmettez un callback_url : OpenRouter envoie alors un webhook signé avec HMAC-SHA256.
curl -X POST "https://openrouter.ai/api/v1/videos" \
-H "Authorization: Bearer $OPENROUTER_TOKEN" \
-d '{"model": "google/veo-3.1", "prompt": "A golden retriever playing fetch on a sunny beach"}'
💡 À savoir : OpenRouter indique que la génération de vidéos n’est pas éligible à la Zero Data Retention, car la conception asynchrone conserve chaque sortie jusqu’à son téléchargement. Si votre politique interdit toute conservation, prévoyez-le avant l’intégration.
Les paramètres qui modifient le prix
Outre model et prompt, vous pouvez définir duration, resolution, aspect_ratio et size. Ajoutez frame_images pour animer une image fixe, ou input_references pour une génération à partir de références. Vous pouvez aussi activer ou désactiver l’audio, fixer un seed et transmettre des options propres à chaque fournisseur. Les résolutions vont de 480p à 4K et les formats de 21:9 à 9:21, mais chaque modèle n’accepte qu’un sous-ensemble de ces options. Chacun de ces choix influe sur le prix, raison pour laquelle la facturation mérite sa propre section.
Le fonctionnement de la facturation
Tarifs à la seconde
La plupart des modèles facturent à la seconde de sortie. Le point de terminaison des modèles l’expose via pricing_skus, avec des entrées comme un tarif de base per-video-second et un tarif distinct pour le 1080p. Une résolution plus élevée fait monter le tarif, une piste audio le fait encore monter, et la durée multiplie le tout. Veo 3.1 illustre l’écart au sein d’un même modèle : environ 0,20 $ la seconde en 1080p sans audio, jusqu’à 0,60 $ la seconde en 4K avec audio. Cela représente un écart de trois pour un, avant même de choisir un autre modèle.
Tarification au token et tâches échouées
Les modèles Seedance de ByteDance apparaissent dans le point de terminaison des modèles avec des prix au token plutôt qu’à la seconde. La page de collection d’OpenRouter les convertit en un tarif de départ à la seconde, et c’est ce tarif converti qui est utilisé dans tout cet article.
Les échecs sont moins clairs. OpenRouter indique qu’une panne amont 502 n’est pas facturée, mais la documentation ne précise pas la règle pour les autres tâches échouées : prévoyez donc une marge de nouvelles tentatives dans votre budget. Trois autres erreurs méritent d’être gérées dans le code :
402 signifie crédits insuffisants.
403 signifie que vous avez atteint une limite de dépenses.
429 signifie que vous êtes limité en débit.
Chaque modèle vidéo et son prix
Voici quinze des fiches les plus utilisées, classées du moins cher au plus cher à l’entrée de la fourchette :
💡 Le bas de la fourchette correspond généralement à la résolution la moins chère sans audio. Le haut correspond généralement à la résolution maximale avec audio. Les lignes Seedance affichent le tarif de départ converti, et non un prix fixe.
Si vous connaissez déjà votre besoin, ces choix rapides vous feront gagner du temps :
Clip unique le plus long :Wan 3.0 ou Seedance 2.5, tous deux jusqu’à 30 secondes.
Résolution la plus élevée :Veo 3.1 ou Seedance 2.0, tous deux jusqu’à la 4K.
Tarif forfaitaire prévisible :Gen-4.5 à 0,12 $ la seconde.
Quelques autres fiches valent le détour. Wan 3 Prime coûte de 0,068 $ à 0,28 $ la seconde jusqu’à 1080p. Kling v3 Video dans son niveau Pro coûte de 0,112 $ à 0,168 $. Hailuo 2.3 facture 0,0817 $ pour les clips 1080p de 6 ou 10 secondes. Wan 2.7 se situe à 0,10 $ et Wan 2.6 de 0,04 $ à 0,15 $. Runway Aleph 2.0, conçu pour le montage de séquences existantes, démarre à 0,28 $.
Considérez les chiffres ci-dessus comme une carte, pas comme un contrat. Certaines fiches diffèrent d’un ou deux centimes entre la page de collection et le point de terminaison des modèles : interrogez donc /api/v1/videos/models directement avant de figer un budget.
Les modèles économiques à moins de dix centimes
D’abord Veo 3.1 Lite
Veo 3.1 Lite est la version allégée et moins chère du modèle phare de Google. Il génère des clips 720p et 1080p de 4, 6 ou 8 secondes, accepte un prompt texte ou une image de départ, ajoute l’audio natif et accepte un seed. À 0,03 $ à 0,08 $ la seconde, un clip complet de 8 secondes coûte entre 0,24 $ et 0,64 $. Veo 3.1 Fast se place un cran au-dessus, à 0,08 $ à 0,30 $, et ajoute une option 4K : c’est l’échelon intermédiaire logique lorsque Lite paraît trop doux, mais que le modèle complet est excessif.
Budgets Seedance et Wan
L’option ByteDance la moins chère est Seedance 2.0 Mini, à environ 0,034 $ la seconde pour des clips 480p et 720p de 4 à 15 secondes. Un clip de 15 secondes coûte environ 0,50 $. Seedance 2.0 Fast privilégie la vitesse et un coût réduit plutôt que la qualité maximale, à environ 0,040 $ la seconde.
Pour la durée, regardez Wan 3.0. Il accepte de 2 à 30 secondes, de 480p à 1080p, avec audio. À environ 0,05 $ la seconde, un clip de 30 secondes coûte 1,50 $, ce qui en fait le clip unique le plus long de cette tranche de prix. HeyGen Video démarre à 0,01 $ la seconde et constitue la fiche la moins chère de toutes, même si vous devriez vérifier à quelle résolution ce tarif s’applique avant de bâtir un plan dessus.
Les modèles premium qui valent leur prix
Veo 3.1 au plein tarif
Veo 3.1 prend en charge les résolutions 720p, 1080p et 4K, des clips de 4, 6 ou 8 secondes, l’audio, le conditionnement par première et dernière image, et un seed. En 1080p avec audio, le tarif est d’environ 0,40 $ la seconde, donc un clip de 8 secondes coûte 3,20 $. En 4K avec audio, il grimpe à 0,60 $. Réservez-le aux plans phares, pas aux brouillons.
Seedance 2.5 pour les scènes longues
OpenRouter positionne Seedance 2.5 pour la narration longue, la génération à partir de références, le montage vidéo et l’extension de vidéo. Il accepte de 4 à 30 secondes en 480p et 720p. À environ 0,103 $ la seconde, une scène complète de 30 secondes coûte 3,08 $. Si vous avez besoin du contrôle de la première et de la dernière image et de personnages cohérents en résolutions plus élevées, Seedance 2.0 atteint la 4K à partir d’environ 0,067 $ la seconde.
Kling, Runway et HappyHorse
Le segment intermédiaire haut de gamme est très encombré. Kling v3.0 Standard génère des clips 720p de 3 à 15 secondes avec audio, à 0,084 $ à 0,126 $ la seconde. Gen-4.5 de Runway facture un forfait de 0,12 $ pour des clips 720p de 2 à 10 secondes, sans audio. HappyHorse 1.1 propose le 720p et le 1080p à 0,099 $ à 0,128 $. Grok Imagine Video 1.5 accepte des clips aussi courts que 1 seconde, la durée minimale la plus faible du tableau, ce qui convient aux tests de mouvement bon marché.
Ce que coûte un projet réel
Dix clips selon trois budgets
Imaginez dix clips de 8 secondes chacun, soit 80 secondes de séquences finies. En utilisant les tarifs les plus bas et les plus hauts publiés, la facture se présente ainsi :
Remarquez l’écart : les mêmes 80 secondes coûtent environ 2,40 $ ou environ 48 $, soit une différence de vingt pour un, selon le seul modèle et les seuls réglages choisis. Même Seedance 2.0 Mini à son tarif de départ atteint environ 2,69 $ pour les mêmes séquences.
Coûts cachés et reprises
Le prix affiché suppose que chaque clip sera retenu, et aucun ne l’est jamais vraiment. Si vous ne gardez qu’une prise sur trois, multipliez votre budget par trois : le projet à 2,40 $ avec Veo 3.1 Lite devient 7,20 $. Le moyen le moins cher d’augmenter votre taux de réussite, c’est un meilleur prompt avant la soumission, et non un modèle plus cher ensuite.
Un grand modèle de langage fait bien ce travail. Demandez à Claude Sonnet 5, Gemini 3.5 Flash ou GPT 5.6 Luna de réécrire votre idée sous forme de description chronologique de plans, avec un sujet, un mouvement, un déplacement de caméra et un repère sonore. Les modèles vidéo répondent bien mieux à cette structure qu’à une demande vague d’une seule ligne. Téléchargez aussi chaque sortie dès qu’elle est terminée et conservez votre propre copie, plutôt que de supposer que l’URL de la tâche restera disponible.
Brouillonner à petit prix, finaliser en premium
La meilleure stratégie budgétaire consiste en un pipeline en deux étapes. Lancez six brouillons de 8 secondes sur Seedance 2.0 Mini : 48 secondes à environ 0,034 $ reviennent à environ 1,61 $. Choisissez le meilleur cadrage, puis générez uniquement ce plan sur Veo 3.1 en 1080p avec audio, pour 3,20 $. Le plan complet coûte environ 4,81 $, contre 19,20 $ pour six tentatives premium.
💡 Règle empirique : ne payez jamais un tarif premium pour savoir si un prompt fonctionne.
Utiliser Veo 3.1 Lite sur PicassoIA
Si vous voulez tester le rendu de Veo 3.1 Lite avant de configurer une API, Veo 3.1 Lite sur PicassoIA fonctionne dans un navigateur, sans code. La page propose des clips de 4, 6 et 8 secondes, en 720p et 1080p, avec audio natif.
Rédiger le prompt
Ouvrez la page du modèle et décrivez la scène dans l’ordre où elle se déroule : qui ou quoi est à l’écran, comment cela bouge, où va la caméra et ce que l’on entend. Comme le modèle génère l’audio, nommez le son : pluie sur une vitre, sifflet lointain d’un train, jazz doux. Le prompt est le seul champ obligatoire.
Choisir la durée et la résolution
Réglage
Options
Par défaut
Durée
4, 6 ou 8 secondes
8
Résolution
720p ou 1080p
720p
Format
16:9 ou 9:16
16:9
💡 La page du modèle précise que la durée doit être de 8 secondes si vous choisissez le 1080p, et que la 4K n’est pas prise en charge sur la version Lite.
Animer une image de départ
Importez une image et le modèle l’utilise comme première image. Ajoutez une seconde image comme dernière image, et Veo 3.1 Lite construit une transition fluide entre les deux. Définissez un seed lorsqu’un résultat vous plaît et que vous voulez des variantes proches.
Vous préférez le code ? PicassoIA propose aussi une API de prédictions de type Replicate à https://api.picassoia.com/v1. Les tâches sont asynchrones : vous créez une prédiction, l’interrogez et récupérez le résultat, à peu près comme le flux OpenRouter décrit plus haut. Les modèles vidéo exposés là-bas sont picassoia/picassoia-video et picassoia/seedance-2.5-lite, et un compte peut lancer jusqu’à 5 prédictions simultanées. Consultez la page des tarifs pour trouver le forfait qui inclut l’accès à l’API avant de construire quoi que ce soit dessus.
Votre prochain clip commence ici
Lire des tableaux de prix ne vous mène que jusqu’à un certain point. Le moyen le plus rapide de savoir quel modèle convient à votre projet est de générer le même prompt sur deux d’entre eux et de comparer les images. Ouvrez Seedance 2.5 Lite, que PicassoIA présente comme illimité pour les membres Wonder en 480p et 720p, et lancez un brouillon de 5 ou 10 secondes. Essayez ensuite Veo 3.1 Lite ou PicassoIA Video sur la même idée, et voyez quel mouvement vous préférez.
Une fois un clip retenu, la plateforme propose aussi des effets vidéo, de l’upscaling, la synchronisation labiale et la synthèse vocale, afin d’affiner le résultat sans quitter la plateforme. Parcourez tous les modèles vidéo, image et langage sur picassoia.com/en/all-models, choisissez-en un et réalisez votre premier clip dès aujourd’hui.