Le moment où une personne soulève une tasse de café, le liquide à l’intérieur ballotte d’une manière bien précise. Lorsqu’un tissu glisse de l’épaule de quelqu’un, la gravité et la résistance de l’air interagissent selon des schémas que l’on reconnaît immédiatement comme réels. La perception humaine s’est façonnée au fil de millions d’années d’observation d’objets physiques en mouvement, ce qui explique pourquoi la vidéo générée par IA nous a toujours paru fausse, même lorsque nous ne pouvions pas dire pourquoi.
Sora 2.5 change cela. Pas complètement. Pas parfaitement. Mais de manière suffisamment importante pour faire évoluer la façon dont les créateurs sérieux envisagent les outils de vidéo par IA.
Cet article détaille les domaines précis dans lesquels Sora 2.5 réalise des progrès mesurables : cohérence temporelle, simulation physique et intelligence de caméra. Il examine ensuite comment l’écosystème plus large des modèles de texte vers vidéo disponibles sur PicassoIA se positionne face à lui, et ce que fait différemment la concurrence.
Le problème du mouvement qui a toujours hanté la vidéo par IA
Pourquoi la physique a mis à mal chaque modèle des débuts
La première génération de modèles de texte vers vidéo traitait la vidéo comme une suite d’images. On générait une image, puis une autre, puis une autre, et on les assemblait. Le problème, c’est que le monde physique ne fonctionne pas image par image. Une balle qui roule sur une table ne se réinitialise pas entre deux images. Sa vitesse, sa rotation, son rapport à la gravité et son interaction avec la surface persistent dans le temps, comme un processus physique continu.
Les premiers modèles produisaient des clips à la qualité onirique, avec des objets qui se transformaient de façon inattendue d’une image à l’autre et des arrière-plans qui se déplaçaient en violant les règles élémentaires de continuité. L’information visuelle était souvent saisissante, mais la physique était fausse d’une manière qui rendait les séquences inutilisables pour un travail professionnel.
Les options open source récentes ont considérablement accéléré l’itération. Des modèles comme Wan 2.7 T2V de WanVideo et LTX 2.3 Pro de Lightricks ont poussé la cohérence temporelle à de nouveaux niveaux, mais le défi de fond restait le même : les modèles de génération vidéo sont optimisés pour produire des images individuelles d’apparence plausible, et non des simulations physiquement exactes du monde.

À quoi ressemblent réellement les « artefacts de mouvement »
Les artefacts de mouvement sont les défaillances spécifiques qui trahissent l’origine synthétique d’une vidéo. Ils comprennent :
- Effet fantôme : résidus semi-transparents d’objets qui apparaissent aux positions qu’ils occupaient dans des images précédentes
- Tremblement : objets qui vibrent légèrement d’une image à l’autre sans cause physique
- Mains et doigts déformés : l’un des indices les plus fréquents, lorsque le nombre de doigts ou la forme des mains change d’une image à l’autre
- Instabilité de l’arrière-plan : textures des murs ou des sols qui se déplacent ou fluctuent entre les plans
- Dynamique des fluides impossible : eau qui ne coule pas, tissu qui ne tombe pas, cheveux figés en plein mouvement puis qui se téléportent
Sora 2.5 traite ces problèmes de façon systématique. Le modèle utilise un mécanisme d’attention spatio-temporelle conjointe qui traite les images non pas comme des images indépendantes, mais comme les segments d’un volume 4D continu, où le temps est la quatrième dimension. Cette approche fait de la cohérence physique une propriété structurelle du processus de génération, plutôt qu’un comportement que le modèle apprend à simuler.
💡 L’idée clé : Sora 2.5 ne simule pas la physique à partir de principes premiers. Il a appris, à partir d’une immense quantité de données vidéo, un solide a priori sur ce à quoi ressemble un mouvement physiquement plausible, puis il applique cet a priori de façon cohérente dans la dimension temporelle.
Une cohérence temporelle enfin maîtrisée
La permanence des objets d’une image à l’autre
La permanence de l’objet est la compréhension cognitive de base selon laquelle les objets continuent d’exister même lorsqu’ils sortent du champ ou changent de position. Pour les modèles de vidéo par IA, maintenir la permanence des objets signifie veiller à ce que la chemise d’une personne garde sa couleur lorsqu’elle se retourne, que la tasse de café reste sur la table lorsque la caméra s’éloigne par un panoramique puis revient, et que la queue du chien conserve la même longueur tout au long du plan.
Sora 2 était déjà nettement en avance sur ses concurrents sur ce point. Sora 2.5 va plus loin avec ce qu’OpenAI décrit comme un suivi amélioré de l’état du monde : le modèle maintient une représentation interne des positions, des propriétés et des relations des objets, qui persiste sur toute la durée du clip.
L’effet pratique est frappant. Dans les clips de test, la caméra peut effectuer un panoramique de 180 degrés puis revenir, et retrouver les objets exactement là où ils étaient, avec des ombres et un éclairage corrects pour le nouvel angle. Les personnages peuvent marcher derrière des obstacles et réapparaître correctement de l’autre côté. Les liquides peuvent être versés et s’accumuler de façon réaliste dans des récipients.

Comment la réflexion à l’échelle de la scène change tout
Dans l’ancienne approche image par image, chaque image générée se demandait : « À quoi cette image doit-elle ressembler ? » L’architecture de Sora 2.5 déplace la question vers : « Que se passe-t-il dans cette scène, et à quoi doit-elle ressembler maintenant ? »
Cette distinction peut sembler philosophique, mais elle a des conséquences concrètes. Un modèle qui raisonne au niveau de l’image générera un feu qui vacille de façon imprévisible, parce que les pixels du feu varient de manière probabiliste. Un modèle qui raisonne au niveau de la scène comprend que ce feu précis a commencé à cet endroit précis et brûle depuis tant de secondes, et que son état actuel découle causalement de tout cela.
C’est la différence entre halluciner une vidéo et s’en souvenir.
Des modèles comme Ray 3.2 de Luma AI ont également fait des progrès notables en matière de cohérence à l’échelle de la scène, notamment pour les mouvements de caméra. Seedance 2.5 de ByteDance aborde le problème sous un angle architectural différent, en privilégiant la fluidité du mouvement et la synchronisation audio. Chacun a ses atouts, mais le suivi de l’état du monde de Sora 2.5 est actuellement la mise en œuvre la plus robuste de la réflexion à l’échelle de la scène commercialement disponible.
Sora 2.5 et la physique des fluides
Eau, tissu et simulation des corps mous
Trois catégories de simulation physique restent systématiquement les plus difficiles pour les modèles de vidéo par IA : la dynamique des fluides, la simulation de tissus et la physique des corps mous. Elles sont difficiles pour exactement les mêmes raisons qu’elles sont coûteuses en calcul dans les pipelines d’effets visuels traditionnels : les équations physiques sous-jacentes produisent un comportement chaotique et non linéaire, très sensible aux conditions initiales.
Regardez de l’eau se verser depuis une carafe dans un clip de Sora 2.5, puis comparez-le à n’importe quel concurrent d’il y a deux générations. Le filet se rétrécit correctement en tombant, la tension superficielle crée une adhérence réaliste au bord du bec avant de se rompre, et les motifs d’éclaboussure à l’impact suivent la dynamique des fluides. Le modèle a vu suffisamment de séquences d’eau réelle pour que son a priori appris sur le mouvement des fluides soit désormais véritablement exact.

La simulation des tissus montre des progrès similaires. Le tissu réagit correctement à la gravité et au mouvement : un manteau se gonfle lorsqu’un personnage tourne rapidement, retombe avec un poids juste, et des plis se forment aux articulations et aux points de pression selon des schémas physiquement plausibles. Les cheveux suivent la direction du vent de façon constante tout au long d’un clip, au lieu de changer de direction d’une image à l’autre.
Pourquoi ces éléments sont si difficiles à reproduire correctement
La difficulté n’est pas seulement de calcul. Elle tient au fait que la physique des fluides et des tissus est profondément non locale : ce qui se passe dans une partie d’un matériau en mouvement dépend de ce qui se passe simultanément dans toutes les autres parties. Une vague dans l’eau affecte les conditions en amont et en aval. La tension d’un tissu en un point tire sur les zones adjacentes.
Les modèles de diffusion vidéo actuels génèrent l’information spatiale grâce à des mécanismes d’attention qui, bien que puissants, n’ont pas été explicitement conçus pour capturer ces dépendances physiques non locales. Sora 2.5 semble compenser cela par une combinaison d’un volume de données d’entraînement plus important et d’une échelle de modèle qui lui donne la capacité de représentation nécessaire pour approximer implicitement ces interactions.
💡 Pour les créateurs : cela signifie que les prompts décrivant des scénarios physiques complexes (de la pluie qui tombe sur la surface d’une flaque, de la soie soufflée par le vent, des cheveux sous l’eau) ont désormais beaucoup plus de chances de produire des séquences exploitables qu’il y a encore six mois.
Une intelligence de caméra qui paraît humaine
Un langage de plan cinématographique sans équipe de tournage
La cinématographie professionnelle possède son vocabulaire : mise au point déplacée (rack focus), effet Vertigo (dolly zoom), plan incliné (Dutch angle), caméra à l’épaule (handheld), plan de suivi, mouvement de grue ascendant. Ces termes décrivent non seulement la position de la caméra, mais aussi la relation entre la caméra et le sujet dans le temps, y compris ce que le mouvement communique sur le plan émotionnel.
Sora 2.5 a intériorisé ce vocabulaire d’une façon que les modèles précédents n’avaient pas. Demander un « travelling avant lent sur le visage d’un intervenant » produit des images où le mouvement de caméra a du poids et de l’intention. Un « plan de suivi caméra à l’épaule » produit une légère instabilité réaliste, qui donne l’impression d’être opérée par un humain plutôt que secouée au hasard.

C’est un domaine dans lequel Gen 4.5 de Runway s’est particulièrement illustré, et où Kling v3 de Kwai a réalisé des avancées notables en matière de précision du contrôle du mouvement. Le champ concurrentiel est serré sur ce point, chaque modèle affichant des forces différentes dans son interprétation du langage cinématographique.
Composition dynamique ou statique
Une caméra statique ne signifie pas que rien ne bouge. La caméra reste fixe, mais les sujets traversent le cadre, la lumière change, le mouvement ambiant se poursuit. Sora 2.5 gère particulièrement bien les clips à caméra statique grâce à un mouvement ambiant convaincant : les arbres ondulent de façon crédible, les rideaux bougent avec les courants d’air, et l’activité en arrière-plan se poursuit avec une variété appropriée.
Les clips à caméra dynamique présentent un défi différent : à mesure que la caméra se déplace, tout l’arrière-plan doit se reprojeter correctement, les zones masquées doivent être reconstituées de façon plausible, et les relations de profondeur doivent être préservées. La force de Sora 2.5 en matière de suivi de l’état du monde soutient directement les performances en caméra dynamique, puisque le modèle maintient un monde 3D cohérent dans lequel la caméra évolue, au lieu de générer de nouveaux pixels d’arrière-plan à la volée.
Face à face : les modèles qui méritent d’être suivis
Les capacités des modèles de texte vers vidéo se sont considérablement resserrées au cours de l’année écoulée. Voici une évaluation honnête de la position des principaux modèles :
| Modèle | Cohérence temporelle | Précision physique | Contrôle de caméra | Audio natif | Résolution maximale |
|---|
| Sora 2 Pro | Excellent | Excellent | Solide | Oui | 1080p |
| Veo 3.1 | Très bon | Très bon | Bon | Oui | 1080p |
| Seedance 2.5 | Bon | Bon | Bon | Oui | 1080p |
| Kling v3 | Bon | Modéré | Très bon | Partiel | 1080p |
| Ray 3.2 | Bon | Modéré | Très bon | Oui | 1080p |
| Wan 2.7 T2V | Bon | Modéré | Modéré | Non | 1080p |
| Hailuo 02 | Très bon | Bon | Modéré | Non | 1080p |

Où chaque outil l’emporte sur les autres
Aucun modèle ne fait tout le mieux. Veo 3.1 de Google produit une vidéo synchronisée avec l’audio, dont la qualité des ambiances sonores est actuellement inégalée : la pluie sonne mouillée, les pas ont la résonance correcte de la surface, et le rythme des dialogues s’accorde naturellement avec les mouvements de la bouche.
Kling v2.6 reste l’option la plus performante pour la précision du contrôle du mouvement, en particulier pour le sport et les contenus d’action où les trajectoires précises comptent. Ray 3.2 excelle dans les mouvements de caméra cinématographiques et génère des séquences à la qualité proche du cinéma, qui se marient naturellement avec des images tournées de façon professionnelle.
Seedance 2.5 de ByteDance se distingue par sa cohérence sur la durée. Jusqu’à 30 secondes de séquences temporellement cohérentes représentent un avantage pratique important pour les applications narratives où plusieurs plans doivent se raccorder.
Pour les créateurs qui veulent choisir un point de départ unique et itérer, le conseil pratique est d’adapter l’outil au type de contenu :
Des courts métrages et des récits qui fonctionnent désormais
Ce qui change pour les cinéastes indépendants
Avant l’existence de modèles de la classe de Sora 2.5, la vidéo par IA était réellement limitée à de courts clips illustratifs : présentations de produits, visuels abstraits, éléments d’arrière-plan. La qualité du mouvement n’était pas suffisante pour un travail narratif, car la cohérence des personnages faisait défaut, la physique se déréglait et les mouvements de caméra paraissaient artificiels.
L’amélioration de la cohérence temporelle dans Sora 2.5 change la donne pour les créateurs indépendants. Un cinéaste capable de rédiger des prompts détaillés et techniquement précis peut désormais produire des séquences pour :
- Plans d’établissement qui situent la scène et correspondent à l’atmosphère d’un lieu précis
- Plans d’insert montrant des objets, des environnements ou des événements évoqués dans les dialogues
- Séquences abstraites ou symboliques où le réalisme physique renforce l’impact émotionnel
- Séquences de démonstration de faisabilité pour présenter des projets à des investisseurs ou à des collaborateurs

Les possibilités narratives qui s’ouvrent
Le cadre utile n’est pas « l’IA remplace le cinéma », mais « l’IA élargit ce qui est possible à budget donné ». Un court métrage disposant d’un budget de production de $5 000 ne pouvait pas, auparavant, inclure une scène filmée depuis un hélicoptère, une séquence de foule avec une centaine de figurants, ou un cadre historique nécessitant une décoration d’époque fidèle. Avec une vidéo par IA suffisamment performante, certaines de ces séquences deviennent accessibles.
La principale limite qui subsiste concerne la cohérence des personnages d’un plan à l’autre. Si votre film exige que la même personne apparaisse dans plusieurs plans distincts générés par IA, les modèles actuels, Sora 2.5 compris, ne parviendront pas de manière fiable à conserver une géométrie du visage et des caractéristiques physiques identiques. C’est là que Kling Avatar v2 et P Video occupent un créneau précis, en s’appuyant sur des images de référence pour ancrer l’apparence des personnages d’une génération à l’autre.
La vidéo commerciale et produit, repensée
Du concept au résultat en quelques minutes
Pour les usages commerciaux, la donne est différente de celle de la fiction narrative. La vidéo commerciale est généralement courte (de 15 à 60 secondes), centrée sur les plans plutôt que sur les personnages, et fortement orientée vers la qualité visuelle et la présentation du produit plutôt que vers la continuité narrative.
C’est là que les progrès de Sora 2.5 en matière de physique portent leurs fruits le plus directement pour les professionnels. Une vidéo de produit pour une marque de soins de la peau doit rendre l’eau réaliste. Une publicité alimentaire a besoin que la vapeur, la sauce et la texture se comportent de manière convaincante. Une vidéo de mode doit faire bouger le tissu avec élégance sous le vent.

Pour de nombreuses équipes de production, le flux de travail d’un brief de vidéo commerciale ressemble désormais à ceci :
- Concept et storyboard : utilisez un grand modèle de langage (LLM) comme GPT 5 ou Claude Sonnet 5 pour prototyper rapidement des concepts à partir d’un brief
- Référence visuelle : générez des images fixes pour aligner le résultat sur les attentes du client avant de lancer la génération vidéo
- Génération vidéo : produisez des clips avec le modèle de texte vers vidéo le plus adapté au type de contenu
- Post-production : étalonnez les couleurs, ajoutez de la musique sous licence, intégrez les prises de vue produit
Pour de nombreuses applications commerciales au format court, ce pipeline ramène des journées de préproduction à quelques heures, et des jours de production à quelques minutes de temps de génération.
💡 Le seuil de qualité qui compte : la question n’est pas de savoir si la vidéo par IA est aussi belle qu’une caméra RED dans des conditions contrôlées. Il s’agit de savoir si elle est suffisamment bonne pour le canal de diffusion visé : réseaux sociaux, campagnes par e-mail, présentations ou propositions aux clients. Pour bon nombre de ces contextes, la qualité actuelle des modèles atteint déjà ce seuil.
L’architecture technique derrière le mouvement
Pourquoi les modèles de diffusion gèrent le temps différemment
Les modèles de diffusion vidéo font face à un défi que les modèles de diffusion d’images ne connaissent pas : ils doivent être cohérents selon trois dimensions spatiales et une dimension temporelle simultanément. Les premières approches géraient cela en entraînant les images de façon indépendante, ce qui explique la fréquence des artefacts temporels.
L’innovation architecturale qu’emploient les modèles de type Sora est un mécanisme d’attention spatio-temporelle conjointe. Plutôt que de ne porter son attention que sur les voisins spatiaux (les pixels proches les uns des autres dans une seule image), le modèle porte son attention sur les voisins spatio-temporels (les voxels proches les uns des autres à la fois dans l’espace et dans le temps). Il est ainsi structurellement plus difficile pour le modèle de produire des incohérences temporelles, car les mêmes poids d’attention qui assurent la cohérence spatiale locale assurent aussi la cohérence temporelle locale.

L’échelle comme a priori physique
Il n’existe aucun moteur physique explicite à l’intérieur de Sora 2.5. Le modèle n’exécute ni équations de simulation des fluides ni résolution des équations de Navier-Stokes pour le mouvement de l’eau. Il dispose en revanche d’un immense modèle statistique de l’apparence des phénomènes physiques réels dans la vidéo, construit à partir de l’entraînement sur un corpus énorme de séquences réelles.
Cette approche fonctionne mieux qu’on ne l’attendait, parce que la physique du monde réel est très régulière : l’eau se comporte de la même façon le mardi et le samedi. Un modèle entraîné sur suffisamment de données apprendra si bien la distribution des mouvements physiquement valides de l’eau que la génération d’échantillons à partir de cette distribution produit des résultats d’apparence physiquement exacte.
Cela implique que l’échelle du modèle se traduit directement en précision physique. Des modèles plus grands entraînés sur davantage de données auront des a priori physiques plus précis, ce qui correspond exactement à la trajectoire suivie par Sora depuis la version 1 jusqu’à la 2.5.
Générez dès maintenant des vidéos par IA sur PicassoIA
Chaque modèle évoqué dans cet article est accessible depuis une seule plateforme. PicassoIA héberge Sora 2, Sora 2 Pro, Veo 3.1, Seedance 2.5, Kling v3, Ray 3.2, ainsi que plus de 80 autres modèles de texte vers vidéo réunis au même endroit, aux côtés de la suite complète de grands modèles de langage pour affiner les prompts.
La façon la plus rapide de comprendre ce que Sora 2.5 fait bien avec le mouvement consiste à générer des clips avec le même prompt sur plusieurs modèles et à comparer directement les résultats. Commencez par un scénario physique simple (de l’eau qui se verse, un tissu dans le vent, une personne qui marche sur une surface texturée) où la précision physique est facile à évaluer visuellement. Les différences entre modèles apparaîtront immédiatement, et vous saurez rapidement quel outil convient à quel type de projet.

La précision du prompt est la compétence qui progresse le plus vite. Les prompts vagues donnent des résultats fades et génériques. Les prompts détaillés, qui précisent la direction de l’éclairage, les caractéristiques de l’objectif, les propriétés physiques des matériaux et la vitesse du mouvement, offrent au modèle suffisamment de contraintes pour produire des séquences qui correspondent à une vision créative claire.
Commencez à générer. L’écart entre ce que la vidéo par IA pouvait faire il y a un an et ce qu’elle peut faire aujourd’hui est assez grand pour que la plupart des hypothèses sur ses limites soient désormais dépassées. Les modèles disponibles aujourd’hui, y compris Sora 2.5 et ses concurrents sur PicassoIA, sont capables de produire des séquences qui auraient exigé une équipe, du matériel et des repérages importants il y a seulement 18 mois.
Cet écart continue de se réduire. Les créateurs qui expérimentent dès maintenant développent une bonne maîtrise des prompts et l’intuition des flux de travail, qui compteront le plus à mesure que la technologie progressera.