Ce qui a changé dans la génération 3D par IA cette année : les grands virages expliqués

La génération 3D par IA a connu son plus grand virage depuis des années. Le Gaussian Splatting a remplacé le NeRF comme pipeline dominant, les modèles texte vers 3D ont enfin produit des résultats exploitables, et la génération en temps réel est devenue une réalité pour les créateurs individuels. Cette analyse passe en revue chaque changement majeur et montre concrètement ce qu’il implique pour votre flux de travail créatif dès maintenant.

Ce qui a changé dans la génération 3D par IA cette année : les grands virages expliqués
Cristian Da Conceicao
Fondateur de Picasso IA

Il y a trois ans, générer un objet 3D exploitable à partir d’une seule photographie ressemblait à de la science-fiction. Cette année, cela ressemblait à un mardi après-midi tranquille. Le rythme des changements dans la génération 3D par IA entre 2024 et 2025 a été remarquable : des méthodes fondamentales ont été remplacées, de nouveaux modèles open source ont inondé l’écosystème, et des workflows autrefois réservés aux studios bien financés sont désormais accessibles aux créateurs individuels sur un ordinateur portable grand public. Voici ce qui a réellement changé, pourquoi c’est important et ce que cela implique pour votre travail créatif dès maintenant.

L’ère du NeRF touche presque à sa fin

Les Neural Radiance Fields (NeRF) ont dominé le discours autour de la reconstruction 3D par IA pendant plusieurs années. Si vous tourniez autour d’un objet avec un appareil photo, le NeRF pouvait synthétiser des vues inédites de cet objet avec une fidélité impressionnante. Mais en pratique, son utilisation exigeait des heures d’entraînement par scène, des besoins de calcul énormes, et un résultat enfermé dans une représentation volumétrique en boîte noire plutôt que dans un maillage 3D propre et modifiable. Pour intégrer une sortie NeRF dans Blender, un moteur de jeu ou un pipeline de production cinématographique, il fallait des étapes supplémentaires pénibles que la plupart des studios n’étaient pas prêts à assumer.

Ce qui rendait le NeRF passionnant

L’article fondateur sur le NeRF a introduit l’idée de représenter une scène 3D comme une fonction neuronale continue optimisée à partir d’images 2D. C’était élégant et cela produisait des vues inédites étonnamment nettes. La recherche qui a suivi a explosé : Instant NGP, Mip-NeRF 360, Zip-NeRF et des dizaines de variantes se sont attaqués aux principaux freins, la vitesse et l’échelle. Pendant un temps, le NeRF a semblé être la direction inévitable pour la capture et la reconstruction 3D.

Pourquoi il a atteint son plafond

Le problème était structurel. Les représentations NeRF sont implicites, ce qui signifie qu’il est difficile d’en extraire la géométrie, de modifier des objets individuels ou d’exporter vers des formats de maillage standard. Le rendu en temps réel à partir d’un NeRF nécessitait des astuces propres au matériel et des étapes de baking. Pour les créateurs professionnels qui travaillent quotidiennement dans des outils DCC et des moteurs de jeu, la friction était tout simplement trop élevée. La communauté s’était attachée au concept, mais l’outillage n’a jamais vraiment suivi l’ambition.

Photographe capturant une figurine en céramique sous plusieurs angles comme référence pour la reconstruction 3D

Le Gaussian Splatting a bouleversé tout le domaine

Le 3D Gaussian Splatting (3DGS) est arrivé fin 2023, et dès 2025 il avait effectivement détrôné le NeRF comme méthode par défaut pour la reconstruction 3D du monde réel. Au lieu d’une fonction neuronale implicite, le Gaussian Splatting représente une scène comme des millions de minuscules ellipsoïdes 3D, chacun doté d’une position, d’une rotation, d’une échelle, d’une opacité et d’une couleur. La rastérisation de ces ellipsoïdes est assez rapide pour tourner en temps réel sur des GPU grand public.

Des chiffres de vitesse qui ont fait changer d’avis

Là où un NeRF classique pouvait mettre de 6 à 12 heures pour s’entraîner sur une scène modérément complexe, le Gaussian Splatting a ramené ce temps à moins de 30 minutes pour une qualité comparable. Plus important encore, la vitesse de rendu est passée de sous le temps réel à un véritable 60 fps et plus sur du matériel de milieu de gamme. Ce n’est pas une amélioration marginale. C’est un changement de catégorie.

La communauté de recherche ne s’est pas arrêtée là. Les pipelines d’extraction de maillage comme SuGaR et les variantes du Gaussian Splatting 2D produisent désormais une géométrie propre et modifiable directement à partir de scènes gaussiennes. Des plugins communautaires permettent de charger une scène 3DGS dans Unreal Engine, Unity et Blender en quelques clics. Le parcours allant de la vidéo tournée avec un téléphone à une 3D interactive se mesure désormais en une après-midi, et non plus en une semaine.

Le bond de qualité du rendu

Au-delà de la vitesse, la qualité visuelle a dépassé ce que le NeRF pouvait produire dans des conditions de capture bien éclairées et contrôlées. Les détails fins de surface, les matériaux translucides et les interactions complexes de la lumière, que le NeRF avait tendance à estomper ou à approximer, sont désormais rendus avec bien plus de fidélité. Le compromis, c’est que les gaussiennes peuvent paraître « splodgy » dans les zones où la couverture de capture est clairsemée. Mais des outils comme Luma AI, Polycam et plusieurs pipelines open source utilisent désormais le 3DGS comme méthode principale de reconstruction. Si vous avez testé récemment l’une de ces applications, vous utilisiez le Gaussian Splatting sans forcément connaître le nom.

💡 À savoir : les scènes 3DGS peuvent être exportées directement vers Unreal Engine, Unity et Blender grâce à des plugins communautaires activement maintenus et améliorés chaque mois.

Deux écrans côte à côte montrant une reconstruction en nuage de points face à un modèle 3D lisse dans un laboratoire de recherche

Les modèles texte vers 3D sont enfin devenus utiles

Pendant la majeure partie de 2023 et au début de 2024, les modèles texte vers 3D impressionnaient davantage en démonstration qu’en pratique. DreamFusion a montré ce qui était possible, mais les résultats étaient flous, informes et affectés par le fameux problème de Janus : le modèle plaquait un visage ou un élément reconnaissable sur chaque face visible d’un objet, faute de véritable conscience spatiale d’une géométrie 3D cohérente.

En 2025, cette époque est en grande partie derrière nous. Une nouvelle génération de modèles texte vers 3D et image vers 3D est arrivée, avec une cohérence multi-vues intégrée à l’architecture dès le départ, et non ajoutée après coup.

La 3D à partir d’une seule image fonctionne désormais

Le changement pratique le plus important est que la reconstruction 3D à partir d’une seule image est devenue réellement fiable. Des modèles comme Zero123++, TripoSR, CraftsMan et InstantMesh peuvent prendre une seule photographie et produire, en quelques secondes, soit un ensemble multi-vues cohérent, soit un maillage 3D direct. Les résultats ne sont pas au niveau d’un rendu final, mais ils constituent un point de départ utilisable pour un travail professionnel. Cela modifie sensiblement l’économie de la modélisation de concepts, de la visualisation de produits et de la création d’assets pour les jeux.

MéthodeSituation en 2023Situation en 2025
Texte vers 3DTaches floues, artefacts de JanusGéométrie cohérente, textures exploitables
Image vers 3D (image unique)Preuve de conceptPoint de départ prêt pour la production
Vidéo vers 3DDémo de recherche uniquementPipeline pratique pour une capture contrôlée
Génération en temps réelImpossibleMoins d’une seconde sur GPU grand public

Les modèles 3D open source sont arrivés

La disponibilité en open source de modèles 3D performants est en soi un grand événement de cette année. Shap-E, Large3D, InstantMesh et plusieurs versions récentes ont été publiés avec des licences permissives. Les développeurs indépendants et les chercheurs peuvent désormais faire du fine-tuning, héberger eux-mêmes et intégrer des modèles 3D d’IA sans payer de frais d’API à chaque génération. L’écosystème environnant s’est développé rapidement, avec des nœuds ComfyUI, des extensions Blender et des workflows web qui élargissent tous l’accès aux créateurs qui ne travaillent pas dans un grand studio.

Jeune designer tapant un prompt texte sur son ordinateur portable, un grand écran à côté d’elle montre un modèle 3D prenant forme à partir d’une forme abstraite

Les modèles de diffusion sont passés dans l’espace 3D

Le virage conceptuel le plus important de l’année écoulée est que les modèles de diffusion 2D sont devenus la colonne vertébrale de la génération 3D. Plutôt que d’entraîner des architectures 3D natives coûteuses depuis zéro, les chercheurs ont découvert que les modèles de diffusion 2D pré-entraînés contiennent déjà suffisamment de connaissances spatiales et matérielles pour superviser la reconstruction 3D, même sans aucune donnée d’entraînement 3D explicite dans leur pipeline.

La diffusion multi-vues a résolu un problème difficile

Le défi central de la génération texte vers 3D a toujours été la cohérence : si vous générez plusieurs vues d’un même objet, celles-ci doivent concorder géométriquement. Les modèles de diffusion multi-vues, entraînés à générer plusieurs points de vue simultanément grâce à des couches d’attention partagées, ont répondu directement à ce problème. Zero123, MVDiffusion, SyncDreamer et leurs successeurs l’ont abordé de différentes manières. Résultat : vous pouvez aujourd’hui générer six vues cohérentes ou plus d’un objet 3D et les transmettre à un pipeline de reconstruction par Gaussian Splatting ou par maillage pour obtenir un résultat cohérent.

De la 3D sans données d’entraînement 3D

Cela compte plus qu’il n’y paraît au premier abord. Entraîner un modèle à produire directement de la 3D exige de grands jeux de données 3D annotés, coûteux, lents à produire et peu variés. Entraîner sur des images 2D et utiliser les a priori de diffusion comme superviseurs géométriques contourne entièrement cette limite. Internet fournit des milliards d’images 2D. En apprenant aux modèles à extraire des connaissances spatiales et structurelles de ces images, les chercheurs ont ouvert une voie vers la génération 3D qui évolue avec la disponibilité des données 2D plutôt qu’avec le budget d’annotation 3D.

💡 Conséquence pratique : c’est pourquoi les progrès de la génération texte vers 3D se sont accélérés si nettement une fois que les grands modèles de diffusion 2D sont devenus largement disponibles. Des modèles 2D plus performants améliorent directement la qualité des résultats 3D qui les utilisent comme a priori géométriques.

Deux professionnels dans un bureau open space moderne comparant plusieurs variantes de modèles 3D sur un grand écran mural

La vidéo vers 3D est devenue un vrai workflow

L’une des révolutions les moins couvertes de cette année : l’entrée vidéo est désormais pleinement prise en charge dans les pipelines de reconstruction 3D. Auparavant, la reconstruction à partir de vidéo était possible, mais elle exigeait une sélection manuelle minutieuse des images et un prétraitement pour obtenir des résultats exploitables. Aujourd’hui, les modèles peuvent traiter une courte vidéo tournée avec un téléphone (10 à 30 secondes de séquence) d’un objet et produire un asset 3D exploitable avec une intervention minimale de l’opérateur.

Des clips de 30 secondes aux maillages

Des pipelines comme MonST3R (Monocular Scene Reconstruction in the Wild), RealDreamer et plusieurs implémentations commerciales acceptent désormais directement une vidéo de smartphone standard en entrée. Ils gèrent le flou de bougé, l’éclairage irrégulier et les éléments dynamiques mineurs bien mieux que leurs prédécesseurs. Pour la photographie de produits, la numérisation d’objets patrimoniaux et la prévisualisation architecturale, c’est devenu un outil pratique du quotidien, et non plus une expérience de laboratoire réservée aux spécialistes.

Ce qui coince, ce qui passe

Encore vraiment difficile en 2025 : les surfaces très réfléchissantes ou transparentes comme le verre, le chrome et l’eau ; les structures très fines comme le grillage, les cheveux ou la corde ; et les grandes scènes en extérieur avec un mouvement important du sujet pendant la capture. Aucun modèle ne gère encore ces cas de façon fiable.

Fonctionne bien aujourd’hui : les objets mats avec une texture de surface régulière, les produits manufacturés compacts, les intérieurs architecturaux sous un éclairage contrôlé, et les objets organiques comme la céramique, le mobilier ou le tissu. La plage de cas pratiques est nettement plus large qu’il y a 18 mois, même si elle n’est pas encore universelle.

Intérieur d’un studio de développement de jeux avec un développeur devant un bureau debout à trois écrans affichant un pipeline d’assets de personnages 3D

La génération 3D en temps réel est arrivée

Peut-être le développement le plus surprenant de l’année écoulée : la génération 3D en temps réel à partir de texte est désormais techniquement possible. Elle n’est pas encore de qualité production à grande échelle pour tous les cas d’usage, mais le seuil a été franchi. Des modèles de recherche génèrent des assets 3D grossiers en moins de deux secondes sur du matériel grand public haut de gamme, avec une qualité qui progresse rapidement à chaque nouvelle publication.

L’inférence en moins d’une seconde a changé la façon de travailler

Quand une génération prend 20 minutes, vous concevez votre flux de travail autour de lots. Vous mettez des requêtes en file d’attente, vous faites autre chose, et vous revenez plus tard évaluer les résultats. Quand une génération prend deux secondes, le modèle d’interaction change complètement. Vous itérez en temps réel. Vous acceptez un résultat ou vous essayez immédiatement un autre prompt. Ce changement de vitesse de la boucle de rétroaction ne modifie pas seulement la rapidité de votre travail, mais aussi ce que vous osez essayer, ce qui influe directement sur la qualité et l’originalité de ce que vous produisez.

La configuration matérielle requise a baissé

Faire tourner le 3D Gaussian Splatting et les derniers modèles image vers 3D ne nécessite plus une grappe de GPU d’entreprise. Un GPU grand public moderne de la classe RTX 4070 gère la plupart des workflows pratiques sans infrastructure spécialisée. L’inférence dans le cloud est également devenue nettement moins chère, avec des coûts par génération assez faibles pour que les créateurs individuels l’utilisent régulièrement, sans financement institutionnel ni abonnements onéreux.

💡 Pour mettre en perspective : un scan de photogrammétrie professionnel qui coûtait à un studio plusieurs milliers de dollars en matériel et des heures de travail d’opérateur en 2020 peut aujourd’hui être approximé en un point de départ exploitable avec des outils d’IA, gratuitement ou presque. L’écart entre les capacités des studios et celles des créateurs individuels s’est nettement réduit.

Architecte examinant de grands modèles de bâtiments 3D sur un écran tactile professionnel dans un bureau moderne et lumineux

Ce que font réellement les créateurs avec tout cela

Les évolutions technologiques ne comptent que lorsqu’elles changent ce que les gens créent. Voici comment les avancées de la 3D par IA se traduisent concrètement en changements de workflow dans différents domaines créatifs.

Les studios de jeux ont changé de point de départ

Les studios de jeux indépendants et les équipes de taille moyenne sont aujourd’hui les adoptants les plus actifs des outils 3D par IA. Le cas d’usage typique ne consiste pas à remplacer un artiste. Il s’agit de changer le point de départ. Au lieu qu’un artiste 3D passe quatre heures à modéliser un accessoire à partir de zéro, il utilise un outil d’IA pour générer un maillage grossier à partir d’une image de référence, le nettoie dans son outil DCC préféré et applique des textures finales. Une tâche qui occupait auparavant une demi-journée de travail prend désormais moins de 90 minutes. Le jugement et le savoir-faire de l’artiste restent au centre. Le travail répétitif de mise en place a largement disparu.

Les grands studios observent de près mais avancent plus lentement. Les questions liées à la provenance des données d’entraînement et à la compatibilité avec la propriété intellectuelle des dépendances existantes du pipeline sont de véritables contraintes. Mais la pression concurrentielle exercée par les petits studios, qui avancent plus vite, pousse chaque grand studio à mener une évaluation interne plus sérieuse.

Architectes, designers et cinéastes

La visualisation architecturale est l’un des secteurs professionnels qui adoptent le plus rapidement ces outils. Pouvoir partir d’un croquis grossier ou d’une photographie d’un site existant et créer en moins d’une heure un environnement d’exploration 3D interactif pour une présentation client constitue un véritable changement dans la façon dont se déroulent les propositions commerciales et les validations de conception.

Les designers produit utilisent des workflows similaires pour la visualisation rapide de concepts, en produisant des représentations de type 3D d’idées de produits physiques sans construire de prototypes physiques. Dans le cinéma et la télévision, les outils 3D par IA servent à la prévisualisation et à l’extension grossière de décors, tandis que les grandes maisons d’effets visuels attendent des indications plus claires sur la propriété intellectuelle avant d’intégrer des assets générés par IA dans leurs rendus finaux.

SecteurCas d’usage principalNiveau d’adoption
Développement de jeux indépendantsGénération de maillages d’accessoires et d’environnementsÉlevé, en croissance
Visualisation architecturaleMaquettes de concept, visites clientÉlevé
Cinéma et VFXPrévisualisation, modélisation grossière de décorsMoyen, prudent
Design produitVisualisation de concepts, revue de prototypesMoyen
E-commercePhotographie de produits à partir de scans 3DÉmergent

Gros plan aérien de mains sur un clavier mécanique avec un terrain forestier photoréaliste généré visible sur l’écran en arrière-plan

Créez dès maintenant des images d’allure 3D sur PicassoIA

Si les pipelines dédiés à la reconstruction 3D ont fait d’énormes progrès, de nombreux créateurs ont besoin de quelque chose de plus rapide et de plus simple : des images photoréalistes qui transmettent une forte profondeur, du volume et une présence spatiale, sans la charge d’un pipeline 3D complet. C’est précisément là que les modèles de génération d’images par IA sur PicassoIA sont devenus des outils étonnamment performants pour une production visuelle de style 3D.

Flux et Seedream pour la profondeur et le volume

Flux Dev et Flux Pro excellent particulièrement à produire des images dotées d’une profondeur spatiale et d’une superposition de plans convaincantes. Lorsque votre prompt précise des éléments de premier plan, de second plan et d’arrière-plan avec des relations de distance claires et une direction de lumière réaliste, ces modèles rendent le résultat avec une cohérence spatiale impressionnante. L’image paraît tridimensionnelle, même à plat.

Seedream 4.5 va plus loin avec une sortie en 4K et une excellente gestion des environnements volumétriques complexes : scènes de forêt dense, espaces intérieurs à sources lumineuses multiples et prises de vue de produits avec des reflets de surface réalistes. Pour les créateurs qui ont besoin de visuels de style 3D sans la charge d’un pipeline 3D, c’est l’une des options les plus performantes disponibles actuellement sur la plateforme.

Pour une fidélité maximale, Flux 1.1 Pro Ultra produit des images de 4 mégapixels avec le type de texture de surface et d’éclairage volumétrique qui donne aux images planes une véritable dimension spatiale. Wan 2.7 Image Pro propose une sortie en 4K avec un caractère stylistique particulièrement adapté aux sujets de visualisation de produits et d’architecture.

Les étapes simples pour commencer dès aujourd’hui

Obtenir des résultats convaincants d’allure 3D avec la génération d’images repose sur des habitudes de prompt constantes :

  • Précisez l’objectif et la profondeur de champ : un prompt tel que « shot with 85mm f/1.4 lens, shallow depth of field with sharp foreground and soft background » signale directement et de façon fiable la profondeur spatiale au modèle.
  • Décrivez explicitement la lumière volumétrique : « Volumetric morning light from upper left, light rays visible in dust particles, soft shadow falloff across midground » crée une profondeur physique dans la scène rendue.
  • Structurez votre description de scène par couches spatiales : décrivez les éléments de premier plan, de second plan et d’arrière-plan comme des couches spatiales distinctes. Un prompt structuré ainsi produit de façon constante une profondeur perçue plus forte qu’une description plate sur une seule couche.
  • Utilisez Flux Kontext Pro pour l’édition spatiale : une fois que vous disposez d’une bonne image de base, Flux Kontext Pro vous permet d’ajuster des relations de profondeur précises ou de remplacer des éléments d’arrière-plan sans tout régénérer depuis le début.
  • Faites un upscaling pour les détails de surface : passez votre image générée par les outils de Super Resolution de PicassoIA pour faire ressortir les textures fines des matériaux en 2x ou 4x, ce qui augmente sensiblement la perception du volume et du réalisme des matières.

À essayer aussi : GPT Image 2 pour les scènes complexes avec plusieurs éléments spatiaux en interaction, et Flux 2 Pro pour des sorties haute fidélité où la précision des textures et la définition des matières comptent le plus. Les deux sont disponibles sur PicassoIA, aux côtés du catalogue complet de plus de 90 modèles de génération d’images à partir de texte sur picassoia.com/en/all-models.

Créatrice de contenu souriante devant les résultats d’une plateforme de génération d’images par IA affichés sur un double écran dans un bureau à domicile

Le changement continue de s’accélérer

La génération 3D par IA en 2025 n’est pas une technologie stabilisée. C’est un domaine en mouvement, où de nouveaux modèles, méthodes et benchmarks arrivent toutes les quelques semaines. Ce qui a changé cette année, ce n’est pas seulement la capacité, c’est l’élan. Le Gaussian Splatting a détrôné le NeRF. Les modèles de diffusion sont devenus le moteur de la qualité des résultats 3D. La reconstruction à partir d’une seule image est passée de curiosité de recherche à workflow pratique. La génération en temps réel est passée de l’impossible à l’accessible sur du matériel grand public.

Si vous n’avez pas réexaminé ce que les outils 3D par IA peuvent faire depuis le début de 2024, l’écart entre votre représentation mentale et l’état actuel du domaine est considérable. Pour les créateurs qui veulent produire dès maintenant des images dotées d’une véritable présence spatiale, sans attendre que les pipelines 3D dédiés gagnent encore en maturité, PicassoIA propose certains des modèles de génération les plus performants disponibles, de Flux Dev et Seedream 4.5 à Flux 1.1 Pro Ultra et au-delà. Les outils sont là. Allez créer quelque chose avec de la profondeur.

Professionnel de la création debout dans un studio sombre face à un immense écran affichant une scène forestière 3D photoréaliste et d’une finesse saisissante, éclairée par une lumière volumétrique

Partager cet article

Choisissez votre langue