Tongyi Wanxiang 2.6 : le générateur d’images d’IA expliqué

Tongyi Wanxiang 2.6 est la plateforme de synthèse d’images par IA la plus aboutie d’Alibaba, fondée sur des années de recherche en compréhension multimodale et en génération haute résolution. Cet article détaille ses capacités réelles, la manière dont le modèle gère le photoréalisme et les esthétiques culturelles chinoises, et sa comparaison avec les autres modèles de pointe disponibles aujourd’hui, y compris les solutions d’accès pour les utilisateurs du monde entier.

Tongyi Wanxiang 2.6 : le générateur d’images d’IA expliqué
Cristian Da Conceicao
Fondateur de Picasso IA

Le paysage de la génération d’images par IA vient d’accueillir un nouvel acteur sérieux, qui mérite votre attention. Tongyi Wanxiang 2.6 d’Alibaba Cloud représente la dernière version de l’une des plateformes texte vers image les plus capables de Chine, et les améliorations de cette version sont suffisamment importantes pour changer la façon dont les professionnels de la création envisagent les outils d’IA non occidentaux. Que vous produisiez du contenu pour les marchés asiatiques, que vous construisiez des chaînes de création multilingues ou que vous souhaitiez simplement comprendre l’évolution du domaine, Wanxiang 2.6 mérite un examen lucide.

Espace de travail créatif avec des mains tapant des prompts sur un clavier, et des images générées par IA affichées sur un écran à l’arrière-plan

Ce qu’est réellement Tongyi Wanxiang 2.6

Tongyi Wanxiang (通义万象) se traduit approximativement par « vision globale du sens » en chinois, une ambition bien adaptée à une plateforme conçue pour gérer tout, de la génération d’images photoréalistes à la synthèse vidéo et à la compréhension de contenus multimodaux.

La version 2.6 s’appuie sur la famille plus large de modèles d’IA Tongyi d’Alibaba, qui comprend des grands modèles de langage, la reconnaissance vocale et des outils de génération de vidéos. Il ne s’agit pas d’une application grand public autonome, mais plutôt d’une plateforme orientée API, destinée aux développeurs d’entreprise, aux créateurs de contenus et aux créateurs de plateformes au sein de l’écosystème Alibaba Cloud.

L’architecture qui le sous-tend

Tongyi Wanxiang 2.6 repose sur une architecture de diffusion avec des composants transformers, comparable dans son principe à celle de modèles tels que Stable Diffusion 3. Ce qui le distingue, c’est le jeu de données d’entraînement, qui comprend en grande partie des images de haute qualité en langue chinoise, des références visuelles propres à la culture et un conditionnement par prompts multilingues.

Cela compte concrètement. Lorsque vous rédigez un prompt en chinois ou faites référence à des concepts culturellement spécifiques, le modèle affiche un alignement nettement meilleur que les alternatives entraînées en Occident. Les esthétiques de l’animation japonaise, les styles de peinture à l’encre traditionnelle et les références à l’architecture d’Asie de l’Est sont tous rendus avec une précision notablement supérieure à celle des modèles entraînés principalement sur des données web en anglais.

L’ambition d’IA d’Alibaba

Tongyi Wanxiang s’inscrit dans la stratégie plus large d’IA d’Alibaba Cloud. L’infrastructure qui alimente les plateformes e-commerce d’Alibaba, y compris la génération d’images de produits en temps réel et la production créative automatisée à grande échelle, soutient l’investissement continu dans les capacités de synthèse visuelle. La version 2.6 traite spécifiquement trois domaines que l’équipe a publiquement reconnus comme des faiblesses des versions précédentes : la lisibilité du texte dans les images générées, le respect des prompts pour les scènes complexes à plusieurs sujets et la cohérence de la sortie haute résolution au-delà de 2K.

Cour d’un temple chinois traditionnel à l’aube, avec une pagode rouge, des lanternes de pierre et des pétales de fleurs de cerisier tombant le long d’un chemin de pierre embrumé

Ce qui a changé dans la version 2.6

Un texte plus net dans les images générées

L’un des problèmes les plus persistants de tous les générateurs d’images par IA concerne le rendu du texte. Les mots et les lettres présents dans les images générées apparaissent souvent flous, brouillés ou stylistiquement incohérents. Tongyi Wanxiang 2.6 montre ici une amélioration mesurable.

Le modèle peut désormais restituer avec précision de courtes phrases, des noms de marques et des enseignes, à condition de les demander explicitement dans le prompt. C’est important pour les applications commerciales comme les maquettes de produits, les visuels pour les réseaux sociaux et les supports publicitaires, où un texte lisible n’est pas négociable.

💡 Conseil pratique : même avec ces améliorations, limiter le texte dans l’image à 3 à 5 mots maximum donne des résultats systématiquement meilleurs. Les phrases complexes perdent encore en lisibilité lorsque la taille diminue.

Une meilleure composition à plusieurs sujets

Les versions précédentes peinaient lorsque les prompts décrivaient des scènes comportant plusieurs personnes ou objets distincts, nécessitant des relations spatiales précises. La version 2.6 introduit des mécanismes d’attention spatiale améliorés, qui produisent une séparation plus nette entre les sujets et un rendu plus fidèle des relations décrites, comme « une femme debout derrière un homme assis à une table ».

Cette amélioration touche directement les cas d’usage de la photographie commerciale, des shootings de mode et des visuels de produits en contexte, où la maîtrise de la composition est essentielle.

Gestion de la résolution au-delà de 2K

Jeune femme est-asiatique aux longs cheveux noirs debout dans une serre de jardin botanique ensoleillée, entourée de vignes de glycine violette

Wanxiang 2.6 prend en charge la génération native à des résolutions allant jusqu’à 4096 x 4096 pixels pour certains modes de sortie, avec une cohérence des détails améliorée aux grandes dimensions. Les versions précédentes présentaient une dégradation notable des détails fins, comme la texture des tissus, les pores de la peau et les mèches de cheveux, lorsqu’elles étaient upscalées ou générées à de grandes dimensions.

L’amélioration est visible : les recadrages de portraits en gros plan issus de générations en 4K montrent des détails de pores de la peau, une netteté des mèches de cheveux individuelles et des motifs de tissage des étoffes qui nécessitaient auparavant des outils d’upscaling en post-traitement pour être obtenus.

Comment il se compare à la concurrence

C’est ici que le contexte compte le plus. Tongyi Wanxiang 2.6 n’existe pas en vase clos. Il évolue sur un marché encombré de systèmes texte vers image très performants, et l’histoire de la comparaison est plus nuancée qu’un simple classement.

Face aux modèles occidentaux de pointe

ModèlePhotoréalismeEsthétique chinoiseTexte dans l’imageAccès
Tongyi Wanxiang 2.6SolideExcellenteAmélioréAPI/Entreprise
GPT Image 2ExcellentBonneSolideLarge
Flux 1.1 Pro UltraExcellentBonneModéréLarge
Gemini 2.5 Flash ImageSolideBonneSolideLarge
Stable Diffusion 3BonModéréeModéréOpen source

Le tableau raconte une histoire intéressante. Pour le photoréalisme généraliste et un accès facile, Flux 1.1 Pro Ultra Finetuned et GPT Image 2 restent globalement plus performants pour les contenus centrés sur l’Occident. Là où Wanxiang 2.6 prend l’avantage, c’est dans les contenus culturellement spécifiques et dans l’intégration à l’ensemble d’outils d’Alibaba Cloud.

Vue panoramique en heure dorée de la skyline de Shanghai, reflétée dans le fleuve Huangpu depuis la promenade du Bund

Face aux concurrents chinois en IA

La concurrence la plus intéressante se joue au sein même de l’écosystème chinois de l’IA.

Seedream 4.5 de ByteDance s’est imposé comme un rival sérieux, avec des performances particulièrement solides en sortie 4K et en diversité créative. L’avantage de ByteDance tient au flux de données créatives de TikTok et de Douyin, qui donne à Seedream un bon alignement sur les tendances visuelles contemporaines.

Hunyuan Image 2.1 de Tencent se positionne directement sur le marché multimodal des entreprises. Hunyuan bénéficie historiquement d’une meilleure intégration à l’écosystème de contenus de WeChat, tandis que Wanxiang 2.6 a des liens plus profonds avec le commerce électronique et l’infrastructure cloud d’Alibaba.

Dreamina 3.1 de ByteDance cible le créneau de la photographie cinématographique en 4MP et affiche des résultats compétitifs dans l’imagerie éditoriale et la mode.

La concurrence à trois entre Alibaba, ByteDance et Tencent accélère des progrès notables en matière de capacités, à un rythme que les observateurs occidentaux ont souvent du mal à suivre.

💡 Bon à savoir : ces modèles d’IA chinois sont tous accessibles via la plateforme PicassoIA, ce qui vous permet de les tester sans passer par des contrats d’API d’entreprise ni par des comptes cloud propres à la Chine.

Ce que Wanxiang 2.6 fait réellement bien

Sujets humains photoréalistes

La génération de portraits avec Wanxiang 2.6 est réellement solide, en particulier pour les sujets est-asiatiques. Le modèle dispose d’une représentation d’entraînement nettement meilleure des traits du visage, des teints et des types de cheveux est-asiatiques, par rapport aux modèles entraînés principalement sur des jeux de données en anglais.

Pour les marques ou les créateurs qui produisent du contenu destiné aux marchés sinophones, cet avantage n’est pas mineur. Générer des images photoréalistes de style de vie, des photos de placement de produits et du contenu de mode mettant en scène des sujets asiatiques, avec une qualité constante, a longtemps exigé un post-traitement important ou des modèles spécialisés issus d’un fine-tuning.

Deux professionnels de la création travaillant côte à côte à des bureaux voisins dans un studio moderne en open space, l’un utilisant une tablette graphique et l’autre tapant des prompts

Traiter les esthétiques traditionnelles

La manière dont le modèle gère les styles visuels chinois traditionnels est ce qui le distingue le plus nettement de toute alternative occidentale :

  • La peinture à l’encre (水墨画) : les prompts produisent des résultats avec un caractère de coup de pinceau authentique et des dégradés tonaux
  • L’architecture traditionnelle, y compris les structures des dynasties Tang et Song, est rendue avec des proportions historiquement exactes
  • Les images de fêtes et de cérémonies (Fête des lanternes, Fête du printemps, Fête de la mi-automne) montrent une composition sensible à la culture
  • Les textiles traditionnels, y compris les motifs de broderie de soie et les détails des étoffes hanfu, font preuve d’une grande précision

Cela s’étend aussi aux références esthétiques japonaises et coréennes, avec toutefois une cohérence un peu moindre que pour les contenus purement chinois.

La photographie de produits e-commerce

Smartphone premium posé sur un plan de travail en marbre blanc, affichant sur son écran un portrait vibrant généré par IA, à côté d’une petite plante grasse

C’est sans doute l’usage concret le plus fort de Wanxiang 2.6. L’activité principale d’Alibaba est le commerce électronique, et le modèle a été explicitement optimisé pour les cas d’usage de la photographie commerciale de produits.

Les résultats générés pour les visuels de produits en contexte, les images de produits sur fond blanc épuré et les images de placement contextuel de produits affichent une solide qualité commerciale, avec une bonne maîtrise de l’éclairage et une fidélité convaincante des matériaux de surface. Pour les vendeurs sur Taobao, Tmall ou les plateformes internationales d’Alibaba, cette fonctionnalité a des implications directes sur le chiffre d’affaires.

Ses points faibles

L’accessibilité pour les développeurs internationaux

C’est la limite pratique la plus importante. Tongyi Wanxiang 2.6 est accessible principalement via l’API DashScope d’Alibaba Cloud, qui exige :

  • Un numéro de téléphone chinois ou un compte Alibaba Cloud vérifié pour un accès complet
  • Une documentation principalement en chinois, avec une traduction anglaise partielle
  • Une tarification exprimée en RMB, avec une facturation internationale complexe
  • Des questions de latence pour les utilisateurs physiquement éloignés des régions serveurs d’Alibaba

Pour les développeurs hors de Chine, obtenir un accès de production à Wanxiang 2.6 implique des frictions que les API occidentales comparables n’imposent pas. C’est un véritable frein à l’adoption, indépendamment de la qualité technique du modèle.

Les différences dans l’ingénierie des prompts

Graphiste femme debout devant une grande table de conférence couverte d’images imprimées générées par IA et de maquettes de design, qu’elle examine et organise

Les utilisateurs habitués aux styles de prompts optimisés pour Flux Kontext Dev ou Wan 2.7 Image Pro constateront que Wanxiang 2.6 demande des ajustements. Le modèle répond différemment aux modificateurs de qualité d’inspiration occidentale comme « Kodak Portra » ou « Leica lens », et tire davantage profit d’une construction de scène descriptive que de l’empilement de mots-clés.

Les prompts en anglais fonctionnent, mais les meilleures performances du modèle sont obtenues avec :

  1. Des descriptions spatiales plus explicites de la disposition de la scène
  2. Une terminologie artistique chinoise employée en translittération anglaise
  3. Des descriptions d’éclairage plutôt que des références à des marques d’appareils photo ou de pellicules occidentales
  4. Des prompts plus longs et structurés plutôt que des listes de mots-clés

L’anatomie et les poses complexes

Comme la plupart des modèles de diffusion de dernière génération, Wanxiang 2.6 peine encore avec l’anatomie humaine complexe dans des poses inhabituelles. Les mains, les pieds et les interactions à plusieurs personnes dans des agencements physiquement exigeants peuvent produire des erreurs anatomiques qui nécessitent une nouvelle génération ou une correction par inpainting. C’est une limite propre à l’ensemble du secteur, et non spécifique à Wanxiang, mais à connaître avant de l’adopter pour un pipeline de production.

Le changement plus large en 2027 : l’IA asiatique

Couloir d’un centre de données d’entreprise moderne avec des baies de serveurs qui s’étendent au fond, un technicien en chemise blanche marchant et vérifiant les équipements

Le développement de Tongyi Wanxiang, de Seedream, de Hunyuan et de plateformes similaires reflète un changement plus large dans le paysage de l’IA. Pour la première fois, les modèles d’images d’IA non occidentaux sont compétitifs avec la pointe mondiale sur les indicateurs de qualité générale, tout en offrant des avantages réels dans des contextes culturels et commerciaux spécifiques.

Il ne s’agit pas d’un rattrapage. Des modèles comme Seedream 4.5 et Wanxiang 2.6 produisent des résultats qui tiennent la comparaison avec Flux 1.1 Pro Ultra Finetuned et GPT Image 2 dans des comparaisons directes sur les benchmarks standard de qualité d’image.

Les implications pour la production créative mondiale sont importantes :

  • Les équipes créatives multilingues disposent désormais d’outils d’IA qui comprennent leur contexte culturel, sans avoir besoin de contournements à esthétique occidentale
  • La production de contenus pour les marchés asiatiques peut se faire avec des outils conçus spécifiquement pour ce vocabulaire visuel
  • Les acheteurs d’IA en entreprise dans la région Asie-Pacifique disposent d’alternatives réelles aux fournisseurs occidentaux de cloud IA, à qualité comparable

💡 Le vrai changement : l’écart de qualité entre les générateurs d’images IA chinois et occidentaux s’est effectivement refermé en 2027. La différenciation porte désormais sur l’accès, l’écosystème d’intégration, la spécialisation culturelle et des atouts spécifiques, et non plus sur la qualité brute des résultats.

Pourquoi l’entraînement multimodal compte ici

Tongyi Wanxiang 2.6 fait partie d’une architecture d’IA multimodale plus large qu’Alibaba a construite pour gérer la compréhension du texte, des images, de l’audio et de la vidéo au sein d’une famille de modèles unifiée. Cette approche, où différentes modalités partagent des représentations et des signaux d’entraînement, est de plus en plus la direction que suit l’ensemble du domaine.

Le bénéfice pratique pour la génération d’images est, en particulier, une meilleure compréhension sémantique des prompts. Lorsque vous décrivez « un bol de riz fraîchement cuit avec de la vapeur qui s’élève, photographié pour une carte de restaurant », un modèle multimodal dispose d’une compréhension contextuelle de ce que signifie visuellement la photographie de carte de restaurant, et pas seulement d’une étiquette textuelle. C’est en partie pour cette raison que Wanxiang 2.6 gère si bien la photographie alimentaire et les visuels de style de vie à forte dimension culturelle.

Les meilleures alternatives disponibles dès maintenant

Groupe diversifié de quatre professionnels de la création réunis autour d’une tablette affichant des photos de mode générées par IA, dans un espace de coworking moderne et lumineux

Comme l’accès direct à Tongyi Wanxiang 2.6 présente des frictions importantes pour la plupart des utilisateurs internationaux, ces alternatives offrent des capacités comparables et, dans certains cas, de meilleures performances pour des usages spécifiques.

Les meilleurs choix pour une sortie photoréaliste

GPT Image 2 est actuellement l’un des modèles disponibles les plus solides pour une sortie photoréaliste, avec un rendu précis du texte et un bon respect des prompts sur un large éventail de sujets.

Flux 1.1 Pro Ultra Finetuned délivre une sortie en 4MP avec des détails fins exceptionnels sur la peau, les tissus et les textures de surface, ce qui en fait le bon choix pour la photographie de portrait et de produits.

Wan 2.7 Image Pro offre une génération en résolution 4K avec une bonne gestion des scènes complexes et des détails d’environnement.

Pour les esthétiques est-asiatiques en particulier

Qwen Image Edit Plus de l’équipe Qwen d’Alibaba est disponible sur PicassoIA et partage des racines architecturales avec la famille Tongyi. Il offre de solides performances sur les images à dimension culturelle asiatique, avec des capacités d’édition intégrées, ce qui en fait le modèle le plus proche accessible de Wanxiang 2.6.

Seedream 4.5 de ByteDance offre une qualité exceptionnelle pour les styles esthétiques est-asiatiques, ainsi qu’un bon photoréalisme général en tailles de sortie 4K.

Hunyuan Image 2.1 de Tencent constitue une alternative concurrentielle directe, avec une sortie 2K solide et une gestion fiable des esthétiques culturelles.

Quand la vitesse compte plus que la résolution

Gemini 2.5 Flash Image est la meilleure option lorsque la vitesse de génération est prioritaire, avec une sortie très rapide, adaptée à l’itération rapide de concepts et à de multiples variations de prompts.

Commencez à créer avec ces modèles dès aujourd’hui

Les modèles présentés dans cet article sont disponibles dès maintenant sur PicassoIA. Vous n’avez besoin ni d’un compte Alibaba Cloud, ni d’un numéro de téléphone chinois, ni d’un contrat d’API d’entreprise pour commencer à générer des images photoréalistes, avec des capacités qui égalent ou dépassent celles de Tongyi Wanxiang 2.6 pour la plupart des usages.

Que vous produisiez des photos de produits pour un marché asiatique, que vous génériez des portraits à l’alignement esthétique est-asiatique ou que vous testiez la façon dont les générateurs d’images IA modernes gèrent des prompts à forte dimension culturelle, PicassoIA met plus de 90 modèles texte vers image à votre disposition, via une interface unique et accessible.

Commencez par Qwen Image Edit Plus si vous voulez le modèle apparenté sur le plan architectural le plus proche de Tongyi Wanxiang disponible en dehors de l’écosystème d’Alibaba. Essayez Seedream 4.5 pour une sortie haute résolution à forte qualité esthétique est-asiatique. Ou allez directement vers Flux 1.1 Pro Ultra Finetuned pour le photoréalisme brut le plus élevé disponible en résolution 4MP.

La qualité est là. L’accès est immédiat. Il ne vous reste plus qu’à rédiger un prompt.

Partager cet article

Choisissez votre langue