Vous avez sans doute déjà assisté, cette année, à une conversation où quelqu’un a lancé : « il suffit de faire du fine-tuning du LLM avec un adaptateur LoRA et de baisser la température », et où la moitié de la salle a hoché la tête comme si elle avait compris. Ce moment, ce sentiment d’être deux pas en retrait pendant que tout le monde semble parler couramment, est précisément la raison d’être de cet article.
L’IA ne ralentit pas en 2027. Son vocabulaire accélère tout aussi vite. Que vous soyez designer et que vous testiez des générateurs d’images, spécialiste du marketing qui expérimente les chatbots, ou simplement quelqu’un qui veut tenir sa place dans les discussions tech, connaître les bons mots est la première vraie étape.
Ce n’est pas un manuel. C’est une explication sans détour des mots de l’IA qui reviennent réellement dans les conversations, présentée avec la clarté que la plupart des textes techniques évitent volontairement.

Pourquoi le vocabulaire de l’IA compte dès maintenant
L’écart se creuse rapidement
En 2023, savoir ce qu’était « ChatGPT » vous plaçait devant la plupart des gens à table. En 2026, ce niveau de base a fortement évolué. Les personnes qui utilisent l’IA de façon productive parlent une langue différente, et la distance entre les utilisateurs aguerris et les personnes dépassées ne cesse de grandir à chaque nouvelle sortie de produit.
La bonne nouvelle ? Le vocabulaire de l’IA n’est pas difficile une fois qu’on arrête de l’habiller d’un langage académique. La plupart de ces termes décrivent des idées que vous saisissez déjà intuitivement. Ils ont seulement besoin d’une traduction en français simple et d’un exemple concret.
Comment utiliser cet article
Chaque terme ci-dessous comprend une définition en une ligne, une analogie tirée du réel lorsqu’elle aide, et une note sur les situations où vous le rencontrerez. Lisez-le d’un trait ou allez directement à la section qui correspond à ce sur quoi vous travaillez en ce moment.

Les briques de base
Avant tout, trois mots fondamentaux reviennent constamment dans les conversations sur l’IA. Ce sont les fondations.
Qu’est-ce qu’un modèle ?
Un modèle est le système entraîné qui produit les résultats de l’IA. Lorsque vous saisissez un prompt et récupérez une image, vous utilisez un modèle. Pensez-le comme une fonction très sophistiquée : une entrée y entre, une sortie en ressort.
Les modèles se distinguent par leur taille (le nombre de paramètres qu’ils contiennent), par leurs données d’entraînement (ce sur quoi ils ont été entraînés) et par leurs capacités (texte, images, audio, vidéo, ou une combinaison de ces formats).
💡 Quand quelqu’un demande « quel modèle utilisez-vous ? », il veut savoir quel système d’IA précis traite sa requête, et non l’application ou la plateforme qui l’enveloppe.
Paramètres et poids
Les paramètres (parfois appelés poids) sont les valeurs numériques à l’intérieur d’un modèle, ajustées pendant l’entraînement. Quand vous entendez « un modèle de 70 milliards de paramètres », ce chiffre indique le nombre de valeurs ajustables individuelles que contient le modèle.
Plus de paramètres signifie généralement plus de capacités, mais aussi un coût de calcul plus élevé. Un modèle de 7 B tourne rapidement sur un matériel modeste. Un modèle de 405 B a besoin d’une infrastructure sérieuse rien que pour se charger.
Entraînement ou inférence ?
Ces deux mots décrivent les deux phases distinctes de la vie de tout modèle d’IA.
| Phase | Ce qui se passe | Qui s’en charge |
|---|
| Entraînement | Le modèle apprend à partir de données massives et ajuste ses paramètres | Les entreprises d’IA (OpenAI, Google, Black Forest Labs, etc.) |
| Inférence | Le modèle entraîné répond à vos entrées | Vous, via une application ou une API |
Lorsque vous utilisez un outil d’IA, vous faites toujours de l’inférence. Vous ne réentraînez rien. Les connaissances du modèle sont figées à la date limite de son entraînement, ce qui explique qu’il ne connaisse pas forcément les événements récents.

Le langage des grands modèles de langage
Les grands modèles de langage, ou LLM, sont la catégorie d’IA derrière les chatbots, les assistants d’écriture et tout ce qui fonctionne principalement avec du texte. Voici les six mots qui définissent leur fonctionnement.
Tokens
Un token est un petit morceau de texte, environ les trois quarts d’un mot en moyenne. Lorsqu’un LLM traite votre message, il convertit tout, y compris votre prompt et sa propre réponse, en tokens avant toute autre opération.
Les tokens comptent, car :
- les modèles ont un nombre maximal qu’ils peuvent traiter en une fois (la fenêtre de contexte) ;
- la tarification des API est presque toujours calculée par millier de tokens ;
- les longs documents atteignent les limites plus vite que prévu.
💡 « 1 000 tokens » représentent environ 750 mots. Un essai court typique tient en 1 500 tokens environ.
Fenêtre de contexte
La fenêtre de contexte est la quantité totale de texte, mesurée en tokens, qu’un modèle peut traiter en une fois. Tout ce qui se trouve en dehors de la fenêtre est invisible pour le modèle.
Si vous avez une longue conversation avec une IA et qu’elle commence à « oublier » des passages antérieurs, vous avez atteint la limite de la fenêtre de contexte. Le modèle n’a pas été troublé. Il ne peut tout simplement pas accéder à ce qui se trouve hors de sa fenêtre.
Les LLM modernes ont considérablement élargi leurs fenêtres de contexte. Certains traitent désormais des millions de tokens, ce qui rend possibles l’analyse d’un livre entier ou l’exploration approfondie d’une base de code au cours d’une seule session.
Prompt et prompt système
Un prompt est votre entrée dans un modèle d’IA : la question que vous posez, la tâche que vous décrivez, l’image que vous importez. Tout ce que vous tapez ou envoyez constitue votre prompt.
Un prompt système est un ensemble d’instructions invisible, chargé avant le début de votre conversation. C’est ainsi que les produits construits sur des modèles d’IA donnent au modèle une personnalité, restreignent son comportement ou chargent automatiquement un contexte précis. Lorsqu’un robot de service client répond toujours sur un ton donné et refuse d’aborder des sujets sans rapport, ce comportement est défini dans le prompt système.
L’ingénierie de prompt désigne la pratique consistant à rédiger soigneusement les prompts pour obtenir des résultats nettement meilleurs. C’est en partie un art, en partie une science, et de plus en plus une compétence professionnelle reconnue.
Température
La température contrôle le degré d’aléatoire ou de créativité des résultats d’un modèle. Il s’agit généralement d’un nombre compris entre 0 et 1, mais certains systèmes acceptent jusqu’à 2.
- Température basse (0,1 à 0,3) : résultats prévisibles, ciblés et souvent répétitifs. Idéale pour les tâches factuelles ou techniques, où la précision compte plus que la variété.
- Température moyenne (0,6 à 0,8) : créativité et cohérence équilibrées. Convient bien à la plupart des tâches d’écriture et de conversation.
- Température haute (1,0 et plus) : résultats audacieux, créatifs, parfois incohérents. Utile pour les séances de brainstorming où vous cherchez des combinaisons inattendues.

Termes de l’IA pour l’image et la vidéo
Cette section couvre le vocabulaire des générateurs d’images par IA, qui reposent sur une classe de modèles totalement différente de celle des LLM.
Modèle de diffusion
Un modèle de diffusion est l’architecture derrière la plupart des générateurs d’images par IA largement utilisés aujourd’hui. L’idée centrale est étonnamment élégante : partir d’un bruit aléatoire pur, puis le débruiter progressivement, étape par étape, jusqu’à ce qu’une image cohérente apparaisse.
Flux 2 Klein de Black Forest Labs, GPT Image 2 d’OpenAI et Wan 2.7 Image Pro reposent tous sur des architectures de diffusion ou influencées par la diffusion. Chaque étape de débruitage affine davantage l’image, ce qui explique pourquoi augmenter le nombre d’étapes (jusqu’à un certain point) améliore la qualité au prix d’un temps de génération plus long.
LoRA
LoRA signifie Low-Rank Adaptation (adaptation de bas rang). C’est une technique qui permet d’ajuster un modèle sur un style, une personne ou un concept précis, sans le réentraîner entièrement depuis zéro.
Concrètement, un LoRA est un petit fichier, souvent de quelques centaines de mégaoctets, que vous chargez par-dessus un modèle de base pour modifier ses résultats. Si vous voulez qu’un générateur d’images produise de façon constante des images dans un style visuel précis ou avec un personnage donné, un LoRA entraîné sur ces exemples est la solution standard.
💡 Considérez un LoRA comme un plugin qui modifie le style par défaut du modèle sans remplacer le modèle de base lui-même.
Espace latent
L’espace latent est la représentation mathématique interne qu’un modèle utilise pour encoder images, textes ou audio sous forme de vecteurs. Vous ne le voyez jamais directement. Lorsqu’un modèle de diffusion génère une image, le calcul proprement dit se fait dans l’espace latent, avant que l’image finale ne soit décodée en pixels.
Ce terme revient souvent dans les discussions sur la manière dont les modèles d’IA mélangent des concepts : fusionner deux images, faire évoluer progressivement un style ou effectuer des recherches sémantiques dans des contenus visuels. Toutes ces manipulations se font dans l’espace latent.

Le vocabulaire de la génération
Texte vers image
Le texte vers image désigne tout système qui prend un prompt textuel et renvoie une image générée. C’est devenu l’une des capacités de l’IA les plus démocratisées, avec des dizaines de modèles distincts offrant des esthétiques et des points forts différents.
Des plateformes comme Picasso IA rassemblent l’accès à de nombreux modèles texte vers image, de GPT Image 2 pour des résultats photoréalistes à Seedream 4.5 pour des détails de qualité 4K, en passant par Hunyuan Image 2.1 pour un rendu stylisé. Chaque modèle interprète le même prompt à sa manière et produit une signature visuelle propre.
Texte vers vidéo
Le texte vers vidéo étend ce concept aux images animées. Vous décrivez une scène (ou fournissez une image source), et le modèle génère un court clip vidéo avec un mouvement cohérent.
Cette catégorie a beaucoup mûri en 2025 et 2026. L’écart de qualité entre la vidéo générée par IA et les images réelles s’est nettement réduit. Les modèles produisent désormais des personnages cohérents d’une image à l’autre, une physique réaliste et des mouvements naturels là où les versions précédentes donnaient des résultats flous ou déformés.
Multimodal
Un modèle multimodal fonctionne avec plus d’un type d’entrée ou de sortie. Un modèle qui accepte à la fois des images et du texte en entrée, ou qui peut générer à la fois du texte et de l’audio en sortie, est multimodal.
La plupart des modèles de pointe en 2027 sont multimodaux, à un certain degré. Ce mot indique qu’un système n’est plus limité à un seul support par interaction, ce qui ouvre des flux de travail bien plus complexes.

Les termes techniques que vous verrez partout
Fine-tuning
Le fine-tuning consiste à poursuivre l’entraînement d’un modèle pré-entraîné sur un jeu de données plus petit et spécifique, afin de l’adapter à une tâche ou à un domaine précis. Un LLM généraliste affiné sur la littérature médicale répond mieux aux questions cliniques. Un modèle d’image généraliste affiné sur la photographie de produits donne des clichés plus nets et plus cohérents.
Le fine-tuning se situe entre l’entraînement depuis zéro (qui coûte des millions de dollars) et le prompting (qui ne nécessite aucune modification du modèle). C’est le juste milieu que la plupart des organisations adoptent lorsqu’elles ont besoin d’un comportement spécialisé.
Hallucination
Une hallucination est un résultat d’IA qui paraît sûr de lui mais qui est factuellement faux. Le modèle ne ment pas. Il procède par reconnaissance de motifs et produit un résultat plausible, mais incorrect.
Les LLM hallucinent des références, des statistiques, des noms et des événements historiques. Les modèles d’image peuvent halluciner du texte dans les images (lettres déformées ou absurdes) ou une anatomie incorrecte. Reconnaître que l’hallucination est une tendance structurelle de la manière dont ces modèles fonctionnent, et non un bug à corriger, change la façon dont vous utilisez et vérifiez les résultats de l’IA.
💡 Vérifiez toujours les faits générés par l’IA auprès d’une source primaire. Le ton assuré du modèle n’est pas une preuve d’exactitude.
RAG
Le RAG signifie Retrieval-Augmented Generation (génération augmentée par récupération). C’est une technique qui connecte un modèle à une base de connaissances externe, comme une bibliothèque de documents, une base de données ou un site web, afin qu’il récupère les informations pertinentes avant de générer une réponse.
Le RAG réduit fortement l’hallucination pour les tâches riches en connaissances, car le modèle travaille à partir de contenus réels récupérés plutôt que de se fier uniquement à ses données d’entraînement. Lorsqu’un chatbot cite correctement un paragraphe précis de la documentation de votre entreprise, il y a presque certainement du RAG dans l’architecture.
Embedding
Un embedding est une représentation numérique d’un texte, d’une image ou d’un audio sous forme de vecteur dans un espace à haute dimension. Des concepts proches se retrouvent avec des coordonnées numériques proches, ce qui rend la similarité sémantique mesurable par un ordinateur.
Les embeddings sont à la base de la recherche sémantique (trouver du contenu pertinent sans correspondance exacte de mots-clés), des systèmes de recommandation et du fonctionnement réel de la récupération dans le RAG. Invisibles pour les utilisateurs, ils sont à l’origine d’une grande partie de ce qui paraît « intelligent » dans les applications d’IA modernes.

Les mots qui décrivent la conception de l’IA
Réseau de neurones
Un réseau de neurones est une architecture de calcul librement inspirée de la structure du cerveau. Il se compose de couches de nœuds interconnectés qui transforment les données d’entrée en sortie grâce à une suite d’opérations mathématiques pondérées.
Tous les modèles d’IA modernes, qu’il s’agisse d’un LLM, d’un modèle de diffusion ou d’un système de reconnaissance vocale, reposent sur des réseaux de neurones. Le terme est large. Dire « il utilise un réseau de neurones » revient un peu à dire « ça tourne sur un logiciel ». C’est vrai, mais rarement le niveau de description le plus utile.
Transformeur
Le transformeur est l’architecture de réseau de neurones précise qui alimente pratiquement tous les modèles d’IA de pointe en 2026. Il a été présenté dans un article de recherche de 2017 et a complètement remodelé le domaine en quelques années.
Les transformeurs dominent à ce point que « LLM » et « grand modèle transformeur » sont presque synonymes en pratique. Quand quelqu’un parle de « modèle de fondation » ou de « modèle de base », il décrit presque toujours un grand transformeur.
Mécanisme d’attention
Le mécanisme d’attention est l’innovation centrale à l’intérieur des transformeurs. Il permet au modèle de pondérer dynamiquement l’importance des différentes parties de l’entrée lorsqu’il produit chaque partie de la sortie.
Lorsqu’un LLM écrit une phrase, le mécanisme d’attention se demande en permanence : « Quelles autres parties de ce contexte comptent le plus à cet instant ? » Cette pondération dynamique permet aux transformeurs de gérer des relations à longue distance dans un texte et des motifs complexes dans les images.

Vocabulaire de la sécurité et du business
Alignement
L’alignement désigne le défi consistant à faire en sorte que les modèles d’IA se comportent de manière conforme aux valeurs et aux intentions humaines. Un modèle aligné ne se contente pas de produire des résultats exacts. Il produit des résultats utiles, honnêtes et sûrs.
Le RLHF (Reinforcement Learning from Human Feedback, apprentissage par renforcement à partir de retours humains) est la technique d’alignement la plus répandue aujourd’hui. Des évaluateurs humains notent les résultats du modèle, et celui-ci est entraîné à privilégier les schémas qu’ils ont jugés positifs. La plupart des produits d’IA grand public passent par de vastes processus d’alignement avant leur sortie publique.
Garde-fous
Les garde-fous sont des restrictions intégrées dans un modèle ou placées autour de lui pour empêcher certains résultats précis. Un chatbot qui refuse de produire un contenu violent dispose de garde-fous. Un générateur d’images qui bloque certaines catégories d’images applique des garde-fous.
Les garde-fous peuvent être intégrés au modèle pendant l’entraînement (rendant certains résultats statistiquement improbables) ou appliqués au niveau de l’application (filtrage des entrées et des sorties avant et après le traitement par le modèle). La plupart des produits d’IA grand public combinent ces deux approches.
API
Une API (Application Programming Interface, interface de programmation) est la connexion qui permet à un logiciel de communiquer avec un autre. Lorsqu’une entreprise indique « accédez à notre modèle via API », elle veut dire que vous pouvez envoyer des requêtes à son modèle de façon programmatique, depuis votre propre code, et recevoir des réponses en retour.
Les API sont la façon dont la plupart des produits d’IA sont réellement construits. L’application que vous utilisez n’a presque certainement pas entraîné le modèle sur lequel elle repose. Elle appelle une API fournie par l’entreprise qui a réalisé l’entraînement, et ajoute une couche d’interface par-dessus.
Open source ou code fermé
Un modèle open source a ses poids publiés publiquement. Chacun peut le télécharger, l’exécuter, le modifier ou l’affiner par fine-tuning, sans autorisation ni coût. Llama, Mistral et Stable Diffusion sont des modèles open source de premier plan.
Un modèle à code fermé garde ses poids privés. Vous n’y accédez que par l’API de l’entreprise, et uniquement selon ses conditions. La plupart des modèles de pointe relèvent de cette catégorie.
| Open source | Code fermé |
|---|
| Coût | Gratuit à exécuter en local | Paiement à la requête ou abonnement |
| Confidentialité | Totale (tourne sur votre matériel) | Données traitées sur des serveurs externes |
| Performance | Très variable selon le modèle | Souvent parmi les meilleures |
| Personnalisation | Contrôle total pour le fine-tuning | Limitée à ce que l’API expose |

Référence rapide : les 30 termes en un coup d’œil
Voici l’ensemble du vocabulaire de cet article, condensé dans un tableau facile à parcourir pour une révision rapide.
| Terme | Définition en une ligne |
|---|
| Modèle | Système entraîné qui reçoit une entrée et produit une sortie |
| Paramètres / poids | Valeurs numériques à l’intérieur d’un modèle, fixées pendant l’entraînement |
| Entraînement | Processus d’apprentissage d’un modèle par l’ajustement de ses paramètres |
| Inférence | Exécution d’un modèle entraîné pour générer des résultats |
| Token | Petit morceau de texte (environ 3/4 d’un mot) utilisé pour traiter le langage |
| Fenêtre de contexte | Quantité maximale de texte qu’un modèle peut traiter en une fois |
| Prompt | Votre entrée dans un modèle d’IA |
| Prompt système | Instructions préchargées qui façonnent discrètement le comportement du modèle |
| Température | Contrôle le degré d’aléatoire et de créativité des résultats |
| Modèle de diffusion | Architecture qui génère des images en débruitant à partir d’un bruit aléatoire |
| LoRA | Petit fichier qui adapte le style d’un modèle de base sans le réentraîner |
| Espace latent | Espace mathématique interne dans lequel les modèles représentent les concepts |
| Texte vers image | Génération d’images à partir de descriptions textuelles |
| Texte vers vidéo | Génération de clips vidéo à partir d’un texte ou d’une image |
| Multimodal | Fonctionnement avec plusieurs types d’entrées ou de sorties à la fois |
| Fine-tuning | Adaptation d’un modèle pré-entraîné avec un jeu de données plus petit et ciblé |
| Hallucination | Résultat d’IA qui paraît sûr de lui mais qui est factuellement faux |
| RAG | Connexion d’un modèle à des documents externes pour des réponses fondées |
| Embedding | Représentation vectorielle numérique d’un texte, d’une image ou d’un audio |
| Réseau de neurones | Architecture de calcul au cœur de toute l’IA moderne |
| Transformeur | Architecture de réseau de neurones qui alimente la plupart des modèles d’IA actuels |
| Mécanisme d’attention | Façon dont les transformeurs pondèrent le contexte dynamiquement pendant la génération |
| Alignement | Faire en sorte que les modèles se comportent conformément aux valeurs humaines |
| Garde-fous | Restrictions qui empêchent certains résultats de modèles |
| API | Couche de connexion qui permet aux logiciels d’accéder aux capacités d’un modèle |
| Open source | Modèles dont les poids sont disponibles publiquement |
| Code fermé | Modèles accessibles uniquement par l’API d’une entreprise |
| LLM | Grand modèle de langage, transformeur entraîné principalement sur du texte |
| Coût d’inférence | Coût de calcul et monétaire d’une requête sur un modèle |
| Ingénierie de prompt | Compétence consistant à rédiger des entrées pour obtenir de meilleurs résultats |

Maintenant, passez à la création
Lire ce vocabulaire n’est que la première étape. La vraie clarté vient de l’usage des outils. Vous ne saisirez pas vraiment l’« espace latent » tant que vous n’aurez pas ajusté des curseurs sur un générateur d’images pour observer ce qui change réellement. Vous ne sentirez pas la différence entre une température de 0,2 et une température de 1,0 tant que vous n’aurez pas lancé le même prompt de deux façons et comparé les résultats côte à côte.
Picasso IA vous donne un accès direct à plus de 90 modèles texte vers image au même endroit, dont Flux 2 Klein, Wan 2.7 Image Pro, Seedream 4.5 et GPT Image 2. Vous pouvez passer de l’un à l’autre, comparer les résultats côte à côte, expérimenter avec des adaptateurs LoRA et voir en temps réel comment différentes architectures interprètent le même prompt.
Le vocabulaire que vous venez de lire devient intuitif en quelques heures de pratique. Choisissez un terme de cet article, trouvez le contrôle correspondant dans un outil d’IA, poussez-le à l’extrême et observez ce qui se passe. C’est ainsi que la maîtrise se construit, non pas en lisant seulement, mais en lisant puis en faisant.