Es probable que este año hayas estado en una conversación en la que alguien dijo "solo ajusta el LLM con un adaptador LoRA y baja la temperatura", y la mitad de la sala asintió como si lo entendiera. Ese momento, esa sensación de ir dos pasos por detrás mientras los demás parecen dominarlo, es exactamente la razón de ser de este artículo.
La IA no va a frenar en 2027, y el vocabulario avanza igual de rápido. Ya seas diseñador que usa generadores de imágenes, especialista en marketing que prueba chatbots o alguien que quiere defenderse en conversaciones de tecnología, conocer las palabras correctas es el primer paso de verdad.
Esto no es un libro de texto. Es un desglose sin rodeos de las palabras de IA que realmente salen en conversaciones reales, explicadas con la claridad que la mayoría de la divulgación tecnológica evita a propósito.

Por qué el vocabulario de IA importa ahora mismo
La brecha se agranda rápido
En 2023, saber qué era "ChatGPT" te ponía por delante de la mayoría de la gente en la cena. En 2026, ese punto de partida ha cambiado mucho. Las personas que usan la IA de forma productiva hablan otro idioma, y la distancia entre los usuarios expertos y los espectadores confundidos crece con cada lanzamiento de producto.
¿La buena noticia? El vocabulario de IA no es difícil una vez que alguien deja de disfrazarlo de lenguaje académico. La mayoría de estos términos describen ideas que ya entiendes de forma intuitiva. Solo necesitan una traducción en lenguaje sencillo y un ejemplo concreto.
Cómo usar este artículo
Cada término incluye una definición de una línea, una analogía del mundo real cuando ayuda y una nota sobre dónde te lo vas a encontrar. Léelo de principio a fin o salta a la sección que encaje con lo que estás haciendo ahora.

Los bloques básicos
Antes que nada, tres palabras fundamentales aparecen constantemente en las conversaciones sobre IA. Son la base.
¿Qué es un modelo?
Un modelo es el sistema entrenado que produce los resultados de la IA. Cuando escribes un prompt y recibes una imagen, estás usando un modelo. Piensa en él como una función muy sofisticada: entra una entrada y sale una salida.
Los modelos se diferencian por su tamaño (cuántos parámetros tienen), por sus datos de entrenamiento (con qué se entrenaron) y por su capacidad (texto, imágenes, audio, video o combinaciones de todo eso).
💡 Cuando alguien pregunta "¿qué modelo estás usando?", quiere saber qué sistema de IA concreto recibe tu petición, no la aplicación o la plataforma que lo envuelve.
Parámetros y pesos
Los parámetros (a veces llamados pesos) son los valores numéricos dentro de un modelo que se ajustaron durante el entrenamiento. Cuando oyes "un modelo de 70.000 millones de parámetros", ese número describe cuántos valores individuales ajustables contiene el modelo.
Más parámetros suele significar más capacidad, pero también más costo de cómputo. Un modelo de 7B funciona rápido en equipos modestos. Un modelo de 405B necesita una infraestructura seria solo para cargarlo.
Entrenamiento frente a inferencia
Estas dos palabras describen las dos fases distintas de la vida de cualquier modelo de IA.
| Fase | Qué ocurre | Quién lo hace |
|---|
| Entrenamiento | El modelo aprende de datos masivos y ajusta sus parámetros | Empresas de IA (OpenAI, Google, Black Forest Labs, etc.) |
| Inferencia | El modelo entrenado responde a tus entradas | Tú, a través de una app o una API |
Cuando usas cualquier herramienta de IA, siempre estás haciendo inferencia. No estás reentrenando nada. El conocimiento del modelo se queda congelado en su fecha de corte del entrenamiento, por eso puede que no sepa de acontecimientos recientes.

El lenguaje de los modelos de lenguaje de gran tamaño
Los modelos de lenguaje (Large Language Models, o LLM) son la categoría de IA detrás de los chatbots, los asistentes de escritura y cualquier cosa que trabaje sobre todo con texto. Estas son las seis palabras que definen cómo funcionan.
Tokens
Un token es un fragmento pequeño de texto, de aproximadamente tres cuartos de palabra de media. Cuando un LLM procesa tu mensaje, convierte todo, incluido tu prompt y su propia respuesta, en tokens antes de hacer cualquier otra cosa.
Los tokens importan porque:
- Los modelos tienen un máximo de tokens que pueden procesar a la vez (la ventana de contexto)
- El precio de las API casi siempre se calcula por cada mil tokens
- Los documentos largos alcanzan los límites antes de lo que esperas
💡 "1.000 tokens" equivalen más o menos a 750 palabras. Un ensayo corto típico cabe en unos 1.500 tokens.
Ventana de contexto
La ventana de contexto es la cantidad total de texto, medida en tokens, que un modelo puede procesar a la vez. Todo lo que queda fuera de la ventana es invisible para el modelo.
Si mantienes una conversación larga con una IA y empieza a "olvidar" partes anteriores del chat, has llegado al límite de la ventana de contexto. El modelo no se ha confundido. Literalmente no puede acceder a lo que quedó fuera de su ventana.
Los LLM modernos han ampliado mucho sus ventanas de contexto. Algunos ya manejan millones de tokens, lo que hace posible analizar un libro entero o explorar una base de código extensa en una sola sesión.
Prompt y prompt del sistema
Un prompt es tu entrada a un modelo de IA: la pregunta que haces, la tarea que describes, la imagen que subes. Todo lo que escribes o envías es tu prompt.
Un prompt del sistema es un conjunto invisible de instrucciones que se carga antes de que empiece tu conversación. Así es como los productos construidos sobre modelos de IA dan al modelo una personalidad, restringen su comportamiento o cargan contexto específico de forma automática. Cuando un bot de atención al cliente responde siempre con un tono determinado y se niega a hablar de temas no relacionados, ese comportamiento está definido en el prompt del sistema.
La ingeniería de prompts es la práctica de redactar los prompts con cuidado para obtener resultados significativamente mejores. Es en parte arte, en parte ciencia, y cada vez más una habilidad profesional reconocida.
Temperatura
La temperatura controla lo aleatorios o creativos que son los resultados de un modelo. Suele ser un número entre 0 y 1, aunque algunos sistemas permiten hasta 2.
- Temperatura baja (0,1 a 0,3): Previsible, enfocada y a menudo repetitiva. Ideal para tareas factuales o técnicas en las que la precisión importa más que la variedad.
- Temperatura media (0,6 a 0,8): Creatividad y coherencia equilibradas. Funciona bien en la mayoría de tareas de escritura y conversación.
- Temperatura alta (1,0 o más): Salvaje, creativa, a veces incoherente. Útil para sesiones de lluvia de ideas en las que quieres combinaciones inesperadas.

Términos de IA para imagen y video
Esta sección recoge el vocabulario de los generadores de imágenes con IA, que funcionan con una clase de modelo completamente distinta a la de los LLM.
Modelo de difusión
Un modelo de difusión es la arquitectura detrás de la mayoría de generadores de imágenes con IA que se usan hoy en día. La idea central es sorprendentemente elegante: partir de ruido aleatorio puro y eliminarlo poco a poco, paso a paso, hasta que surge una imagen coherente.
Flux 2 Klein de Black Forest Labs, GPT Image 2 de OpenAI y Wan 2.7 Image Pro son arquitecturas basadas en difusión o influidas por ella. Cada paso de eliminación de ruido afina la imagen un poco más, por eso aumentar el número de pasos (hasta cierto punto) mejora la calidad a costa del tiempo de generación.
LoRA
LoRA son las siglas de Low-Rank Adaptation (adaptación de bajo rango). Es una técnica para ajustar un modelo a un estilo, una persona o un concepto concreto sin volver a entrenar todo el modelo desde cero.
En la práctica, un LoRA es un archivo pequeño, a menudo de solo unos cientos de megabytes, que cargas sobre un modelo base para alterar sus resultados. Si quieres que un generador de imágenes produzca de forma constante imágenes con un estilo visual específico o con un personaje concreto, un LoRA entrenado con esos ejemplos es la solución habitual.
💡 Piensa en un LoRA como un plugin que cambia el estilo por defecto del modelo sin reemplazar el modelo base.
Espacio latente
El espacio latente es la representación matemática interna que usa un modelo para codificar imágenes, texto o audio como vectores. Nunca lo ves directamente. Cuando un modelo de difusión genera una imagen, el cálculo real ocurre en el espacio latente antes de que la imagen final se decodifique de nuevo en píxeles.
Este término aparece con frecuencia en las conversaciones sobre cómo los modelos de IA combinan conceptos: mezclar dos imágenes, desplazar un estilo de forma gradual o hacer búsquedas semánticas en contenido visual. Toda esa manipulación ocurre en el espacio latente.

El vocabulario de la generación
Texto a imagen
Texto a imagen describe cualquier sistema que toma un prompt de texto y devuelve una imagen generada. Se ha convertido en una de las capacidades de IA más democratizadas, con decenas de modelos distintos que ofrecen estéticas y fortalezas diferentes.
Plataformas como Picasso IA reúnen el acceso a muchos modelos de texto a imagen, desde GPT Image 2 para resultados fotorrealistas hasta Seedream 4.5 para detalle de calidad 4K y Hunyuan Image 2.1 para resultados estilizados. Cada modelo interpreta el mismo prompt de forma distinta y produce una firma visual propia.
Texto a video
Texto a video extiende el mismo concepto a las imágenes en movimiento. Describes una escena (o aportas una imagen de origen) y el modelo genera un clip corto con movimiento coherente.
Esta categoría maduró mucho a lo largo de 2025 y principios de 2026. La brecha de calidad entre el video generado con IA y las grabaciones reales se ha reducido bastante. Los modelos ahora producen personajes coherentes entre fotogramas, física realista y un movimiento de aspecto natural, donde las versiones anteriores generaban resultados borrosos o deformados.
Multimodal
Un modelo multimodal trabaja con más de un tipo de entrada o salida. Un modelo que acepta imágenes y texto como entrada, o que puede generar texto y audio como salida, es multimodal.
La mayoría de los modelos más avanzados de 2027 son multimodales en cierta medida. Esta palabra indica que un sistema ya no se limita a un solo medio por interacción, lo que abre flujos de trabajo mucho más complejos.

Los términos técnicos que verás en todas partes
Ajuste fino
El ajuste fino (fine-tuning) es el proceso de seguir entrenando un modelo preentrenado con un conjunto de datos más pequeño y específico para adaptarlo a una tarea o dominio concreto. Un LLM de uso general ajustado con literatura médica rinde mejor en preguntas clínicas. Un modelo de imagen general ajustado con fotografía de producto genera tomas de producto más nítidas y más constantes.
El ajuste fino se sitúa entre entrenar desde cero (que cuesta millones de dólares) y el prompting (que no requiere modificar el modelo en absoluto). Es el punto intermedio que usan la mayoría de las organizaciones cuando necesitan un comportamiento especializado del modelo.
Alucinación
Una alucinación ocurre cuando un modelo de IA produce un resultado que suena seguro pero es factualmente incorrecto. El modelo no miente. Está haciendo coincidir patrones de una forma que genera un resultado plausible pero erróneo.
Los LLM alucinan referencias, estadísticas, nombres y hechos históricos. Los modelos de imagen pueden alucinar texto dentro de las imágenes (letras deformadas o sin sentido) o anatomía incorrecta. Reconocer que la alucinación es una tendencia estructural de cómo funcionan estos modelos, y no un fallo que se pueda parchear, cambia la forma en que usas y verificas los resultados de la IA.
💡 Verifica siempre los datos generados por IA con una fuente primaria. El tono seguro del modelo no es prueba de precisión.
RAG
RAG son las siglas de Retrieval-Augmented Generation (generación aumentada por recuperación). Es una técnica en la que un modelo se conecta a una base de conocimiento externa, como una biblioteca de documentos, una base de datos o un sitio web, para recuperar información relevante antes de generar una respuesta.
El RAG reduce de forma notable la alucinación en tareas que requieren mucho conocimiento, porque el modelo trabaja a partir de contenido real recuperado en lugar de depender solo de sus datos de entrenamiento. Cuando un chatbot cita correctamente un párrafo concreto de la documentación de tu empresa, casi seguro que el RAG forma parte de la arquitectura.
Embedding
Un embedding es una representación numérica de un fragmento de texto, imagen o audio como vector en un espacio de muchas dimensiones. Los conceptos similares acaban con coordenadas numéricas parecidas, y eso es lo que hace que la similitud semántica sea medible para una máquina.
Los embeddings son la base de la búsqueda semántica (encontrar contenido relevante sin coincidencias exactas de palabras clave), de los sistemas de recomendación y de cómo funciona realmente la recuperación en RAG entre bastidores. Son invisibles para los usuarios, pero dan potencia a una parte importante de lo que hace que las aplicaciones de IA modernas parezcan "inteligentes".

Palabras que definen cómo se construye la IA
Red neuronal
Una red neuronal es una arquitectura computacional vagamente inspirada en la estructura del cerebro. Consiste en capas de nodos interconectados que transforman los datos de entrada en una salida mediante una serie de operaciones matemáticas ponderadas.
Todo modelo de IA moderno, ya sea un LLM, un modelo de difusión o un reconocedor de voz, se construye sobre redes neuronales. El término es amplio. Decir "usa una red neuronal" es un poco como decir "funciona con software". Técnicamente es cierto, pero rara vez es el nivel de descripción más útil.
Transformer
El transformer es la arquitectura de red neuronal específica que impulsa prácticamente todos los modelos de IA más avanzados de 2026. Se presentó en un artículo de investigación de 2017 y remodeló por completo el campo en pocos años.
Los transformers son tan dominantes que, en la práctica, "LLM" y "gran modelo transformer" son casi sinónimos. Cuando alguien dice "modelo fundacional" o "modelo base", casi siempre está describiendo un gran transformer.
Mecanismo de atención
El mecanismo de atención es la innovación central dentro de los transformers. Permite al modelo ponderar dinámicamente la importancia de distintas partes de la entrada al producir cada parte de la salida.
Cuando un LLM escribe una frase, el mecanismo de atención se pregunta constantemente: "¿Qué otras partes de este contexto importan más ahora mismo?" Esa ponderación dinámica es lo que da a los transformers su capacidad para manejar relaciones de largo alcance en el texto y patrones complejos en las imágenes.

Vocabulario de seguridad y negocio
Alineación
La alineación se refiere al reto de que los modelos de IA se comporten de acuerdo con los valores e intenciones humanos. Un modelo alineado no solo produce resultados precisos. Produce resultados útiles, honestos y seguros.
RLHF (Reinforcement Learning from Human Feedback, aprendizaje por refuerzo a partir de retroalimentación humana) es la técnica de alineación más común en uso hoy. Evaluadores humanos valoran los resultados del modelo, y el modelo se entrena para preferir los patrones que puntuaron positivamente. La mayoría de los productos de IA de consumo pasan por amplios procesos de alineación antes de su lanzamiento público.
Barreras de seguridad
Las barreras de seguridad (guardrails) son restricciones integradas en un modelo o aplicadas alrededor de él para evitar resultados específicos. Un chatbot que se niega a producir contenido violento tiene barreras de seguridad. Un generador de imágenes que bloquea ciertas categorías de imágenes está aplicando barreras de seguridad.
Las barreras de seguridad pueden integrarse en el modelo durante el entrenamiento (haciendo que ciertos resultados sean estadísticamente improbables) o aplicarse en la capa de la aplicación (filtrando entradas y salidas antes y después del procesamiento del modelo). La mayoría de los productos de IA de consumo usan ambos enfoques combinados.
API
Una API (Application Programming Interface, interfaz de programación de aplicaciones) es la conexión que permite que una pieza de software se comunique con otra. Cuando una empresa dice "accede a nuestro modelo mediante API", quiere decir que puedes enviar peticiones a su modelo de forma programática desde tu propio código y recibir respuestas.
Las API son la forma en que se construye la mayoría de productos de IA. La aplicación que usas casi seguro que no entrenó el modelo en el que funciona. Llama a una API proporcionada por la empresa que hizo el entrenamiento y añade una capa de interfaz por encima.
Código abierto frente a código cerrado
Un modelo de código abierto tiene sus pesos publicados públicamente. Cualquiera puede descargarlo, ejecutarlo, modificarlo o ajustarlo sin permiso ni costo. Llama, Mistral y Stable Diffusion son modelos de código abierto destacados.
Un modelo de código cerrado mantiene sus pesos privados. Solo puedes acceder a él a través de la API de la empresa, y únicamente en sus condiciones. La mayoría de los modelos de frontera entran en esta categoría.
| Código abierto | Código cerrado |
|---|
| Costo | Gratis para ejecutarlo en local | Pago por consulta o suscripción |
| Privacidad | Total (se ejecuta en tu propio equipo) | Datos procesados en servidores externos |
| Rendimiento | Varía mucho según el modelo | A menudo el mejor de su clase |
| Personalización | Control total para ajustarlo | Limitada a lo que expone la API |

Referencia rápida: los 30 términos de un vistazo
Aquí tienes el vocabulario completo de este artículo, condensado en una tabla fácil de revisar.
| Término | Definición en una línea |
|---|
| Modelo | Sistema entrenado que recibe una entrada y produce una salida |
| Parámetros / Pesos | Valores numéricos dentro de un modelo, definidos durante el entrenamiento |
| Entrenamiento | Proceso de enseñar a un modelo ajustando sus parámetros |
| Inferencia | Ejecutar un modelo entrenado para generar resultados |
| Token | Fragmento pequeño de texto (~3/4 de palabra) que se usa para procesar el lenguaje |
| Ventana de contexto | Texto máximo que un modelo puede procesar a la vez |
| Prompt | Tu entrada a un modelo de IA |
| Prompt del sistema | Instrucciones precargadas que moldean el comportamiento del modelo de forma invisible |
| Temperatura | Controla la aleatoriedad y la creatividad de los resultados |
| Modelo de difusión | Arquitectura que genera imágenes eliminando ruido a partir de la aleatoriedad |
| LoRA | Archivo pequeño que adapta el estilo de un modelo base sin volver a entrenarlo |
| Espacio latente | Espacio matemático interno en el que los modelos representan conceptos |
| Texto a imagen | Generar imágenes a partir de descripciones de texto |
| Texto a video | Generar clips de video a partir de texto o de una imagen |
| Multimodal | Trabajar con varios tipos de entrada o salida a la vez |
| Ajuste fino | Adaptar un modelo preentrenado con un conjunto de datos más pequeño y específico |
| Alucinación | Resultado de IA que suena seguro pero es factualmente incorrecto |
| RAG | Conectar un modelo a documentos externos para obtener respuestas fundamentadas |
| Embedding | Representación vectorial numérica de texto, imágenes o audio |
| Red neuronal | La arquitectura computacional central de toda la IA moderna |
| Transformer | La arquitectura neuronal específica que impulsa la mayoría de los modelos de IA actuales |
| Mecanismo de atención | Cómo los transformers ponderan el contexto de forma dinámica durante la generación |
| Alineación | Hacer que los modelos se comporten de acuerdo con los valores humanos |
| Barreras de seguridad | Restricciones que evitan resultados específicos del modelo |
| API | La capa de conexión que permite que el software acceda a las capacidades del modelo |
| Código abierto | Modelos con pesos disponibles públicamente |
| Código cerrado | Modelos accesibles solo a través de la API de una empresa |
| LLM | Modelo de lenguaje, un transformer entrenado principalmente con texto |
| Costo de inferencia | El costo de cómputo y monetario de ejecutar una consulta a un modelo |
| Ingeniería de prompts | La habilidad de redactar entradas para obtener mejores resultados del modelo |

Ahora empieza a crear algo
Leer este vocabulario es el primer paso. La claridad de verdad llega al usar las herramientas. No entenderás del todo el "espacio latente" hasta que empieces a mover los controles de un generador de imágenes y observes qué cambia de verdad. No notarás la diferencia entre la temperatura 0,2 y la temperatura 1,0 hasta que ejecutes el mismo prompt de las dos formas y compares los resultados lado a lado.
Picasso IA te da acceso directo a más de 90 modelos de texto a imagen en un solo lugar, incluidos Flux 2 Klein, Wan 2.7 Image Pro, Seedream 4.5 y GPT Image 2. Puedes cambiar entre ellos, comparar resultados lado a lado, experimentar con adaptadores LoRA y ver en tiempo real cómo distintas arquitecturas interpretan el mismo prompt.
El vocabulario que acabas de leer se vuelve intuitivo en unas pocas horas de trabajo práctico. Elige un término de este artículo, busca el control correspondiente en una herramienta de IA, llévalo a sus extremos y observa qué pasa. Así se forma la fluidez de verdad: no solo leyendo, sino leyendo y luego haciendo.