Qwen Image 3.0: pesos abiertos, API y configuración local
Qwen Image 3.0 no tiene pesos descargables: solo funciona a través de la API alojada de Alibaba Cloud, a unos $0.03 por imagen. Este artículo separa los hechos de los rumores, enumera qué versiones anteriores de Qwen Image son abiertas, muestra una configuración local con Diffusers y explica cómo probar Qwen Image 3 en el navegador.
Si buscabas pesos abiertos de Qwen Image 3.0, aquí va la respuesta directa: no existen. El equipo de Qwen de Alibaba anunció Qwen Image 3.0 el 21 de julio de 2026 como servicio alojado, y no ha aparecido para él ningún repositorio en Hugging Face, ficha de modelo, archivo de licencia ni informe técnico. Hoy tienes tres opciones: llamar al modelo a través de la API de Alibaba Cloud, ejecutar una versión abierta anterior de Qwen Image en tu propia GPU o probar Qwen Image 3 en el navegador, en PicassoIA, sin instalar nada.
Esta página aclara qué opción te conviene, cuánto cuesta cada una y cómo configurarla sin buscar descargas que no son reales. Todas las cifras que aparecen abajo proceden de páginas públicas publicadas entre agosto y septiembre de 2026, y cuando las fuentes no coinciden, lo indico.
La respuesta corta sobre los pesos
El 13 de agosto de 2026, una comprobación independiente de Hugging Face y ModelScope no encontró ningún repositorio de Qwen Image 3.0 bajo las organizaciones Qwen o Tongyi-MAI. La documentación revisada a finales de agosto seguía describiendo el modelo como accesible solo a través de Qwen alojado y del acceso a Alibaba Cloud. En pocas palabras, no puedes descargar Qwen Image 3.0 ni ejecutarlo en tu propio equipo.
Lo que Alibaba publicó realmente
Qwen Image 3.0 llega en dos niveles: un modelo estándar (qwen-image-3.0) y un modelo Pro (qwen-image-3.0-pro). Un mismo modelo se encarga tanto de la generación de imágenes a partir de texto como de la edición de imágenes. Las especificaciones publicadas son estas:
Longitud del prompt: hasta unos 4.5K tokens por solicitud
Resolución: hasta 2048×2048 píxeles
Renderizado de texto: caracteres de unos 10 píxeles, en 12 idiomas
Estilos: más de 100 looks integrados
Salida: varias imágenes por solicitud
El foco está en visuales con mucha información, como infografías, páginas de periódico, hojas de ejercicios, maquetas de interfaz y storyboards, y no solo en imágenes bonitas.
Lo que significa "código abierto" aquí
La gente mezcla tres cosas distintas cuando escribe "código abierto" junto al nombre de un modelo:
Pesos abiertos: puedes descargar los archivos del modelo y ejecutarlos tú mismo.
Licencia abierta: los archivos llegan con permiso para uso comercial.
Acceso abierto: cualquiera puede pagar y llamar al modelo a través de una API.
Qwen Image 3.0 solo ofrece la tercera. Eso tiene consecuencias prácticas: no puedes hacer ajuste fino, no puedes fijar una versión en tu propio servidor y, si Alibaba cambia el precio o retira un nivel, tu flujo de trabajo cambia con él.
💡 Cuidado con las descargas falsas. Cualquier sitio web, torrent o canal de chat que ofrezca "pesos de Qwen Image 3.0" no es de Alibaba, porque Alibaba no ha publicado ninguno. Ese tipo de archivos es una forma habitual de difundir malware. Quédate con las organizaciones oficiales de Qwen en Hugging Face y ModelScope.
Qué versiones de Qwen Image son abiertas
La familia Qwen Image no está cerrada del todo. Varias versiones anteriores son abiertas, y ahí empieza cualquier configuración local.
Versión
Pesos
Licencia
Notas
Qwen Image (agosto de 2025)
Sí
Apache 2.0
MMDiT de 20B parámetros, centrado en texto
Qwen Image Edit 2511 (diciembre de 2025)
Sí
Apache 2.0
Variante de edición
Qwen Image 2512 (diciembre de 2025)
Sí
Apache 2.0
Texto más nítido, caras más realistas
Qwen Image 2.0 (febrero de 2026)
No en el anuncio
n/a
Los pesos no se habían publicado cuando se publicó la noticia del repositorio
Qwen Image 3.0 y 3.0 Pro (julio de 2026)
No
Términos de servicio alojados
Solo API
Qwen Image 2.1 (septiembre de 2026)
Sí
Licencia de investigación
Generador de 7B más codificador de 8B
Las versiones Apache 2.0
Los pesos originales de Qwen Image se hicieron públicos el 4 de agosto de 2025, en Hugging Face y ModelScope, bajo Apache 2.0. Esa licencia permite el uso comercial, la modificación y la redistribución con muy pocas condiciones. Las versiones de diciembre de 2025, Qwen Image Edit 2511 y Qwen Image 2512, siguieron el mismo esquema, y el repositorio de GitHub incluye fragmentos de Diffusers listos para usar en cada una.
Si tu objetivo es un modelo que puedas ajustar, alojar en tu propio servidor o incluir en un producto sin pagar una factura por imagen, estos son los archivos que debes revisar.
Qwen Image 2.1 y su licencia
Las comparativas publicadas describen Qwen Image 2.1 como una versión de pesos abiertos con un generador visual de 7B, un codificador de visión y lenguaje de 8B y salida transparente nativa. Una de las comparativas la fecha el 20 de septiembre de 2026. La trampa está en la licencia. Según los informes, los materiales publicados usan una licencia de investigación, y el uso comercial requiere un acuerdo aparte con Qwen.
💡 Lee la licencia en la página del modelo antes de generar nada para un cliente. "Los pesos se pueden descargar" y "el resultado se puede vender libremente" son dos preguntas distintas.
Cómo funciona la API alojada
Si quieres Qwen Image 3.0 en sí, la API es la única puerta. Funciona a través de Alibaba Cloud Model Studio, al que la documentación de la API también llama DashScope.
Acceso y nombres de modelo
Hay dos regiones que importan. La región de Singapur atiende a la mayoría de usuarios fuera de China continental, y una región de Pekín atiende al mercado chino. Los tokens de API son específicos de cada región, así que un token creado para una no funcionará con la otra. Los agregadores de terceros también listan el modelo: OpenRouter ofrece Qwen Image 3.0 desde principios de agosto de 2026 a unos $0.03 por imagen de 1K.
El proceso de configuración es así:
Crea una cuenta en Alibaba Cloud y abre Model Studio en la región de Singapur.
Activa los modelos de generación de imágenes que vayas a usar.
Crea un token de API en la consola y guárdalo en una variable de entorno.
Llama a qwen-image-3.0 o qwen-image-3.0-pro con un prompt y un tamaño.
Cuánto cuesta por imagen
Precios publicados para la región de Singapur a 31 de agosto de 2026:
Concepto
Precio
Qwen Image 3.0 estándar, por imagen generada
$0.03
Qwen Image 3.0 Pro, por imagen generada
$0.04 a $0.075
Imagen de entrada para edición, por imagen
$0.003
Cuota gratuita
10 imágenes, válidas 90 días
A esas tarifas, 1 000 imágenes estándar cuestan unos $30, y 10 000 cuestan unos $300. Pro está entre $400 y $750 por 10 000, según el tamaño de salida. La edición añade unas pocas décimas de centavo por imagen de referencia. Las tarifas nativas de Alibaba Cloud no estaban documentadas por completo en todas las publicaciones, así que consulta la página de facturación antes de planificar un presupuesto con estas cifras.
Una solicitud de ejemplo
Esta es la forma general de una llamada de texto a imagen. Tómala como punto de partida y no como una receta para copiar y pegar.
💡 Confirma los detalles en tu propia consola. Los nombres de los campos siguen el patrón de DashScope que usaban los modelos anteriores de Qwen Image, pero los artículos de configuración de terceros no coinciden en el host exacto del endpoint. Copia la URL y el esquema de la solicitud que aparecen en Model Studio antes de publicar nada.
Los límites de frecuencia no están documentados oficialmente. Quienes integran la API informan de respuestas 429 bajo carga, así que implementa un retroceso exponencial desde el primer día en lugar de reintentar de inmediato.
Configuración local con pesos abiertos de Qwen
Como Qwen Image 3.0 no puede ejecutarse en local, una configuración local significa una de las versiones abiertas anteriores. Qwen Image 2512 es la opción natural para el trabajo general, porque mejoró la nitidez del texto y el realismo de los rostros respecto al original.
Un baño de realidad sobre el hardware
El modelo original tiene 20B parámetros. En bfloat16 son unos 40 GB solo para el modelo de imagen, sin contar el codificador de texto. Esta es una tabla orientativa para planificar:
Configuración
Qué esperar
48 GB o más de memoria de GPU
Funciona en bfloat16 con margen de sobra
Tarjeta de consumo de 24 GB
Necesita descarga a la CPU o una versión cuantizada, más lenta por imagen
Tarjeta de 12 a 16 GB
Posible solo con cuantización intensa, prepárate para esperas largas
Sin GPU dedicada
No es práctico, usa mejor una opción alojada
Las conversiones FP8 y GGUF de la comunidad se usan mucho en ComfyUI para hacer caber el modelo en tarjetas más pequeñas. La calidad varía según la conversión, así que prueba tus propios prompts antes de decidirte por una. Piensa también en un almacenamiento rápido: los archivos del modelo ocupan decenas de gigabytes, y la descarga a la CPU depende de la memoria del sistema, así que 32 GB de RAM es un mínimo cómodo.
Instalar y ejecutar con Diffusers
El repositorio recomienda instalar Diffusers desde el código fuente:
Si Python indica que falta un paquete para el codificador de texto al cargar el pipeline, instálalo con pip y vuelve a ejecutar el script. Después, un script mínimo que usa los pesos de 2512:
import torch
from diffusers import DiffusionPipeline
pipe = DiffusionPipeline.from_pretrained(
"Qwen/Qwen-Image-2512",
torch_dtype=torch.bfloat16,
)
pipe.enable_model_cpu_offload()
image = pipe(
prompt="A rainy street market at dusk, a hand-painted sign reading OPEN",
negative_prompt=" ",
width=1664,
height=928,
num_inference_steps=50,
true_cfg_scale=4.0,
generator=torch.Generator(device="cuda").manual_seed(42),
).images[0]
image.save("qwen-test.png")
Cambia a Qwen/Qwen-Image para ejecutar la versión original, o usa Qwen/Qwen-Image-Edit-2511 con el pipeline de edición si quieres modificar fotos existentes. La primera ejecución descarga decenas de gigabytes, así que empieza con una conexión estable y una unidad con espacio de sobra.
Cuándo gana lo local a la API
A $0.03 por imagen, la factura de la API se mantiene pequeña para la mayoría de creadores. Alojarlo tú mismo empieza a compensar solo cuando generas decenas de miles de imágenes al mes con una GPU que trabaja sin parar, o cuando las normas de privacidad prohíben enviar prompts a un tercero. Una tarjeta parada cuesta más de lo que costará nunca la API.
Lo que Qwen Image 3.0 hace mejor
La calidad es el motivo por el que la gente quiere la versión 3.0 en primer lugar, así que vale la pena ver en qué se gana su sitio.
Texto legible en las imágenes
Las letras ilegibles son la señal clásica de una imagen de IA. Los modelos Qwen se diseñaron para evitarlo, y la versión 3.0 lleva esa mejora a tipografías pequeñas: carteles, etiquetas, menús y pies de foto que se mantienen legibles. Un prompt como "una pizarra con el cartel OPEN" debería devolver exactamente esa palabra, bien escrita.
Algunos hábitos hacen que el texto salga más limpio en cualquier modelo Qwen:
Entrecomilla las palabras exactas. Pon entre comillas el texto que quieres en la imagen.
Mantenlo corto. De una a tres palabras por cartel o etiqueta es mucho más seguro que un párrafo.
Nombra la superficie. Tiza sobre pizarra, pintura sobre ladrillo y tinta sobre papel se renderizan de forma distinta.
Indica dónde va. "Encima de la puerta" o "en la pizarra del menú de la izquierda" elimina las conjeturas.
Composiciones densas y edición
En páginas de periódico, hojas de ejercicios, storyboards y paneles de control, la larga ventana de prompt de 4.5K tokens da su mejor resultado. Puedes describir cada columna, pie de foto y panel en una sola solicitud. El mismo modelo acepta imágenes de referencia, así que puedes cambiar el estilo o corregir una sola zona de una foto sin volver a dibujar toda la escena.
💡 Revísalo todo. Los revisores advierten de que las composiciones generadas pueden parecer fiables aunque sean incorrectas. Comprueba nombres, cifras y fechas antes de publicar nada.
Usa Qwen Image 3 en PicassoIA
Hay una cuarta opción que evita los tokens, las páginas de facturación y las tarjetas gráficas. Qwen Image 3 funciona directamente en PicassoIA, y la página del modelo indica que se puede usar gratis en línea.
Escribe tu prompt en frases sencillas. Pon entre comillas cualquier texto que necesites en la imagen y mantenlo corto.
Elige una relación de aspecto. Usa 16:9 para banners, 9:16 para historias y 1:1 para publicaciones del feed.
Deja activada la expansión del prompt en prompts cortos, o desactívala cuando quieras control total.
Pulsa generar y revisa el resultado. Ajusta una cosa cada vez y vuelve a generar.
Fija la semilla cuando te guste un resultado, para poder recrearlo más adelante.
Para editar, sube una foto en el campo de imagen, describe el cambio y activa la opción que coincide con la resolución de entrada para que la salida conserve su tamaño original.
Ajustes que importan
Ajuste
Qué hace
Prompt
Texto obligatorio que describe la imagen o la edición
Indica lo que hay que dejar fuera, como marcas de agua o dedos extra
Semilla
Cualquier entero de 0 a 2147483647 para resultados repetibles
Expansión del prompt
Activada por defecto, reescribe los prompts cortos con más detalle
Igualar imagen de entrada
Mantiene el tamaño y las proporciones de una foto subida
¿Necesitas escenas más complejas? Prueba Qwen Image 3 Pro, que maneja composiciones abarrotadas con varios objetos distintos. Si prefieres la línea de pesos abiertos sin instalación local, Qwen Image 2512 y el Qwen Image original están disponibles, y Qwen Image Edit 2511 se encarga de los cambios en fotos. Para estilos personalizados también está Qwen Image LoRA Trainer Legacy.
Qué opción te conviene
Relaciona tu situación con la opción adecuada:
Tu situación
Mejor opción
Necesitas resultados de Qwen Image 3.0 en tu propia aplicación
API de Alibaba Cloud
Quieres archivos que puedas ajustar y alojar
Pesos abiertos como Qwen Image 2512
No tienes GPU y quieres resultados en minutos
PicassoIA en el navegador
Necesitas derechos comerciales sin trámites adicionales
Versiones Apache 2.0 o los términos alojados
Generas menos de unos pocos miles de imágenes al mes
API o PicassoIA, no hardware local
Tres errores que conviene evitar
Buscar una descarga. No existen pesos oficiales de Qwen Image 3.0, y todo lo que se presente así es sospechoso.
Saltarse la licencia. Qwen Image 2.1 usa una licencia de investigación, mientras que las versiones anteriores usan Apache 2.0.
Presupuestar con el precio estándar. La salida del nivel Pro cuesta más, hasta $0.075 por imagen.
Prueba hoy los modelos Qwen en Picasso IA
El resumen honesto es breve: Qwen Image 3.0 vive detrás de una API, los pesos abiertos pertenecen a versiones anteriores y la forma más rápida de ver lo que puede hacer la familia es escribir un prompt y mirar el resultado. Abre Qwen Image 3 en Picasso IA, escribe un prompt con un cartel o una etiqueta corta dentro, y compara el resultado con Qwen Image 2512. Ejecuta el mismo prompt en los dos, cambia un detalle y quédate con la versión que prefieras.
Explora la lista completa de modelos en picassoia.com/en/all-models para encontrar la opción adecuada para carteles, fotos de producto, maquetas y ediciones fotográficas, y empieza tu primera generación hoy mismo.