El ámbito del video con IA de código abierto acaba de ganar un competidor serio. Genmo lanzó Mochi 1 a finales de 2024 con los pesos del modelo disponibles públicamente, y desde entonces se ha ido integrando en flujos de producción, flujos de trabajo creativos y proyectos de investigación de todo el mundo. Si llevas tiempo siguiendo el texto a video y te preguntas si alguna opción gratuita puede competir de verdad con las alternativas de pago, Mochi 1 es la primera respuesta real que merece tomarse en serio.

Qué es Mochi 1 realmente
Mochi 1 es un modelo de difusión de texto a video desarrollado por Genmo, una empresa de investigación en IA centrada en la generación de video multimodal. Publicado bajo la licencia Apache 2.0, es uno de los modelos de video de código abierto más permisivos que existen. Eso significa que puedes descargarlo, ejecutarlo en tu equipo, modificarlo, ajustarlo con ajuste fino y usar los resultados con fines comerciales sin pagar licencias.
El modelo genera videos de alta fidelidad de hasta 5,4 segundos a una resolución de 480p, con una fuerte coherencia temporal entre fotogramas. Se entrenó con un conjunto de datos de video muy grande y está diseñado específicamente para producir un movimiento fluido y natural, en lugar del movimiento entrecortado o deformado que afectaba a las alternativas de código abierto anteriores.
El transformador de difusión asimétrico
Lo que distingue a Mochi 1 a nivel técnico es su arquitectura. En lugar de usar una estructura estándar de transformador de difusión, Genmo creó lo que llaman Transformador de Difusión Asimétrico (AsymmDiT). Este enfoque procesa los tokens de video y de texto de una forma fundamentalmente distinta:
- Los tokens de video concentran la mayor parte del cómputo y de las capas de atención
- Los tokens de texto interactúan con los tokens de video mediante un mecanismo de atención cruzada ligero
- El resultado: mejor fidelidad y calidad de movimiento por unidad de cómputo utilizada
Esto importa porque la mayoría de los modelos de difusión de video tratan los tokens de texto y de video de forma simétrica, lo que desperdicia presupuesto de cómputo en el lado del texto. AsymmDiT concentra ese cómputo donde realmente cuenta.
Por qué el código abierto lo cambia todo
Las herramientas de generación de video cerradas controlan qué puedes crear, con qué resolución y para qué caso de uso. Mochi 1 elimina por completo esas restricciones. Los investigadores pueden ajustarlo con ajuste fino para dominios específicos, como las imágenes médicas, la visualización de arquitectura o la moda. Los desarrolladores pueden integrarlo en aplicaciones a medida. Los creadores son dueños de cada fotograma que producen.
La licencia Apache 2.0 también permite el uso comercial, lo que hace que Mochi 1 sea viable para agencias y estudios de producción que necesitan que los costos de su flujo de contenido sean predecibles.

Lo que Mochi hace bien
No todos los lanzamientos de código abierto cumplen lo que prometen. Mochi 1 destaca en tres áreas concretas que los usuarios mencionan con regularidad en las comparativas de la comunidad.
Un movimiento que se mantiene coherente
El fallo más habitual en el video con IA es la falta de coherencia temporal: los rostros se deforman entre fotogramas, los objetos parpadean y los fondos cambian de forma antinatural. Mochi 1 maneja esto mejor que los modelos abiertos anteriores. La arquitectura AsymmDiT, combinada con el entrenamiento en un conjunto de datos seleccionado de alto movimiento, produce videos en los que los sujetos se mueven de forma coherente y los entornos se mantienen estables durante todo el clip.
💡 Consejo profesional: los prompts que describen un movimiento continuo (una persona caminando, agua que fluye, hojas que caen) producen los mejores resultados de Mochi. Las descripciones de escenas estáticas no dan al modelo suficiente estructura de movimiento con la que trabajar.
Expresividad en el movimiento de los personajes
Una de las fortalezas específicas de Mochi es la expresión facial y corporal. Cuando un prompt describe a una persona que reacciona emocionalmente, Mochi tiende a representar esa reacción de forma convincente, en lugar de recurrir a una expresión congelada con movimiento solo en los labios. Esto lo hace especialmente útil para contenido narrativo, cortometrajes y videos para redes sociales que necesitan una presencia genuina de personajes.
Fidelidad al prompt
Mochi 1 sigue descripciones de prompts complejas con más fidelidad que muchas alternativas con el mismo precio (gratis). Puedes especificar el movimiento de cámara, el comportamiento del sujeto y el detalle del entorno en un solo prompt y esperar que el modelo intente todo ello. Los resultados no siempre son perfectos, pero se nota la fidelidad a la intención.

Mochi 1 frente a otros modelos de video
Vale la pena situar a Mochi 1 en el panorama actual. El texto a video cuenta con decenas de modelos, gratuitos y de pago. Así se compara Mochi con los que encuentran la mayoría de los creadores:
| Modelo | Código abierto | Resolución | Calidad de movimiento | Licencia |
|---|
| Mochi 1 | Sí | 480p | Excelente | Apache 2.0 |
| CogVideoX 5B | Sí | 480p | Buena | Apache 2.0 |
| LTX Video | Sí | 768p | Buena | Apache 2.0 |
| Hunyuan Video | Sí | 720p | Muy buena | Personalizada |
| Sora | No | 1080p | Excelente | Cerrado |
| Kling | No | 1080p | Muy buena | Cerrado |
La tabla cuenta una historia clara: Mochi 1 se sitúa a la cabeza de la categoría de código abierto en calidad de movimiento, aunque cede en resolución frente a modelos más recientes como Hunyuan. Para los equipos que priorizan el movimiento expresivo sobre la resolución bruta, Mochi sigue siendo la opción gratuita más sólida.
Cuándo tienen sentido los modelos de pago
Opciones de pago como Kling v2.6 o Pixverse v5 producen clips más largos (de hasta 10 segundos o más), resoluciones más altas y una generación más rápida en hardware profesional. Si produces contenido comercial a escala y la calidad no es negociable, un plan de pago está justificado. Pero para prototipos, experimentación creativa o producciones independientes con presupuestos más pequeños, Mochi 1 ofrece resultados serios sin necesidad de suscripción.

Cómo usar Mochi 1 en PicassoIA
PicassoIA aloja Mochi 1 directamente, así que puedes usarlo desde el navegador sin configurar un entorno local, descargar los pesos del modelo ni gestionar hardware GPU. Así se hace, paso a paso:
Paso 1: abre la página del modelo
Ve a Mochi 1 en PicassoIA. La interfaz carga un campo de prompt limpio con los controles de parámetros en el panel lateral. No necesitas cuenta para previsualizar los resultados.
Paso 2: escribe tu prompt
Tu prompt es la variable más importante. Mochi 1 responde mejor a prompts que son:
- Específicos con el movimiento: "una mujer gira la cabeza lentamente hacia la izquierda" funciona mejor que "una mujer"
- Descriptivos con el entorno: incluye las condiciones de iluminación, los detalles del fondo y el contexto de la escena
- Concisos pero completos: entre 30 y 60 palabras suele ser el punto ideal
Ejemplo de prompt que funciona bien:
"Una joven sentada junto a una ventana con lluvia, girándose despacio para mirar a la cámara, luz cálida de una lámpara interior en su rostro, luces de la ciudad desenfocadas al fondo, atmósfera cinematográfica suave"
Paso 3: ajusta los parámetros
La interfaz del modelo en PicassoIA muestra algunos parámetros importantes:
| Parámetro | Qué hace | Valor recomendado |
|---|
| Steps | Pasos de desruido de la inferencia | 64 para calidad, 30 para velocidad |
| CFG Scale | Cuán estrictamente sigue el prompt | 4,5 a 6,0 |
| Semilla | Control de reproducibilidad | Aleatoria para variedad |
Paso 4: genera y itera
Pulsa generar y espera. Mochi 1 no es instantáneo, ni siquiera en hardware en la nube, pero la generación suele completarse en menos de 2 minutos. Si el primer resultado no coincide con lo que imaginas, ajusta primero el prompt en lugar de los parámetros. El modelo es más sensible a los cambios de lenguaje que a los ajustes numéricos.
💡 Consejo: añade descriptores de movimiento al principio del prompt. "Paneo lento sobre..." o "Primer plano de manos moviéndose despacio..." fijan el contexto de cámara y movimiento antes de la descripción del sujeto, y mejoran siempre los resultados.
Paso 5: escala si lo necesitas
Como Mochi 1 genera en 480p, es posible que quieras pasar el resultado por una herramienta de superresolución para llevarlo a 720p o 1080p antes de publicarlo. PicassoIA ofrece modelos de superresolución que escalan los fotogramas de video de forma eficaz, sin una pérdida de calidad significativa en los detalles finos.

Casos de uso reales de Mochi 1
Las capacidades teóricas importan menos que lo que la gente está creando de verdad con este modelo. Estas son las categorías en las que Mochi 1 rinde de forma constante.
Redes sociales y contenido de formato corto
TikTok, Instagram Reels y YouTube Shorts han generado una demanda constante de video corto que sea visualmente atractivo sin ser necesariamente cinematográfico. Los clips de 5 segundos de Mochi 1 encajan con precisión en este formato. Una creadora de moda puede generar material de apoyo (B-roll) con una modelo en un entorno exterior natural. Una blogger de cocina puede visualizar una receta en movimiento. Una cuenta de viajes puede producir clips promocionales de destinos sin necesidad de un equipo de rodaje.
La salida de 480p es aceptable para plataformas pensadas primero para dispositivos móviles, donde los espectadores miran en pantallas pequeñas con una entrega comprimida.

Storyboards y previsualización
Directores de cine y productores publicitarios usan el video con IA para animáticas, las pruebas de movimiento aproximadas que se hacen antes de comprometerse con rodajes costosos. Mochi 1 es muy adecuado aquí porque su movimiento de personajes es lo bastante convincente como para transmitir la energía de una escena a un cliente o a un director creativo, sin el acabado de la producción final. Para los cineastas independientes en particular, poder generar previsualizaciones sin presupuesto es una ventaja operativa significativa.
Investigación y ajuste fino de modelos
Como los pesos son totalmente abiertos, Mochi 1 se ha convertido en una base para la investigación. Los equipos lo están ajustando para dominios visuales específicos: recorridos arquitectónicos, simulación médica, dinámica de vehículos y captura de movimiento deportivo. La licencia Apache 2.0 permite desplegar comercialmente esas versiones ajustadas sin complicaciones legales.
Integraciones para desarrolladores
El modelo puede invocarse mediante API a través de plataformas como Replicate, lo que facilita integrar la generación de video con IA en aplicaciones web, aplicaciones móviles y flujos de automatización. Un desarrollador que cree una herramienta de tarjetas de felicitación en video personalizadas, por ejemplo, podría integrar Mochi 1 como motor de generación sin tener que construir desde cero una infraestructura de inferencia propia.

Otros modelos de video gratuitos que vale la pena conocer
Mochi 1 es la opción de código abierto más sólida en calidad de movimiento, pero no es la única. Según tus necesidades concretas, estas alternativas pueden encajar mejor con determinados proyectos:
CogVideoX 5B
CogVideoX 5B, de la Universidad Tsinghua y Zhipu AI, es otro sólido modelo Apache 2.0. Maneja especialmente bien la alineación entre texto y video, y produce escenas coherentes cuando el prompt describe interacciones específicas entre objetos. Queda ligeramente por detrás de Mochi en la expresividad del movimiento de personajes, pero es una segunda opción fiable para contenido narrativo.
Pyramid Flow
Pyramid Flow utiliza un enfoque de difusión piramidal que permite generar de forma eficiente en varias resoluciones. Es más rápido que Mochi en el mismo hardware y produce buenos resultados para contenido de paisajes y entornos, donde la expresividad de los personajes importa menos que la calidad de la escena.
Stable Diffusion Videos
Stable Diffusion Videos sigue siendo una opción sólida para quienes ya trabajan con el ecosistema de Stable Diffusion. Ofrece menos fidelidad que Mochi, pero se integra con facilidad en los flujos de trabajo de SD existentes y en los pipelines de ControlNet para un control estructurado del movimiento.
Cuándo elegir Wan en su lugar
La serie Wan 2.7 T2V genera video en 1080p y admite duraciones de clip más largas. Si la resolución y la duración del clip importan más que el acceso de código abierto, Wan 2.7 merece la pena. Está disponible en PicassoIA y produce resultados cinematográficos para contenido comercial que necesita una calidad lista para publicar desde el primer momento.

Patrones de prompt que de verdad funcionan
Escribir prompts para Mochi 1 es una habilidad que se desarrolla con la práctica, pero hay algunos patrones que producen resultados sólidos desde el principio.
La fórmula sujeto-acción-entorno-luz:
Empieza por el sujeto y lo que está haciendo, después describe el entorno y, por último, especifica la iluminación. Así el modelo tiene una estructura espacial y temporal clara.
Ejemplo: "Un hombre con camisa de lino levanta despacio una taza de café hacia sus labios, sentado en una mesa de madera de una terraza de cafetería soleada al aire libre, luz cálida de la tarde que entra desde arriba a la izquierda, profundidad de campo reducida"
Lo que conviene evitar:
- No describas varios sujetos con acciones que compiten entre sí en un mismo prompt
- Evita los estados abstractos o emocionales sin anclajes físicos ("una sensación de alegría" no produce nada útil; "una persona riendo mientras mira la lluvia que cae" sí funciona)
- No pidas textos superpuestos ni tipografía específica en el video
Prompts negativos que ayudan:
Añadir indicaciones negativas como "borroso", "rostros deformados", "marca de agua" y "baja calidad" mejora siempre los resultados, incluso cuando el prompt base ya está bien escrito. Esto es especialmente cierto en los planos de primer plano de rostros.
La carrera del video con IA de código abierto
Mochi 1 llegó en un momento en que varios equipos con buena financiación apostaban por los modelos de video de código abierto como estrategia para crear comunidad. Stability AI, Tencent, Lightricks y Genmo publicaron pesos abiertos en un periodo corto a finales de 2024 y principios de 2025. El resultado es un ecosistema de código abierto más rico de lo que nadie predijo.
Genmo ha sido transparente sobre su hoja de ruta: resoluciones más altas, clips de mayor duración y versiones ajustadas con ajuste fino entrenadas en categorías de contenido específicas están todas en desarrollo activo. La comunidad en torno a Mochi en Hugging Face ya ha producido ajustes finos optimizados para anime, fotorrealismo y video de retratos, lo que demuestra lo rápido que se puede adaptar un modelo abierto.
Para los creadores, esto significa que el techo de calidad de la generación de video gratuita sube con rapidez. Modelos que en 2023 habrían requerido cientos de dólares al mes en cómputo en la nube hoy están al alcance de cualquiera desde un navegador y un prompt de texto.

Empieza a crear ahora
Si llevabas tiempo esperando una herramienta de video con IA que sea gratuita, permisiva y que de verdad produzca buenos resultados, Mochi 1 es esa herramienta. El modelo está disponible en PicassoIA ahora mismo, sin descargas y sin necesidad de suscripción.
Prueba Mochi 1 con una escena de retrato corta o un clip ambiental sencillo. Cuando domines lo básico, experimenta con prompts más largos y detallados, y pasa el resultado por una de las herramientas de superresolución de PicassoIA para subir la calidad final antes de publicar.
Más allá de Mochi, PicassoIA aloja más de 100 modelos de generación de video en la colección de texto a video, desde opciones gratuitas de código abierto hasta los modelos comerciales más potentes disponibles. Dedica una sesión a comparar resultados de Mochi 1, Wan 2.7 y Kling v2.6 lado a lado. La diferencia en lo que cada modelo hace bien te dirá más que cualquier tabla de benchmarks.
La comunidad de generación de video de código abierto está creando algo realmente útil. Mochi 1 demuestra que no necesitas pagar un precio premium para crear contenido de video con IA convincente.