Qué cambió en la generación de 3D con IA este año: los mayores cambios explicados

La generación de 3D con IA vivió su mayor cambio en años. Gaussian Splatting reemplazó a NeRF como el pipeline dominante, los modelos de texto a 3D por fin entregaron resultados utilizables y la generación en tiempo real se volvió una realidad para los creadores particulares. Este desglose cubre cada cambio importante y muestra exactamente qué significa para tu flujo de trabajo creativo ahora mismo.

Qué cambió en la generación de 3D con IA este año: los mayores cambios explicados
Cristian Da Conceicao
Fundador de Picasso IA

Hace tres años, generar un recurso 3D utilizable a partir de una sola fotografía parecía ciencia ficción. Este año parecía una tarde de martes cualquiera. El ritmo de cambio en la generación de 3D con IA entre 2024 y 2025 ha sido notable: métodos fundamentales reemplazados, nuevos modelos de código abierto inundando el ecosistema y flujos de trabajo que antes estaban reservados para estudios con mucho presupuesto ahora están al alcance de los creadores particulares en un equipo portátil de consumo. Lo que de verdad cambió, por qué importa y qué significa para tu trabajo creativo ahora mismo.

La era de NeRF prácticamente ha terminado

Los Neural Radiance Fields (NeRF) dominaron la conversación sobre la reconstrucción 3D con IA durante varios años. Si rodeabas un objeto con una cámara, NeRF podía sintetizar vistas nuevas de él con una fidelidad impresionante. Pero usarlo en la práctica significaba horas de entrenamiento por escena, enormes requisitos de cómputo y un resultado que vivía dentro de una representación volumétrica de caja negra, en lugar de una malla 3D limpia y editable. Llevar un resultado de NeRF a Blender, a un motor de videojuegos o a un flujo de producción cinematográfica requería pasos adicionales y dolorosos que la mayoría de los estudios no estaban dispuestos a asumir.

Lo que hacía emocionante a NeRF

El artículo original de NeRF introdujo la idea de representar una escena 3D como una función neuronal continua optimizada a partir de imágenes 2D. Era elegante y producía vistas nuevas inusualmente nítidas. La investigación posterior se disparó: Instant NGP, Mip-NeRF 360, Zip-NeRF y decenas de variantes atacaron los cuellos de botella centrales de velocidad y escala. Durante un tiempo, NeRF pareció la dirección inevitable para la captura y la reconstrucción 3D.

Por qué alcanzó su techo

El problema era estructural. Las representaciones NeRF son implícitas, lo que significa que no puedes extraer la geometría con facilidad, editar objetos individuales ni exportar a formatos de malla estándar. El render en tiempo real desde un NeRF requería trucos específicos del hardware y pasos de horneado. Para los creadores profesionales que trabajan en herramientas DCC y motores de videojuegos, la fricción era simplemente demasiada. La comunidad se había encariñado con el concepto, pero las herramientas nunca alcanzaron del todo la ambición.

Fotógrafo capturando una figura de cerámica desde varios ángulos como referencia para reconstrucción 3D

Gaussian Splatting cambió todo el campo

El 3D Gaussian Splatting (3DGS) llegó a finales de 2023, y para 2025 había desplazado efectivamente a NeRF como método predeterminado para la reconstrucción 3D del mundo real. En lugar de una función neuronal implícita, Gaussian Splatting representa una escena como millones de pequeños elipsoides 3D, cada uno con una posición, rotación, escala, opacidad y color. Rasterizar esos elipsoides es lo bastante rápido como para ejecutarse en tiempo real en GPU de consumo.

Cifras de velocidad que hicieron cambiar de opinión

Donde un NeRF estándar podía tardar entre 6 y 12 horas en entrenarse en una escena de complejidad moderada, Gaussian Splatting lo redujo a menos de 30 minutos para una calidad comparable. Más importante aún, la velocidad de render pasó de estar por debajo del tiempo real a superar los 60 fps de verdad en hardware de gama media. Eso no es una mejora marginal. Es un cambio de categoría.

La comunidad investigadora no se detuvo ahí. Los pipelines de extracción de mallas, como SuGaR y las variantes de Gaussian Splatting 2D, ahora producen geometría editable y limpia directamente a partir de escenas gaussianas. Los complementos de la comunidad permiten cargar una escena 3DGS en Unreal Engine, Unity y Blender con unos pocos clics. El flujo de trabajo desde la captura de video con el teléfono hasta el 3D interactivo ahora se mide en una tarde en lugar de en una semana.

El salto en la calidad del render

Más allá de la velocidad, la calidad visual superó lo que NeRF podía producir en condiciones de captura bien iluminadas y controladas. El detalle fino de las superficies, los materiales translúcidos y las complejas interacciones de luz que NeRF solía emborronar o aproximar ahora se renderizan con mucha más fidelidad. La contrapartida es que las gaussianas pueden verse "splodgy" en zonas con poca cobertura de captura. Pero herramientas como Luma AI, Polycam y varios pipelines de código abierto ahora usan 3DGS como su método principal de reconstrucción. Si has probado alguna de estas apps recientemente, has estado usando Gaussian Splatting sin necesariamente conocer el nombre.

💡 Vale la pena saberlo: las escenas 3DGS se pueden exportar directamente a Unreal Engine, Unity y Blender con complementos de la comunidad que se mantienen activamente y mejoran cada mes.

Dos monitores uno al lado del otro mostrando una reconstrucción de nube de puntos frente a un modelo 3D suave en un laboratorio de investigación

Los modelos de texto a 3D por fin se volvieron útiles

Durante gran parte de 2023 y a principios de 2024, los modelos de texto a 3D resultaban más impresionantes en las demostraciones que en la práctica. DreamFusion mostró lo que era posible, pero los resultados eran borrosos, con forma de masa y cubiertos por el famoso problema de Janus: el modelo imprimía un rostro o un rasgo reconocible en cada lado visible de un objeto, porque no tenía una conciencia espacial real de una geometría 3D coherente.

Para 2025, esa era ha quedado en gran medida atrás. Ha llegado una nueva generación de modelos de texto a 3D y de imagen a 3D con coherencia multivista integrada en la arquitectura desde el principio, no añadida después.

La imagen única ya funciona en 3D

El cambio práctico más significativo es que la reconstrucción 3D a partir de una sola imagen se ha vuelto realmente fiable. Modelos como Zero123++, TripoSR, CraftsMan e InstantMesh pueden tomar una sola fotografía y producir, en segundos, un conjunto multivista coherente o una malla 3D directa. Los resultados no tienen calidad de render final, pero sirven como punto de partida para trabajo profesional. Eso cambia sustancialmente la economía del modelado conceptual, la visualización de productos y la creación de recursos para videojuegos.

MétodoEstado en 2023Estado en 2025
Texto a 3DMasas borrosas, artefactos de JanusGeometría coherente, texturas utilizables
Imagen a 3D (una sola imagen)Prueba de conceptoPunto de partida listo para producción
Video a 3DSolo demo de investigaciónPipeline práctico para captura controlada
Generación en tiempo realNo era posibleMenos de un segundo en GPU de consumo

Llegaron los modelos 3D de código abierto

La disponibilidad de modelos 3D capaces y de código abierto es en sí misma un gran avance de este año. Shap-E, Large3D, InstantMesh y varias versiones nuevas se han publicado con licencias permisivas. Los desarrolladores independientes e investigadores ahora pueden ajustar, alojar por su cuenta e integrar modelos de IA 3D sin pagar costos de API por cada generación. El ecosistema que los rodea ha crecido rápidamente, con nodos de ComfyUI, complementos para Blender y flujos de trabajo web que amplían lo que está al alcance de los creadores que no trabajan dentro de un gran estudio.

Joven diseñadora escribiendo un prompt de texto en un equipo portátil, mientras un monitor grande junto a ella muestra un modelo 3D materializándose a partir de una forma abstracta

Los modelos de difusión llegaron al espacio 3D

El mayor cambio conceptual del último año es que los modelos de difusión 2D se han convertido en la base de la generación 3D. En lugar de entrenar arquitecturas 3D nativas costosas desde cero, los investigadores descubrieron que los modelos de difusión 2D preentrenados ya contienen suficiente conocimiento espacial y de materiales como para supervisar la reconstrucción 3D, incluso sin ningún dato de entrenamiento 3D explícito en su pipeline.

La difusión multivista resolvió un problema difícil

El desafío central del texto a 3D siempre ha sido la coherencia: genera varias vistas del mismo objeto y tienen que coincidir geométricamente. Los modelos de difusión multivista, entrenados para generar varios puntos de vista a la vez bajo capas de atención compartidas, abordaron esto de forma directa. Zero123, MVDiffusion, SyncDreamer y sus sucesores atacaron el problema de maneras distintas. El resultado es que ahora puedes generar seis o más vistas coherentes de un objeto 3D y alimentarlas a un pipeline de Gaussian Splatting o de reconstrucción de mallas para obtener un resultado coherente.

3D sin datos de entrenamiento 3D

Esto importa más de lo que parece a primera vista. Entrenar un modelo para producir 3D directamente requiere grandes conjuntos de datos 3D etiquetados, que son caros, lentos de producir y limitados en variedad. Entrenar con imágenes 2D y usar los priors de difusión como supervisores de la geometría evita esa limitación por completo. Internet ofrece miles de millones de imágenes 2D. Al enseñar a los modelos a extraer conocimiento espacial y estructural de esas imágenes, los investigadores abrieron un camino hacia la generación 3D que escala con la disponibilidad de datos 2D y no con los presupuestos de anotación 3D.

💡 Implicación práctica: por eso el avance del texto a 3D se aceleró tanto una vez que los grandes modelos de difusión 2D se volvieron ampliamente disponibles. Los modelos 2D más capaces mejoran directamente la calidad de los resultados 3D que los usan como priors geométricos.

Dos profesionales en una oficina moderna de planta abierta comparando varias versiones de un modelo 3D en una pantalla grande montada en la pared

El video a 3D se convirtió en un flujo de trabajo real

Una de las revoluciones menos cubiertas de este año: la entrada de video ya es un elemento de primer nivel en los pipelines de reconstrucción 3D. Antes, la reconstrucción a partir de video era posible, pero requería una selección manual cuidadosa de fotogramas y un preprocesamiento para obtener resultados utilizables. Hoy, los modelos pueden procesar un video corto de teléfono (entre 10 y 30 segundos de metraje) de un objeto y generar un recurso 3D utilizable con una intervención mínima del operador.

De clips de 30 segundos a mallas

Pipelines como MonST3R (Monocular Scene Reconstruction in the Wild), RealDreamer y varias implementaciones comerciales ya aceptan video estándar de un teléfono como entrada directa. Gestionan el desenfoque por movimiento, la iluminación irregular y los pequeños elementos en movimiento mucho mejor que sus predecesores. En fotografía de producto, escaneo de objetos patrimoniales y previsualización arquitectónica, se ha convertido en una herramienta práctica de uso diario, y ya no es un experimento de laboratorio reservado a especialistas.

Qué falla y qué no

Todavía muy difícil en 2025: superficies muy reflectantes o transparentes, como el vidrio, el cromo y el agua; estructuras muy finas, como la malla de alambre, el cabello o las cuerdas; y escenas exteriores grandes con movimiento significativo del sujeto durante la captura. Ningún modelo las maneja de forma fiable todavía.

Funciona bien ahora: objetos mate con textura de superficie uniforme, productos manufacturados compactos, interiores arquitectónicos con iluminación controlada y objetos orgánicos como cerámica, muebles o telas. El rango práctico de trabajo es sustancialmente más amplio que hace 18 meses, aunque todavía no es universal.

Interior de un estudio de desarrollo de videojuegos con un desarrollador frente a una mesa de pie con tres monitores, mostrando un flujo de trabajo de recursos de personajes 3D

La generación de 3D en tiempo real ya está aquí

Quizás el desarrollo más sorprendente del último año es que la generación de 3D en tiempo real a partir de texto ya es técnicamente posible. No es de nivel de producción a escala para todos los casos de uso, pero el umbral ya se ha cruzado. Los modelos de investigación generan recursos 3D aproximados en menos de dos segundos en hardware de consumo de gama alta, con una calidad que mejora rápidamente con cada nueva publicación.

La inferencia de menos de un segundo cambió la forma de trabajar

Cuando la generación tarda 20 minutos, diseñas tu flujo de trabajo en torno a lotes. Encolas solicitudes, haces otras cosas y vuelves más tarde a evaluar los resultados. Cuando la generación tarda dos segundos, el modelo de interacción cambia por completo. Iteras en tiempo real. Aceptas un resultado o pruebas enseguida otro prompt. Ese cambio en la velocidad del ciclo de retroalimentación no solo cambia lo rápido que trabajas, sino también lo que estás dispuesto a probar, lo que afecta directamente a la calidad y a la originalidad de lo que produces.

Bajaron los requisitos de hardware

Ejecutar Gaussian Splatting 3D y los últimos modelos de imagen a 3D ya no requiere un clúster de GPU empresarial. Una GPU de consumo moderna de la clase RTX 4070 maneja la mayoría de los flujos de trabajo prácticos sin infraestructura especializada. La inferencia en la nube también se ha vuelto mucho más barata, con costos por generación lo bastante bajos como para que los creadores particulares los usen con regularidad sin financiación institucional ni planes de suscripción caros.

💡 Para contexto: un escaneo de fotogrametría profesional que en 2020 costaba a un estudio varios miles de dólares en hardware y horas de trabajo de operador ahora puede aproximarse a un punto de partida utilizable con herramientas de IA gratuitas o casi gratuitas. La brecha entre la capacidad de un estudio y la de un creador particular se ha reducido sustancialmente.

Arquitecta revisando modelos arquitectónicos 3D a gran escala en una pantalla táctil profesional en una oficina moderna y luminosa

Lo que los creadores hacen realmente con esto

Los cambios tecnológicos solo importan cuando cambian lo que la gente construye. Así se traducen en la práctica los avances de la IA en 3D en cambios reales del flujo de trabajo en distintos campos creativos.

Los estudios de videojuegos cambiaron el punto de partida

Los estudios independientes de videojuegos y los equipos de tamaño medio son ahora los adoptantes más agresivos de las herramientas de IA 3D. El caso de uso típico no es reemplazar a un artista. Es cambiar el punto de partida. En lugar de que un artista 3D dedique cuatro horas a modelar un objeto desde cero, usa una herramienta de IA para generar una malla aproximada a partir de una imagen de referencia, la limpia en su herramienta DCC preferida y aplica texturas terminadas. Una tarea que antes ocupaba medio día de trabajo ahora tarda menos de 90 minutos. El criterio y el oficio del artista siguen siendo centrales. El trabajo repetitivo de preparación prácticamente ha desaparecido.

Los estudios grandes observan con atención, pero avanzan más despacio. Las preocupaciones sobre la procedencia de los datos de entrenamiento y la compatibilidad de la propiedad intelectual con las dependencias existentes del pipeline son limitaciones reales. Pero la presión competitiva de los estudios más pequeños, que se mueven más rápido, está obligando a una evaluación interna más seria en cada gran estudio.

Arquitectos, diseñadores y cineastas

La visualización arquitectónica ha sido uno de los sectores profesionales que más rápido ha adoptado esto. La capacidad de tomar un boceto aproximado o una fotografía de un terreno existente y generar en menos de una hora un entorno de exploración 3D interactivo para una presentación al cliente es un cambio real en la forma en que funcionan las propuestas y las aprobaciones de diseño.

Los diseñadores de productos usan flujos de trabajo similares para la visualización conceptual rápida, produciendo representaciones de tipo 3D de ideas de producto físico sin construir prototipos físicos. En el cine y la televisión, las herramientas de IA 3D se usan para la previsualización y la extensión rápida de escenarios, mientras que las grandes casas de VFX esperan una orientación más clara sobre la propiedad intelectual antes de incorporar recursos generados por IA en los renders finales.

SectorCaso de uso principalNivel de adopción
Desarrollo de videojuegos independientesGeneración de mallas para objetos y entornosAlto, en crecimiento
Visualización arquitectónicaModelos conceptuales, recorridos para clientesAlto
Cine y VFXPrevisualización, modelado rápido de escenariosMedio, con cautela
Diseño de productoVisualización conceptual, revisión de prototiposMedio
Comercio electrónicoFotografía de producto a partir de escaneos 3DEmergente

Primer plano aéreo de unas manos sobre un teclado mecánico con un terreno de bosque generado fotorrealista visible en el monitor de fondo

Crea imágenes con aspecto 3D ahora mismo en PicassoIA

Aunque los pipelines dedicados de reconstrucción 3D han avanzado muchísimo, muchos creadores necesitan algo más rápido y sencillo: imágenes fotorrealistas que transmitan una fuerte profundidad, volumen y presencia espacial sin la carga de un pipeline 3D completo. Ahí es donde los modelos de generación de imágenes con IA de PicassoIA se han convertido en herramientas sorprendentemente capaces para la producción visual de estilo 3D.

Flux y Seedream para profundidad y volumen

Flux Dev y Flux Pro destacan especialmente en la creación de imágenes con profundidad espacial y capas convincentes. Cuando tu prompt especifica elementos de primer plano, plano medio y fondo con relaciones de distancia claras y una dirección de luz realista, estos modelos renderizan el resultado con una coherencia espacial impresionante. La imagen se lee como tridimensional aunque sea plana.

Seedream 4.5 va un paso más allá con salida en 4K y un excelente manejo de entornos volumétricos complejos: escenas de bosque densas, espacios interiores con varias fuentes de luz y fotos de producto con reflejos realistas en las superficies. Para los creadores que necesitan visuales de estilo 3D sin la carga de un pipeline 3D, es una de las opciones más capaces que hay actualmente en la plataforma.

Para la máxima fidelidad, Flux 1.1 Pro Ultra produce imágenes de 4 megapíxeles con el tipo de textura de superficie e iluminación volumétrica que hace que las imágenes planas se lean como auténticamente espaciales. Wan 2.7 Image Pro ofrece salida en 4K con un carácter estilístico que funciona especialmente bien para temas de visualización de producto y arquitectura.

Pasos sencillos para empezar hoy

Obtener buenos resultados de estilo 3D con la generación de imágenes depende de mantener buenos hábitos al escribir prompts:

  • Especifica la lente de la cámara y la profundidad de campo: escribir "shot with 85mm f/1.4 lens, shallow depth of field with sharp foreground and soft background" indica al modelo la profundidad espacial de forma directa y fiable.
  • Describe la luz volumétrica de forma explícita: "Volumetric morning light from upper left, light rays visible in dust particles, soft shadow falloff across midground" crea profundidad física en la escena renderizada.
  • Organiza la descripción de la escena en capas espaciales: describe los elementos de primer plano, plano medio y fondo como capas espaciales separadas. Un prompt estructurado así produce siempre una profundidad percibida mayor que una descripción plana de una sola capa.
  • Usa Flux Kontext Pro para la edición espacial: una vez que tengas una imagen base sólida, Flux Kontext Pro te permite ajustar relaciones de profundidad concretas o cambiar elementos del fondo sin regenerar desde cero.
  • Aumenta la resolución para el detalle de superficie: pasa tu imagen generada por las herramientas de Super Resolution de PicassoIA para resaltar las texturas finas de los materiales a 2x o 4x, lo que aumenta sustancialmente la percepción de volumen y realismo material.

También vale la pena experimentar con GPT Image 2 para escenas complejas con varios elementos espaciales que interactúan, y con Flux 2 Pro para resultados de alta fidelidad donde la precisión de la textura y la definición del material importan más. Ambos están disponibles en PicassoIA junto con el catálogo completo de más de 90 modelos de texto a imagen en picassoia.com/en/all-models.

Creadora de contenido sonriendo ante los resultados de una plataforma de generación de imágenes con IA en una configuración de oficina en casa con doble monitor

El cambio sigue acelerándose

La generación de 3D con IA en 2025 no es una tecnología asentada. Es un campo en movimiento, con nuevos modelos, métodos y benchmarks llegando cada pocas semanas. Lo que cambió este año no es solo la capacidad, es el impulso. Gaussian Splatting destronó a NeRF. Los modelos de difusión se convirtieron en el motor de la calidad de los resultados 3D. La reconstrucción a partir de una sola imagen pasó de curiosidad de investigación a flujo de trabajo práctico. La generación en tiempo real pasó de imposible a alcanzable en hardware de consumo.

Si no has revisado lo que las herramientas de 3D con IA pueden hacer desde principios de 2024, la distancia entre tu idea actual y el estado actual del campo es considerable. Para los creadores que quieren empezar a producir imágenes con presencia espacial real ahora mismo, sin esperar a que los pipelines 3D dedicados maduren más, PicassoIA ofrece algunos de los modelos de generación más capaces disponibles, desde Flux Dev y Seedream 4.5 hasta Flux 1.1 Pro Ultra y más allá. Las herramientas están ahí. Ve a crear algo con profundidad.

Profesional creativo de pie en un estudio oscuro mirando una pantalla enorme que muestra una escena de bosque 3D fotorrealista y muy detallada con luz volumétrica

Compartir este artículo

Elige tu idioma