Tienes una canción atascada en la cabeza, pero solo quieres una mitad: la cantante o la banda. Hace unos años eso significaba una sesión de estudio y mucha suerte. Hoy, un eliminador de voz con IA gratis en línea puede separar una pista en el tiempo que tardas en preparar un café, y el resultado suele ser lo bastante limpio como para cantar encima, hacer un remix o estudiar nota a nota.
Este artículo muestra cómo funciona realmente la tecnología, qué te ofrecen y qué no te ofrecen las herramientas gratuitas, cómo conseguir una separación decente con una canción difícil y qué hacer con los archivos después. Una nota honesta desde el principio: PicassoIA no tiene un separador de stems propio. Haces la separación con cualquier separador gratuito y luego traes los stems aquí para la letra, los videos con letra y música completamente nueva. La separación es el primer paso, no la meta final.

💡 Respuesta rápida: sube un WAV (o un MP3 de alta tasa de bits) a un separador de stems con IA, elige la opción voces e instrumental, descarga los dos archivos y escúchalos con auriculares antes de usarlos. Todo lo que sigue trata de que esto funcione en canciones que no colaboran.
Qué hace realmente un eliminador de voz
El viejo truco de fase frente a la separación con IA
Antes de las redes neuronales, el truco habitual era la cancelación de fase. Las voces principales suelen mezclarse exactamente en el centro, así que los canales izquierdo y derecho llevan un canto casi idéntico. Invierte la polaridad de un canal, suma los dos, y todo lo que sea idéntico en ambos se cancela. En teoría, la voz desaparece.
En la práctica, el bombo, el bajo y a menudo la caja también están en el centro, así que desaparecen junto con la voz. Lo que queda suena delgado, hueco y bañado en reverb sobrante, porque la reverb es ancha y no se cancela.

La separación con IA funciona de otra manera. Una red neuronal se entrena con enormes cantidades de grabaciones en las que cada parte se conoce de antemano, así que aprende cómo se ve una voz humana dentro de un espectrograma: los armónicos apilados, las consonantes aireadas, el temblor del vibrato. Dada una mezcla estéreo terminada, estima qué partes del sonido pertenecen a la voz y reconstruye esa señal como un archivo propio. Todo lo demás va a un segundo archivo. Nada se resta a ciegas, por eso el bajo y el bombo sobreviven.
Modelos de código abierto como Demucs (del equipo de investigación de Meta) y Spleeter (de Deezer) son los ejemplos más conocidos, y muchas herramientas web gratuitas se basan en la misma familia de ideas.
Los stems explicados sin tecnicismos
Un stem es un grupo de sonidos relacionados volcados en un solo archivo de audio: todas las voces, toda la batería, todo el bajo. La mayoría de herramientas te deja elegir en cuántos stems separar.
| Tipo de separación | Archivos que obtienes | Ideal para |
|---|
| 2 stems | Voces, instrumental | Pistas de karaoke, acapellas, ediciones rápidas |
| 4 stems | Voces, batería, bajo, otros | Remixes, práctica de batería o bajo |
| 5 a 6 stems | Añade piano y/o guitarra | Aislar un único instrumento para estudiarlo |
Las opciones exactas dependen de la herramienta. Separar en dos stems es lo más rápido y, normalmente, lo más limpio, porque el modelo tiene la tarea más simple: voz o no voz. Cada stem extra añade otra oportunidad para que un sonido caiga en el grupo equivocado.

Una forma útil de pensarlo: el stem vocal es lo que habría captado un micrófono en esa cabina, y el instrumental es todo lo que tocó el resto de la banda. El modelo está adivinando esa sesión de grabación original, trabajando hacia atrás desde la mezcla terminada.
Elige bien una herramienta gratuita
Qué suelen limitar las versiones gratuitas
"Gratis" significa cosas distintas de un sitio a otro. Antes de subir nada, revisa estos límites habituales:
- Duración de la pista: muchos planes gratuitos limitan cada subida a unos pocos minutos.
- Subidas diarias: un número fijo de canciones al día, y después una cola de espera o un muro de pago.
- Calidad de exportación: vistas previas o descargas solo en MP3, con el WAV reservado para usuarios de pago.
- Número de stems: dos stems gratis, cuatro o más detrás de una suscripción.
- Almacenamiento de archivos: tu subida se queda un tiempo en el servidor de otra persona. Si la canción no está publicada, lee primero las condiciones de privacidad.
¿Navegador, escritorio o integrado?
| Método | Costo | Calidad | Velocidad | Principal inconveniente |
|---|
| Cancelación de fase | Gratis | Baja | Instantánea | Elimina el bajo y el bombo, conserva la reverb |
| Herramienta de IA en el navegador | Nivel gratuito | Buena a muy buena | A los pocos minutos | Límites de subida, colas, límites de exportación |
| Modelo de código abierto en tu equipo | Gratis | Muy buena | Depende de tu hardware | Requiere configuración, una GPU ayuda |
| Separador de stems dentro de una DAW | Incluido en el software | Buena | Rápida | Ligado a un solo programa |
Una herramienta de navegador es la mejor opción para un uso puntual. Si separas a menudo, o trabajas con material sin publicar, ejecutar un modelo de código abierto en tu propio equipo mantiene los archivos fuera de servidores ajenos y elimina los límites diarios. Varias aplicaciones de producción musical importantes también incluyen ya su propio separador de stems, algo que conviene revisar antes de instalar nada nuevo.
💡 Antes de subir: usa el archivo de mayor calidad que tengas, mantén la canción en su duración completa y anota los ajustes que elegiste. Comparar dos resultados más adelante es mucho más fácil si sabes exactamente qué cambió.
Separa una canción paso a paso
Prepara el archivo de origen
La calidad de entrada determina la de salida. Un WAV o FLAC sin pérdida le da al modelo la mayor información posible con la que trabajar. Un MP3 sirve a 256 kbps o más. El peor origen es un archivo extraído de un video en streaming o grabado desde un altavoz, porque la compresión ya ha emborronado los detalles que el modelo necesita para distinguir una voz de una guitarra.
Deja la canción sin recortar. Los modelos usan toda la pista como contexto, y cortar una introducción o un final rara vez ahorra tiempo significativo. Tampoco apliques trucos de sonoridad antes: una canción aplastada con limitación extra deja menos espacio entre la voz y los instrumentos.
Ejecuta la separación

El proceso es casi idéntico en cada servicio:
- Sube tu archivo o pega un enlace si la herramienta lo admite.
- Elige el número de stems. Dos stems para karaoke, cuatro para remezclar.
- Escoge el mejor modelo si la herramienta ofrece varios. Los modos de "alta calidad", más lentos, suelen sonar bastante más limpios.
- Inicia el trabajo y espera. La mayoría de canciones terminan en pocos minutos.
- Descarga en WAV si tienes la opción, para que los stems no se compriman por segunda vez.
Comprueba el resultado con el oído
Ponte los auriculares y escucha cada stem por separado. Escucha una estrofa y un estribillo, porque los estribillos son más densos y revelan antes los problemas. Estás comprobando tres cosas: voces fantasma tenues en el instrumental, textura borrosa o acuosa en los platillos y terminaciones de palabras cortadas en el stem vocal.
Para una prueba más exigente, carga el original y el instrumental en cualquier editor de audio, invierte la polaridad del instrumental y reprodúcelos juntos. Lo que oyes es, más o menos, la voz más los errores del modelo. Si se oyen batería o acordes, el modelo los sacó por error del instrumental.
💡 Consejo: juzga los stems al volumen al que los vas a usar de verdad. Una voz fantasma que desaparece a volumen de fiesta puede resultar obvia en una habitación tranquila con auriculares.
Por qué algunas canciones se separan mal
Reverb, armonías y mezclas en mono

Algunas canciones se resisten, y rara vez es culpa de la herramienta. Los sospechosos habituales:
- Reverb intensa. La cola de eco de una voz se extiende por el campo estéreo y a menudo se queda en el instrumental como un coro tenue y fantasmal.
- Armonías apiladas. Las voces de acompañamiento pueden acabar en el instrumental mientras la voz principal va al archivo vocal, o al revés.
- Voces distorsionadas. El canto gritado o muy saturado comparte mucho espacio de frecuencias con las guitarras.
- Grabaciones antiguas en mono. Los trucos de fase necesitan una imagen estéreo, así que fallan por completo en cintas mono. Los modelos de IA siguen funcionando, pero el origen suele tener siseo y ancho de banda limitado, lo que reduce el techo de calidad.
- Fragmentos de voz muestreados. Una voz troceada y usada como un instrumento es difícil de clasificar como una cosa u otra.
Cómo corregir los artefactos
No tienes por qué aceptar el primer resultado. Relaciona el síntoma con una solución:
| Lo que oyes | Causa probable | Qué probar |
|---|
| Canto tenue en el instrumental | Cola de reverb o voces de acompañamiento | Pasa el instrumental por el separador una segunda vez |
| Platillos acuosos o con remolinos | El modelo tiene dificultades con el detalle rápido de agudos | Cambia a un modelo de mayor calidad o a otra herramienta |
| La voz suena fina o robótica | Archivo de origen de baja tasa de bits | Empieza de nuevo con un WAV, FLAC o MP3 de 256 kbps |
| Batería filtrada en la voz | Caja o hi-hat compartiendo frecuencias con la voz | Usa una separación de cuatro stems y descarta el stem de batería |
| Palabras cortadas al final | El modelo confunde los fundidos con ruido | Prueba otro modelo o mezcla un poco del original |
Dos soluciones más están en tu editor de audio. Una puerta de ruido o bajadas manuales de volumen en el instrumental elimina las voces fantasma entre frases, cuando no hay nada más sonando que las tape. Un corte suave de EQ en el medio-agudo, más o menos donde se sitúa una voz, puede esconder restos sin estropear la música.
Para una fiesta, nadie oye un fantasma tenue. Para una publicación, rehaz a mano la sección débil o reemplaza la pista por completo, algo que vuelve a aparecer más abajo.
Usos reales para las voces aisladas
Karaoke sin buscar pistas

Para la mayoría de canciones, sobre todo las nuevas o de nicho, no existen versiones oficiales de karaoke. Una separación de dos stems te da un instrumental en minutos. Cárgalo en cualquier reproductor, pon la letra en una segunda pantalla y tendrás tu propia noche de karaoke.
Si el rango original te queda demasiado alto o bajo, la mayoría de reproductores pueden cambiar el tono unos semitonos sin alterar la velocidad. Baja al cantante dos o tres pasos y una canción que parecía inalcanzable se vuelve cómoda.
Acapellas para DJs y remezcladores

Una voz aislada es la materia prima de un remix. Colócala sobre un beat nuevo, estira el tempo para que encaje y trocea las frases para crear un gancho. Las separaciones de cuatro stems ayudan aquí: el stem de batería te permite reconstruir el groove, y quitar el stem de bajo te deja sustituir un registro grave que choque con tu nueva pista.
Unos hábitos hacen que las acapellas funcionen bien. Ajusta primero el tempo y luego revisa el tono frente a tu nueva pista para que no compitan. Añade un poco de reverb encima en lugar de confiar en lo que dejó el separador. Si piensas publicar el resultado, lee antes la sección de derechos de más abajo.
Practicar junto a la banda

Los músicos usan la separación como sala de ensayo. Un bajista silencia el stem de bajo y toca la línea en directo. Un guitarrista usa una separación de seis stems para silenciar la guitarra. Un cantante que ensaya armonías puede bajar la voz principal y escuchar las voces de acompañamiento por separado. Reproduce a media velocidad y los stems suelen seguir siendo lo bastante limpios como para seguir un pasaje complicado.
Las mismas herramientas funcionan con audio hablado. Los podcasters y los editores de video las usan para extraer la música de fondo de una grabación de voz, o para conservar la música y eliminar el diálogo para otra edición.
Qué hacer con tus stems
Una vez que tienes una voz o un instrumental limpios, se convierten en material de partida para otros proyectos. PicassoIA tiene modelos de transcripción, generación de video y música, y tres tareas muestran cómo encajan las piezas.
Extrae la letra del stem vocal
Una voz sin la banda es mucho más fácil de entender para un modelo de voz. Sube el stem vocal a GPT 4o Transcribe e indica el idioma con su código de dos letras, como en, para mejorar la precisión y la velocidad. El modelo acepta archivos MP3, WAV, M4A, OGG y WebM. Gemini 3 Pro es una segunda opción si la primera transcripción tiene problemas con una estrofa rápida.
El canto es más difícil que el habla, así que revisa el resultado contrastándolo con la canción. Aun así, corregir un borrador lleva bastante menos tiempo que escribir cada línea de oído.
Convierte la voz en un video con letra

Audio To Video toma un archivo de audio y una imagen o un prompt de texto, y genera un video corto cuyas imágenes responden al sonido. Un stem vocal es una buena entrada, porque el movimiento sigue el canto en lugar de la batería.
Cómo usarlo en PicassoIA:
- Abre la página del modelo y sube el stem vocal (WAV, MP3, FLAC, OGG o M4A).
- Añade una imagen que sirva como primer fotograma, o describe la escena en el prompt si no tienes ninguna. Si añades ambas cosas, el prompt describe cómo debe moverse la imagen.
- Ajusta el guidance scale. Los valores más altos siguen tu prompt con más fidelidad, pero pueden reducir la calidad, así que súbelo en pasos pequeños.
- Genera, revisa el clip y ajusta el prompt hasta que el movimiento encaje con el ambiente.
- Une los clips en tu editor de video y añade la letra transcrita como subtítulos.
El modelo crea clips cortos, así que trabaja una estrofa o un estribillo cada vez.
Crea una pista de acompañamiento nueva
Si tu instrumental tiene fantasmas que no puedes corregir, o no puedes publicar el original, genera uno nuevo. Describe el tempo, el ambiente y los instrumentos de la canción que estás sustituyendo, y deja que un modelo de texto a música componga algo nuevo:
Escribe los prompts como si le dieras instrucciones a una banda de sesión: "pop indie de tempo medio, 100 BPM, guitarra eléctrica limpia, batería con escobillas suaves, bajo cálido y mucho espacio para una voz principal femenina." Genera varias versiones y elige la que mejor encaje bajo tu voz.
¿Es legal separar canciones?
Separar un archivo no cambia quién es su dueño. En muchos lugares, crear una pista de karaoke privada o un bucle de práctica para uso propio se mueve en una zona gris que los titulares de derechos rara vez persiguen. Publicar, emitir en streaming o vender algo construido a partir de una grabación comercial es distinto: necesita permiso o una licencia de quien posee la canción. Esto se aplica a la voz, al instrumental y a cualquier remix de ambos. Esto no es asesoramiento legal, y las normas varían según el país.
Las vías seguras son sencillas. Separa tus propias grabaciones, pistas que tengas licencia para remezclar y música publicada con stems expresamente para remezclar.
Pruébalo en PicassoIA
Separar es la parte fácil. La diversión empieza cuando construyes sobre ello. Escribe un instrumental nuevo con un modelo de texto a música, diseña la portada del álbum con Seedream 4.5 o convierte un estribillo en un clip corto con Audio To Video. Abre PicassoIA, escribe un prompt y mira lo que puede dar de sí una tarde de experimentos.
Elige una canción que te guste, sepárala y crea algo nuevo con las piezas. Tu próxima pista, portada o video empieza con un solo prompt.