Eliminador de voz con IA gratis en línea: separa las voces de cualquier canción

Un eliminador de voz con IA gratuito puede separar cualquier canción en voces e instrumental en minutos, directamente en tu navegador. Descubre cómo funciona la separación por stems, qué ajustes protegen la calidad, cómo corregir las voces fantasma y los artefactos acuosos, y qué hacer después con los archivos, desde la letra hasta los videos con letra o las pistas de acompañamiento totalmente nuevas.

Eliminador de voz con IA gratis en línea: separa las voces de cualquier canción
Cristian Da Conceicao
Fundador de Picasso IA

Tienes una canción atascada en la cabeza, pero solo quieres una mitad: la cantante o la banda. Hace unos años eso significaba una sesión de estudio y mucha suerte. Hoy, un eliminador de voz con IA gratis en línea puede separar una pista en el tiempo que tardas en preparar un café, y el resultado suele ser lo bastante limpio como para cantar encima, hacer un remix o estudiar nota a nota.

Este artículo muestra cómo funciona realmente la tecnología, qué te ofrecen y qué no te ofrecen las herramientas gratuitas, cómo conseguir una separación decente con una canción difícil y qué hacer con los archivos después. Una nota honesta desde el principio: PicassoIA no tiene un separador de stems propio. Haces la separación con cualquier separador gratuito y luego traes los stems aquí para la letra, los videos con letra y música completamente nueva. La separación es el primer paso, no la meta final.

Auriculares de estudio sobre un escritorio de roble junto a un equipo portátil que muestra formas de onda de audio

💡 Respuesta rápida: sube un WAV (o un MP3 de alta tasa de bits) a un separador de stems con IA, elige la opción voces e instrumental, descarga los dos archivos y escúchalos con auriculares antes de usarlos. Todo lo que sigue trata de que esto funcione en canciones que no colaboran.

Qué hace realmente un eliminador de voz

El viejo truco de fase frente a la separación con IA

Antes de las redes neuronales, el truco habitual era la cancelación de fase. Las voces principales suelen mezclarse exactamente en el centro, así que los canales izquierdo y derecho llevan un canto casi idéntico. Invierte la polaridad de un canal, suma los dos, y todo lo que sea idéntico en ambos se cancela. En teoría, la voz desaparece.

En la práctica, el bombo, el bajo y a menudo la caja también están en el centro, así que desaparecen junto con la voz. Lo que queda suena delgado, hueco y bañado en reverb sobrante, porque la reverb es ancha y no se cancela.

Vista desde arriba de las manos de un ingeniero deslizando los faders de una mesa de mezclas analógica

La separación con IA funciona de otra manera. Una red neuronal se entrena con enormes cantidades de grabaciones en las que cada parte se conoce de antemano, así que aprende cómo se ve una voz humana dentro de un espectrograma: los armónicos apilados, las consonantes aireadas, el temblor del vibrato. Dada una mezcla estéreo terminada, estima qué partes del sonido pertenecen a la voz y reconstruye esa señal como un archivo propio. Todo lo demás va a un segundo archivo. Nada se resta a ciegas, por eso el bajo y el bombo sobreviven.

Modelos de código abierto como Demucs (del equipo de investigación de Meta) y Spleeter (de Deezer) son los ejemplos más conocidos, y muchas herramientas web gratuitas se basan en la misma familia de ideas.

Los stems explicados sin tecnicismos

Un stem es un grupo de sonidos relacionados volcados en un solo archivo de audio: todas las voces, toda la batería, todo el bajo. La mayoría de herramientas te deja elegir en cuántos stems separar.

Tipo de separaciónArchivos que obtienesIdeal para
2 stemsVoces, instrumentalPistas de karaoke, acapellas, ediciones rápidas
4 stemsVoces, batería, bajo, otrosRemixes, práctica de batería o bajo
5 a 6 stemsAñade piano y/o guitarraAislar un único instrumento para estudiarlo

Las opciones exactas dependen de la herramienta. Separar en dos stems es lo más rápido y, normalmente, lo más limpio, porque el modelo tiene la tarea más simple: voz o no voz. Cada stem extra añade otra oportunidad para que un sonido caiga en el grupo equivocado.

Perfil lateral de un cantante masculino grabando en una cabina de voz con un filtro antiplosivos

Una forma útil de pensarlo: el stem vocal es lo que habría captado un micrófono en esa cabina, y el instrumental es todo lo que tocó el resto de la banda. El modelo está adivinando esa sesión de grabación original, trabajando hacia atrás desde la mezcla terminada.

Elige bien una herramienta gratuita

Qué suelen limitar las versiones gratuitas

"Gratis" significa cosas distintas de un sitio a otro. Antes de subir nada, revisa estos límites habituales:

  • Duración de la pista: muchos planes gratuitos limitan cada subida a unos pocos minutos.
  • Subidas diarias: un número fijo de canciones al día, y después una cola de espera o un muro de pago.
  • Calidad de exportación: vistas previas o descargas solo en MP3, con el WAV reservado para usuarios de pago.
  • Número de stems: dos stems gratis, cuatro o más detrás de una suscripción.
  • Almacenamiento de archivos: tu subida se queda un tiempo en el servidor de otra persona. Si la canción no está publicada, lee primero las condiciones de privacidad.

¿Navegador, escritorio o integrado?

MétodoCostoCalidadVelocidadPrincipal inconveniente
Cancelación de faseGratisBajaInstantáneaElimina el bajo y el bombo, conserva la reverb
Herramienta de IA en el navegadorNivel gratuitoBuena a muy buenaA los pocos minutosLímites de subida, colas, límites de exportación
Modelo de código abierto en tu equipoGratisMuy buenaDepende de tu hardwareRequiere configuración, una GPU ayuda
Separador de stems dentro de una DAWIncluido en el softwareBuenaRápidaLigado a un solo programa

Una herramienta de navegador es la mejor opción para un uso puntual. Si separas a menudo, o trabajas con material sin publicar, ejecutar un modelo de código abierto en tu propio equipo mantiene los archivos fuera de servidores ajenos y elimina los límites diarios. Varias aplicaciones de producción musical importantes también incluyen ya su propio separador de stems, algo que conviene revisar antes de instalar nada nuevo.

💡 Antes de subir: usa el archivo de mayor calidad que tengas, mantén la canción en su duración completa y anota los ajustes que elegiste. Comparar dos resultados más adelante es mucho más fácil si sabes exactamente qué cambió.

Separa una canción paso a paso

Prepara el archivo de origen

La calidad de entrada determina la de salida. Un WAV o FLAC sin pérdida le da al modelo la mayor información posible con la que trabajar. Un MP3 sirve a 256 kbps o más. El peor origen es un archivo extraído de un video en streaming o grabado desde un altavoz, porque la compresión ya ha emborronado los detalles que el modelo necesita para distinguir una voz de una guitarra.

Deja la canción sin recortar. Los modelos usan toda la pista como contexto, y cortar una introducción o un final rara vez ahorra tiempo significativo. Tampoco apliques trucos de sonoridad antes: una canción aplastada con limitación extra deja menos espacio entre la voz y los instrumentos.

Ejecuta la separación

Joven mirando cuatro pistas de audio separadas en la pantalla de un equipo portátil sobre un escritorio

El proceso es casi idéntico en cada servicio:

  1. Sube tu archivo o pega un enlace si la herramienta lo admite.
  2. Elige el número de stems. Dos stems para karaoke, cuatro para remezclar.
  3. Escoge el mejor modelo si la herramienta ofrece varios. Los modos de "alta calidad", más lentos, suelen sonar bastante más limpios.
  4. Inicia el trabajo y espera. La mayoría de canciones terminan en pocos minutos.
  5. Descarga en WAV si tienes la opción, para que los stems no se compriman por segunda vez.

Comprueba el resultado con el oído

Ponte los auriculares y escucha cada stem por separado. Escucha una estrofa y un estribillo, porque los estribillos son más densos y revelan antes los problemas. Estás comprobando tres cosas: voces fantasma tenues en el instrumental, textura borrosa o acuosa en los platillos y terminaciones de palabras cortadas en el stem vocal.

Para una prueba más exigente, carga el original y el instrumental en cualquier editor de audio, invierte la polaridad del instrumental y reprodúcelos juntos. Lo que oyes es, más o menos, la voz más los errores del modelo. Si se oyen batería o acordes, el modelo los sacó por error del instrumental.

💡 Consejo: juzga los stems al volumen al que los vas a usar de verdad. Una voz fantasma que desaparece a volumen de fiesta puede resultar obvia en una habitación tranquila con auriculares.

Por qué algunas canciones se separan mal

Reverb, armonías y mezclas en mono

Vista de cerca de una vieja grabadora de cinta de carrete abierto con cinta magnética marrón

Algunas canciones se resisten, y rara vez es culpa de la herramienta. Los sospechosos habituales:

  • Reverb intensa. La cola de eco de una voz se extiende por el campo estéreo y a menudo se queda en el instrumental como un coro tenue y fantasmal.
  • Armonías apiladas. Las voces de acompañamiento pueden acabar en el instrumental mientras la voz principal va al archivo vocal, o al revés.
  • Voces distorsionadas. El canto gritado o muy saturado comparte mucho espacio de frecuencias con las guitarras.
  • Grabaciones antiguas en mono. Los trucos de fase necesitan una imagen estéreo, así que fallan por completo en cintas mono. Los modelos de IA siguen funcionando, pero el origen suele tener siseo y ancho de banda limitado, lo que reduce el techo de calidad.
  • Fragmentos de voz muestreados. Una voz troceada y usada como un instrumento es difícil de clasificar como una cosa u otra.

Cómo corregir los artefactos

No tienes por qué aceptar el primer resultado. Relaciona el síntoma con una solución:

Lo que oyesCausa probableQué probar
Canto tenue en el instrumentalCola de reverb o voces de acompañamientoPasa el instrumental por el separador una segunda vez
Platillos acuosos o con remolinosEl modelo tiene dificultades con el detalle rápido de agudosCambia a un modelo de mayor calidad o a otra herramienta
La voz suena fina o robóticaArchivo de origen de baja tasa de bitsEmpieza de nuevo con un WAV, FLAC o MP3 de 256 kbps
Batería filtrada en la vozCaja o hi-hat compartiendo frecuencias con la vozUsa una separación de cuatro stems y descarta el stem de batería
Palabras cortadas al finalEl modelo confunde los fundidos con ruidoPrueba otro modelo o mezcla un poco del original

Dos soluciones más están en tu editor de audio. Una puerta de ruido o bajadas manuales de volumen en el instrumental elimina las voces fantasma entre frases, cuando no hay nada más sonando que las tape. Un corte suave de EQ en el medio-agudo, más o menos donde se sitúa una voz, puede esconder restos sin estropear la música.

Para una fiesta, nadie oye un fantasma tenue. Para una publicación, rehaz a mano la sección débil o reemplaza la pista por completo, algo que vuelve a aparecer más abajo.

Usos reales para las voces aisladas

Karaoke sin buscar pistas

Mujer con chaqueta vaquera cantando en un micrófono en una noche de karaoke en un pequeño bar

Para la mayoría de canciones, sobre todo las nuevas o de nicho, no existen versiones oficiales de karaoke. Una separación de dos stems te da un instrumental en minutos. Cárgalo en cualquier reproductor, pon la letra en una segunda pantalla y tendrás tu propia noche de karaoke.

Si el rango original te queda demasiado alto o bajo, la mayoría de reproductores pueden cambiar el tono unos semitonos sin alterar la velocidad. Baja al cantante dos o tres pasos y una canción que parecía inalcanzable se vuelve cómoda.

Acapellas para DJs y remezcladores

Primer plano de las manos de un DJ colocando un disco de vinilo en un tocadiscos

Una voz aislada es la materia prima de un remix. Colócala sobre un beat nuevo, estira el tempo para que encaje y trocea las frases para crear un gancho. Las separaciones de cuatro stems ayudan aquí: el stem de batería te permite reconstruir el groove, y quitar el stem de bajo te deja sustituir un registro grave que choque con tu nueva pista.

Unos hábitos hacen que las acapellas funcionen bien. Ajusta primero el tempo y luego revisa el tono frente a tu nueva pista para que no compitan. Añade un poco de reverb encima en lugar de confiar en lo que dejó el separador. Si piensas publicar el resultado, lee antes la sección de derechos de más abajo.

Practicar junto a la banda

Guitarrista adolescente tocando una guitarra acústica en una cama mientras un teléfono reproduce una pista de acompañamiento

Los músicos usan la separación como sala de ensayo. Un bajista silencia el stem de bajo y toca la línea en directo. Un guitarrista usa una separación de seis stems para silenciar la guitarra. Un cantante que ensaya armonías puede bajar la voz principal y escuchar las voces de acompañamiento por separado. Reproduce a media velocidad y los stems suelen seguir siendo lo bastante limpios como para seguir un pasaje complicado.

Las mismas herramientas funcionan con audio hablado. Los podcasters y los editores de video las usan para extraer la música de fondo de una grabación de voz, o para conservar la música y eliminar el diálogo para otra edición.

Qué hacer con tus stems

Una vez que tienes una voz o un instrumental limpios, se convierten en material de partida para otros proyectos. PicassoIA tiene modelos de transcripción, generación de video y música, y tres tareas muestran cómo encajan las piezas.

Extrae la letra del stem vocal

Una voz sin la banda es mucho más fácil de entender para un modelo de voz. Sube el stem vocal a GPT 4o Transcribe e indica el idioma con su código de dos letras, como en, para mejorar la precisión y la velocidad. El modelo acepta archivos MP3, WAV, M4A, OGG y WebM. Gemini 3 Pro es una segunda opción si la primera transcripción tiene problemas con una estrofa rápida.

El canto es más difícil que el habla, así que revisa el resultado contrastándolo con la canción. Aun así, corregir un borrador lleva bastante menos tiempo que escribir cada línea de oído.

Convierte la voz en un video con letra

Creadora de video en su oficina en casa editando un clip con auriculares y un micrófono de jirafa

Audio To Video toma un archivo de audio y una imagen o un prompt de texto, y genera un video corto cuyas imágenes responden al sonido. Un stem vocal es una buena entrada, porque el movimiento sigue el canto en lugar de la batería.

Cómo usarlo en PicassoIA:

  1. Abre la página del modelo y sube el stem vocal (WAV, MP3, FLAC, OGG o M4A).
  2. Añade una imagen que sirva como primer fotograma, o describe la escena en el prompt si no tienes ninguna. Si añades ambas cosas, el prompt describe cómo debe moverse la imagen.
  3. Ajusta el guidance scale. Los valores más altos siguen tu prompt con más fidelidad, pero pueden reducir la calidad, así que súbelo en pasos pequeños.
  4. Genera, revisa el clip y ajusta el prompt hasta que el movimiento encaje con el ambiente.
  5. Une los clips en tu editor de video y añade la letra transcrita como subtítulos.

El modelo crea clips cortos, así que trabaja una estrofa o un estribillo cada vez.

Crea una pista de acompañamiento nueva

Si tu instrumental tiene fantasmas que no puedes corregir, o no puedes publicar el original, genera uno nuevo. Describe el tempo, el ambiente y los instrumentos de la canción que estás sustituyendo, y deja que un modelo de texto a música componga algo nuevo:

Escribe los prompts como si le dieras instrucciones a una banda de sesión: "pop indie de tempo medio, 100 BPM, guitarra eléctrica limpia, batería con escobillas suaves, bajo cálido y mucho espacio para una voz principal femenina." Genera varias versiones y elige la que mejor encaje bajo tu voz.

Separar un archivo no cambia quién es su dueño. En muchos lugares, crear una pista de karaoke privada o un bucle de práctica para uso propio se mueve en una zona gris que los titulares de derechos rara vez persiguen. Publicar, emitir en streaming o vender algo construido a partir de una grabación comercial es distinto: necesita permiso o una licencia de quien posee la canción. Esto se aplica a la voz, al instrumental y a cualquier remix de ambos. Esto no es asesoramiento legal, y las normas varían según el país.

Las vías seguras son sencillas. Separa tus propias grabaciones, pistas que tengas licencia para remezclar y música publicada con stems expresamente para remezclar.

Pruébalo en PicassoIA

Separar es la parte fácil. La diversión empieza cuando construyes sobre ello. Escribe un instrumental nuevo con un modelo de texto a música, diseña la portada del álbum con Seedream 4.5 o convierte un estribillo en un clip corto con Audio To Video. Abre PicassoIA, escribe un prompt y mira lo que puede dar de sí una tarde de experimentos.

Elige una canción que te guste, sepárala y crea algo nuevo con las piezas. Tu próxima pista, portada o video empieza con un solo prompt.

Compartir este artículo

Elige tu idioma