En resumen
Si suena música detrás de una voz —un altavoz en una cafetería, una canción bajo un video del móvil, un tema que se quedó puesto durante una toma de pódcast—, no necesitas la sesión original para recuperar la voz. Sube el archivo al eliminador de música de fondo (el mismo motor está detrás del limpiador de voz y del eliminador de voces) y la separación con IA te devuelve dos pistas: la voz sola y la música sola. Acepta MP3, WAV, M4A o el audio de un MP4, hasta 10 MB; una separación cuesta 10 créditos y suele terminar en uno a tres minutos. Después carga la voz en el ecualizador gratis, aplica el preset Pódcast o Voz y exporta un MP3 o un WAV. Un límite, con honestidad: la separación quita música. No es un reductor de ruido para siseo, viento o tráfico.
En esta guía
- Lo que la separación puede y no puede hacer
- Antes de empezar
- Paso 1 Separa la voz de la música
- Paso 2 Pule la voz con un ecualizador
- Qué preset para qué grabación
- Solución de problemas
- Situaciones reales que arregla
- Preguntas frecuentes
- Conclusión
Lo que la separación puede y no puede hacer
Los viejos trucos de «aislar la voz» funcionaban por cancelación de fase: restaban el canal izquierdo del derecho y esperaban que la voz estuviera en el centro. Destruían la voz tantas veces como quitaban la música. La separación moderna es distinta. Una red neuronal entrenada con miles de voces e instrumentales aislados escucha la mezcla entera y reconstruye dos archivos nuevos: uno con solo la voz y otro con todo lo demás. Como modela cómo suena una voz en lugar de dónde está en el campo estéreo, también funciona con grabaciones mono de móvil.
En lo que es buena:
- Música bajo una voz hablada. Una canción de fondo en un vlog, el altavoz de una cafetería bajo una nota de voz, una sesión de DJ que se cuela en una entrevista.
- Canto sobre una pista de acompañamiento. Un video de ensayo del que quieres la voz sola.
- Quedarte con las dos mitades. También recibes la música como pista propia, útil si quieres cambiarla por algo sobre lo que tienes derechos.
Lo que no es:
- Un reductor de ruido. El siseo, el zumbido, el viento, el tráfico y el eco de la sala no son música, y el modelo no intenta quitarlos. Por eso la página del limpiador de voz lo dice claramente.
- Magia para una voz enterrada. Si la música está mucho más fuerte que quien habla, la voz separada será utilizable pero más delgada. Cuanto más fuerte estaba la voz en el original, más limpio el resultado.
Antes de empezar
- Formato y tamaño. MP3, WAV, M4A o un video MP4 (se toma su audio), hasta 10 MB. Un MP3 de 10 MB a 128 kbps son unos diez minutos; si tu archivo es más grande, recorta antes la parte que necesitas.
- Una cuenta y créditos. La separación se ejecuta en nuestros servidores, así que necesita que inicies sesión. Cada ejecución cuesta 10 créditos; las cuentas nuevas empiezan con 16 créditos gratis, que cubren una separación. Hay más créditos con cualquier plan o paquete de créditos.
- Tu archivo no se guarda. El archivo subido se usa para esa separación y se borra cuando termina el trabajo.
- Derechos. Separar una grabación no cambia de quién es. Las pistas de tus propias grabaciones son tuyas; las sacadas de una canción comercial ajena son para uso privado.
Paso 1 Separa la voz de la música
- Abre el eliminador de música de fondo. Se abre en Subir un archivo; la otra pestaña, De mi biblioteca, es para canciones que generaste en la web.
- Haz clic en el recuadro punteado y elige tu grabación. El nombre del archivo aparece en el recuadro.

- Pulsa Quitar las voces (10 créditos). Si no has iniciado sesión, primero se abre una ventana de acceso; no se cobra nada hasta que el trabajo empieza de verdad.
- El trabajo se ejecuta en segundo plano —normalmente de uno a tres minutos según la duración— y puedes salir de la página. Aparece en la lista de tareas de la derecha.
- Al terminar tienes dos archivos: la voz aislada (la a capela) y la música sin la voz (la instrumental). Escucha los dos y descarga la voz.
El botón dice «Quitar las voces» porque la misma herramienta se usa también al revés: para quitar al cantante de una canción y hacer karaoke. Para una grabación de voz, el archivo que quieres es el de la voz. Si una separación falla, los créditos se devuelven automáticamente.
Paso 2 Pule la voz con un ecualizador
Una voz separada suele quedar algo apagada o retumbante: el modelo ha quitado la música pero ha conservado cada rumor grave que captó el micrófono. Dos minutos con un ecualizador arreglan casi todo.
- Abre el ecualizador y haz clic en Elige un archivo de audio para cargar la voz separada.
- Elige un preset. Para voz hablada, empieza por Pódcast: recorta fuerte las bandas más graves (−8 dB a 31 Hz, −6 a 62 Hz), deja el medio tranquilo y sube 3 dB la zona de presencia en torno a 1–2 kHz, que es donde viven las consonantes y la claridad.
- Pulsa Reproducir y escucha mientras retocas deslizadores sueltos. Cada una de las diez bandas —31, 62, 125, 250 y 500 Hz y 1, 2, 4, 8 y 16 kHz— se mueve ±12 dB, y oyes el cambio mientras arrastras.
- Exporta con Descargar MP3 o Descargar WAV. La exportación pasa por la misma cadena de filtros que la escucha previa, así que el archivo suena exactamente como lo que has oído.

Cuando exportamos nuestro archivo de prueba como WAV, salió un archivo de duración completa, de 41 MB y con el sufijo -eq en el nombre, listo para un editor. El ecualizador nunca sube nada —el archivo se procesa en tu navegador— y es gratis y sin cuenta.
Qué preset para qué grabación
Los cinco presets son puntos de partida, no veredictos:
| Grabación | Empieza con | Luego prueba |
|---|---|---|
| Nota de voz hablada, entrevista, pódcast | Pódcast | Baja más los 16 kHz si hay siseo |
| Canto, rap, locución que llevará música después | Voz | Añade +1 o +2 a 4 kHz para más aire |
| Voz que suena apagada o lejana | Brillante | Recorta 250 Hz 2–3 dB para quitar sonido a caja |
| Grabación de móvil delgada | Plano, luego +2 a 125–250 Hz | Mantén recortados 31–62 Hz para evitar retumbe |
| Cualquier cosa que hayas procesado de más | Reiniciar | Vuelve a empezar desde Plano |
Una regla ayuda más que cualquier preset: recorta antes de realzar. Subir todas las bandas es solo subir el archivo entero hasta que satura. Quitar lo que estorba —el retumbe de abajo, el sonido a caja entre 250 y 500 Hz— suele hacer más por la claridad que añadir agudos.
Solución de problemas
«Ese archivo supera los 10 MB». Recorta la parte que necesitas o expórtala a menor bitrate. Un MP3 de 96 kbps está bien para voz y cabe en unos 14 minutos en 10 MB.
La voz tiene artefactos acuosos y arremolinados. Ocurre donde la música y la voz competían en las mismas frecuencias y con un volumen parecido. Prueba a separar una copia que empiece y acabe solo en la voz, para que el modelo oiga menos música en total. Un recorte suave hacia 4–8 kHz en el ecualizador también suaviza los artefactos.
La música se ha ido pero sigue habiendo siseo o tráfico. La separación quita música, no ruido. Usa el ecualizador para recortar los extremos (corte de graves para el retumbe, un pequeño recorte a 8–16 kHz para el siseo), y para ruido serio usa una herramienta de reducción de ruido específica.
El ecualizador dice que no pudo decodificar el archivo. Usa MP3, WAV o M4A. Algunos códecs poco habituales dentro de archivos de video no los puede decodificar el navegador; convierte antes a MP3.
La exportación falló. Los archivos muy largos pueden agotar la memoria del navegador. Divide la grabación en partes más cortas y exporta cada una.
Situaciones reales que arregla
- La nota de voz de la cafetería. Grabaste una idea para una canción con el móvil y el altavoz de la cafetería estaba poniendo un tema pop. Sepárala, quédate con la voz y úsala como voz guía.
- El video del discurso. Un brindis de boda filmado mientras tocaba la banda. La voz separada, pasada por el preset Pódcast, queda lo bastante clara para un video resumen.
- La toma de pódcast con música colándose. Alguien dejó una playlist sonando durante una entrevista. La separación rescata la toma sin volver a grabar.
- Cambiar la música con derechos de un vlog. Separa, quédate con la voz y pon debajo un tema que sea tuyo; por ejemplo, uno que generes tú en el generador de música con IA. Nuestra guía sobre música con IA para YouTube cubre lo que marcan las plataformas.
- Cantar sobre una pista de karaoke. Quédate con la voz para una versión, o con la instrumental para practicar. Si el objetivo es el karaoke, la guía de la versión karaoke recorre esa dirección.
Preguntas frecuentes
¿Quitar la música de fondo de una grabación de voz es gratis?
El paso del ecualizador es gratis y sin cuenta. El paso de la separación usa IA en nuestros servidores y cuesta 10 créditos por ejecución; las cuentas nuevas reciben 16 créditos gratis, suficientes para una separación.
¿Qué archivos puedo subir?
MP3, WAV, M4A o un video MP4 (se usa la pista de audio), hasta 10 MB por archivo.
¿También recupero la música?
Sí. Cada separación devuelve dos archivos: la voz aislada y la música sin la voz. Los dos se pueden escuchar y descargar desde la lista de tareas.
¿Quita el viento, el siseo o el ruido del tráfico?
No. La separación está hecha para dividir voz y música. No va a por el ruido, y la página del limpiador de voz lo dice. Un ecualizador puede suavizar el siseo y el retumbe; el ruido fuerte necesita una herramienta de reducción de ruido.
¿Cuánto tarda?
La mayoría de las grabaciones terminan en uno a tres minutos, según la duración. El trabajo se ejecuta en segundo plano, así que puedes salir de la página y volver.
¿Se guarda mi grabación?
El archivo subido se usa solo para esa separación y se borra cuando termina el trabajo. El ecualizador no sube absolutamente nada.
¿Puedo usar comercialmente la voz limpia?
Si es tu propia grabación, sí. Separar una grabación no cambia su propiedad, así que las pistas sacadas de una canción comercial ajena siguen siendo para uso privado.
Conclusión
Una buena grabación de voz estropeada por música de fondo es uno de los problemas más arreglables del audio. Sepárala con el eliminador de música de fondo para tener la voz y la música en dos archivos, dedica luego dos minutos al ecualizador con el preset Pódcast o Voz y exporta. Mantén las expectativas honestas —retira música, no viento ni siseo— y la mayoría de las notas de cafetería, discursos filmados y tomas de pódcast interrumpidas vuelven a ser utilizables.
