23:59:59

2 meses gratis

Guía

Cómo quitar la música de fondo de una grabación de voz: recupera la voz y luego púlela (2026)

Una nota de voz grabada en una cafetería, un discurso filmado con música sonando, una toma de pódcast con una canción colándose por debajo: la música se puede retirar. Cómo la separación con IA divide una grabación en voz y música, qué puede y qué no puede arreglar, y cómo terminar la voz limpia con un ecualizador gratis de diez bandas.

Suno AI Music
Equipo editorial11 min de lectura
Todos los artículos

En resumen

Si suena música detrás de una voz —un altavoz en una cafetería, una canción bajo un video del móvil, un tema que se quedó puesto durante una toma de pódcast—, no necesitas la sesión original para recuperar la voz. Sube el archivo al eliminador de música de fondo (el mismo motor está detrás del limpiador de voz y del eliminador de voces) y la separación con IA te devuelve dos pistas: la voz sola y la música sola. Acepta MP3, WAV, M4A o el audio de un MP4, hasta 10 MB; una separación cuesta 10 créditos y suele terminar en uno a tres minutos. Después carga la voz en el ecualizador gratis, aplica el preset Pódcast o Voz y exporta un MP3 o un WAV. Un límite, con honestidad: la separación quita música. No es un reductor de ruido para siseo, viento o tráfico.

En esta guía

Lo que la separación puede y no puede hacer

Los viejos trucos de «aislar la voz» funcionaban por cancelación de fase: restaban el canal izquierdo del derecho y esperaban que la voz estuviera en el centro. Destruían la voz tantas veces como quitaban la música. La separación moderna es distinta. Una red neuronal entrenada con miles de voces e instrumentales aislados escucha la mezcla entera y reconstruye dos archivos nuevos: uno con solo la voz y otro con todo lo demás. Como modela cómo suena una voz en lugar de dónde está en el campo estéreo, también funciona con grabaciones mono de móvil.

En lo que es buena:

  • Música bajo una voz hablada. Una canción de fondo en un vlog, el altavoz de una cafetería bajo una nota de voz, una sesión de DJ que se cuela en una entrevista.
  • Canto sobre una pista de acompañamiento. Un video de ensayo del que quieres la voz sola.
  • Quedarte con las dos mitades. También recibes la música como pista propia, útil si quieres cambiarla por algo sobre lo que tienes derechos.

Lo que no es:

  • Un reductor de ruido. El siseo, el zumbido, el viento, el tráfico y el eco de la sala no son música, y el modelo no intenta quitarlos. Por eso la página del limpiador de voz lo dice claramente.
  • Magia para una voz enterrada. Si la música está mucho más fuerte que quien habla, la voz separada será utilizable pero más delgada. Cuanto más fuerte estaba la voz en el original, más limpio el resultado.

Antes de empezar

  • Formato y tamaño. MP3, WAV, M4A o un video MP4 (se toma su audio), hasta 10 MB. Un MP3 de 10 MB a 128 kbps son unos diez minutos; si tu archivo es más grande, recorta antes la parte que necesitas.
  • Una cuenta y créditos. La separación se ejecuta en nuestros servidores, así que necesita que inicies sesión. Cada ejecución cuesta 10 créditos; las cuentas nuevas empiezan con 16 créditos gratis, que cubren una separación. Hay más créditos con cualquier plan o paquete de créditos.
  • Tu archivo no se guarda. El archivo subido se usa para esa separación y se borra cuando termina el trabajo.
  • Derechos. Separar una grabación no cambia de quién es. Las pistas de tus propias grabaciones son tuyas; las sacadas de una canción comercial ajena son para uso privado.

Paso 1 Separa la voz de la música

  1. Abre el eliminador de música de fondo. Se abre en Subir un archivo; la otra pestaña, De mi biblioteca, es para canciones que generaste en la web.
  2. Haz clic en el recuadro punteado y elige tu grabación. El nombre del archivo aparece en el recuadro.

El formulario del Eliminador de voces con IA en la página del eliminador de música de fondo, con la pestaña Subir un archivo seleccionada, una grabación llamada take-1.mp3 cargada en el recuadro punteado, los límites MP3, WAV, M4A o el audio de un MP4 hasta 10 MB y el botón Quitar las voces (10 créditos) debajo

  1. Pulsa Quitar las voces (10 créditos). Si no has iniciado sesión, primero se abre una ventana de acceso; no se cobra nada hasta que el trabajo empieza de verdad.
  2. El trabajo se ejecuta en segundo plano —normalmente de uno a tres minutos según la duración— y puedes salir de la página. Aparece en la lista de tareas de la derecha.
  3. Al terminar tienes dos archivos: la voz aislada (la a capela) y la música sin la voz (la instrumental). Escucha los dos y descarga la voz.

El botón dice «Quitar las voces» porque la misma herramienta se usa también al revés: para quitar al cantante de una canción y hacer karaoke. Para una grabación de voz, el archivo que quieres es el de la voz. Si una separación falla, los créditos se devuelven automáticamente.

Paso 2 Pule la voz con un ecualizador

Una voz separada suele quedar algo apagada o retumbante: el modelo ha quitado la música pero ha conservado cada rumor grave que captó el micrófono. Dos minutos con un ecualizador arreglan casi todo.

  1. Abre el ecualizador y haz clic en Elige un archivo de audio para cargar la voz separada.
  2. Elige un preset. Para voz hablada, empieza por Pódcast: recorta fuerte las bandas más graves (−8 dB a 31 Hz, −6 a 62 Hz), deja el medio tranquilo y sube 3 dB la zona de presencia en torno a 1–2 kHz, que es donde viven las consonantes y la claridad.
  3. Pulsa Reproducir y escucha mientras retocas deslizadores sueltos. Cada una de las diez bandas —31, 62, 125, 250 y 500 Hz y 1, 2, 4, 8 y 16 kHz— se mueve ±12 dB, y oyes el cambio mientras arrastras.
  4. Exporta con Descargar MP3 o Descargar WAV. La exportación pasa por la misma cadena de filtros que la escucha previa, así que el archivo suena exactamente como lo que has oído.

El ecualizador de diez bandas con un archivo cargado y el preset Pódcast aplicado: los deslizadores marcan −8, −6, −2, +1, +2, +3, +3, +2, 0 y −2 de 31 Hz a 16 kHz, la escucha está en marcha y los botones Descargar MP3 y Descargar WAV están junto a Reiniciar

Cuando exportamos nuestro archivo de prueba como WAV, salió un archivo de duración completa, de 41 MB y con el sufijo -eq en el nombre, listo para un editor. El ecualizador nunca sube nada —el archivo se procesa en tu navegador— y es gratis y sin cuenta.

Qué preset para qué grabación

Los cinco presets son puntos de partida, no veredictos:

GrabaciónEmpieza conLuego prueba
Nota de voz hablada, entrevista, pódcastPódcastBaja más los 16 kHz si hay siseo
Canto, rap, locución que llevará música despuésVozAñade +1 o +2 a 4 kHz para más aire
Voz que suena apagada o lejanaBrillanteRecorta 250 Hz 2–3 dB para quitar sonido a caja
Grabación de móvil delgadaPlano, luego +2 a 125–250 HzMantén recortados 31–62 Hz para evitar retumbe
Cualquier cosa que hayas procesado de másReiniciarVuelve a empezar desde Plano

Una regla ayuda más que cualquier preset: recorta antes de realzar. Subir todas las bandas es solo subir el archivo entero hasta que satura. Quitar lo que estorba —el retumbe de abajo, el sonido a caja entre 250 y 500 Hz— suele hacer más por la claridad que añadir agudos.

Solución de problemas

«Ese archivo supera los 10 MB». Recorta la parte que necesitas o expórtala a menor bitrate. Un MP3 de 96 kbps está bien para voz y cabe en unos 14 minutos en 10 MB.

La voz tiene artefactos acuosos y arremolinados. Ocurre donde la música y la voz competían en las mismas frecuencias y con un volumen parecido. Prueba a separar una copia que empiece y acabe solo en la voz, para que el modelo oiga menos música en total. Un recorte suave hacia 4–8 kHz en el ecualizador también suaviza los artefactos.

La música se ha ido pero sigue habiendo siseo o tráfico. La separación quita música, no ruido. Usa el ecualizador para recortar los extremos (corte de graves para el retumbe, un pequeño recorte a 8–16 kHz para el siseo), y para ruido serio usa una herramienta de reducción de ruido específica.

El ecualizador dice que no pudo decodificar el archivo. Usa MP3, WAV o M4A. Algunos códecs poco habituales dentro de archivos de video no los puede decodificar el navegador; convierte antes a MP3.

La exportación falló. Los archivos muy largos pueden agotar la memoria del navegador. Divide la grabación en partes más cortas y exporta cada una.

Situaciones reales que arregla

  • La nota de voz de la cafetería. Grabaste una idea para una canción con el móvil y el altavoz de la cafetería estaba poniendo un tema pop. Sepárala, quédate con la voz y úsala como voz guía.
  • El video del discurso. Un brindis de boda filmado mientras tocaba la banda. La voz separada, pasada por el preset Pódcast, queda lo bastante clara para un video resumen.
  • La toma de pódcast con música colándose. Alguien dejó una playlist sonando durante una entrevista. La separación rescata la toma sin volver a grabar.
  • Cambiar la música con derechos de un vlog. Separa, quédate con la voz y pon debajo un tema que sea tuyo; por ejemplo, uno que generes tú en el generador de música con IA. Nuestra guía sobre música con IA para YouTube cubre lo que marcan las plataformas.
  • Cantar sobre una pista de karaoke. Quédate con la voz para una versión, o con la instrumental para practicar. Si el objetivo es el karaoke, la guía de la versión karaoke recorre esa dirección.

Preguntas frecuentes

¿Quitar la música de fondo de una grabación de voz es gratis?

El paso del ecualizador es gratis y sin cuenta. El paso de la separación usa IA en nuestros servidores y cuesta 10 créditos por ejecución; las cuentas nuevas reciben 16 créditos gratis, suficientes para una separación.

¿Qué archivos puedo subir?

MP3, WAV, M4A o un video MP4 (se usa la pista de audio), hasta 10 MB por archivo.

¿También recupero la música?

Sí. Cada separación devuelve dos archivos: la voz aislada y la música sin la voz. Los dos se pueden escuchar y descargar desde la lista de tareas.

¿Quita el viento, el siseo o el ruido del tráfico?

No. La separación está hecha para dividir voz y música. No va a por el ruido, y la página del limpiador de voz lo dice. Un ecualizador puede suavizar el siseo y el retumbe; el ruido fuerte necesita una herramienta de reducción de ruido.

¿Cuánto tarda?

La mayoría de las grabaciones terminan en uno a tres minutos, según la duración. El trabajo se ejecuta en segundo plano, así que puedes salir de la página y volver.

¿Se guarda mi grabación?

El archivo subido se usa solo para esa separación y se borra cuando termina el trabajo. El ecualizador no sube absolutamente nada.

¿Puedo usar comercialmente la voz limpia?

Si es tu propia grabación, sí. Separar una grabación no cambia su propiedad, así que las pistas sacadas de una canción comercial ajena siguen siendo para uso privado.

Conclusión

Una buena grabación de voz estropeada por música de fondo es uno de los problemas más arreglables del audio. Sepárala con el eliminador de música de fondo para tener la voz y la música en dos archivos, dedica luego dos minutos al ecualizador con el preset Pódcast o Voz y exporta. Mantén las expectativas honestas —retira música, no viento ni siseo— y la mayoría de las notas de cafetería, discursos filmados y tomas de pódcast interrumpidas vuelven a ser utilizables.