23:59:59

2 Monate gratis

Ratgeber

Hintergrundmusik aus einer Sprachaufnahme entfernen: erst die Stimme zurückholen, dann polieren (2026)

Eine Sprachnotiz aus dem Café, eine gefilmte Rede mit laufender Musik, ein Podcast-Take, unter dem ein Song durchsickert: Die Musik lässt sich herausnehmen. Wie KI-Trennung eine Aufnahme in Stimme und Musik aufteilt, was sie reparieren kann und was nicht, und wie du die gesäuberte Stimme mit einem kostenlosen Zehnband-Equalizer fertig machst.

Suno AI Music
Redaktion10 Min. Lesezeit
Alle Artikel

Kurz gesagt

Läuft hinter einer Stimme Musik —ein Lautsprecher im Café, ein Song unter einem Handyvideo, ein Track, der während eines Podcast-Takes weiterlief—, brauchst du die Originalsession nicht, um die Stimme zurückzubekommen. Lad die Datei in den Hintergrundmusik-Entferner (dieselbe Engine steckt hinter dem Voice Cleaner und dem Vocal Remover), und die KI-Trennung liefert zwei Spuren: die Stimme allein und die Musik allein. Sie nimmt MP3, WAV, M4A oder das Audio in einer MP4, bis 10 MB; eine Trennung kostet 10 Credits und ist meist in ein bis drei Minuten fertig. Dann lädst du die Stimme in den kostenlosen Equalizer, wählst das Preset Podcast oder Stimme und exportierst eine MP3 oder WAV. Eine ehrliche Grenze: Die Trennung entfernt Musik. Sie ist keine Rauschunterdrückung für Rauschen, Wind oder Verkehr.

In diesem Ratgeber

Was Trennung kann und was nicht

Ältere Tricks zur «Stimmisolation» arbeiteten mit Phasenauslöschung: Sie zogen den linken Kanal vom rechten ab und hofften, dass die Stimme in der Mitte lag. Das zerstörte die Stimme genauso oft, wie es die Musik entfernte. Moderne Trennung ist anders. Ein neuronales Netz, trainiert mit Tausenden isolierter Vocals und Instrumentals, hört den ganzen Mix und baut zwei neue Dateien auf: eine nur mit der Stimme, eine mit allem anderen. Weil es modelliert, wie eine Stimme klingt, statt darauf zu schauen, wo sie im Stereobild sitzt, funktioniert es auch bei Mono-Handyaufnahmen.

Worin sie gut ist:

  • Musik unter Sprache. Ein Song im Hintergrund eines Vlogs, ein Café-Lautsprecher unter einer Sprachnotiz, ein DJ-Set, das in ein Interview blutet.
  • Gesang über einem Begleittrack. Ein Probenvideo, aus dem du nur den Sänger willst.
  • Beide Hälften behalten. Du bekommst die Musik auch als eigene Spur, praktisch, wenn du sie gegen etwas austauschen willst, an dem du die Rechte hast.

Was sie nicht ist:

  • Eine Rauschunterdrückung. Rauschen, Brummen, Wind, Verkehr und Raumhall sind keine Musik, und das Modell versucht nicht, sie zu entfernen. Genau deshalb sagt die Seite des Voice Cleaners das klar.
  • Zauberei bei einer vergrabenen Stimme. Ist die Musik viel lauter als der Sprecher, ist die getrennte Stimme brauchbar, aber dünner. Je lauter die Stimme im Original war, desto sauberer das Ergebnis.

Bevor du anfängst

  • Format und Größe. MP3, WAV, M4A oder ein MP4-Video (das Audio wird daraus genommen), bis 10 MB. Eine 10-MB-MP3 mit 128 kbps sind rund zehn Minuten; ist deine Datei größer, schneid vorher den Teil heraus, den du brauchst.
  • Ein Konto und Credits. Die Trennung läuft auf unseren Servern, du musst also angemeldet sein. Jeder Lauf kostet 10 Credits; neue Konten starten mit 16 Gratis-Credits, das reicht für eine Trennung. Weitere Credits gibt es mit jedem Tarif oder Credit-Paket.
  • Deine Datei wird nicht behalten. Die hochgeladene Datei wird für diese eine Trennung genutzt und gelöscht, wenn der Job fertig ist.
  • Rechte. Eine Aufnahme zu trennen ändert nichts daran, wem sie gehört. Stems aus deinen eigenen Aufnahmen gehören dir; Stems aus dem kommerziellen Song eines anderen sind für den privaten Gebrauch.

Schritt 1 Stimme und Musik trennen

  1. Öffne den Hintergrundmusik-Entferner. Er öffnet auf Datei hochladen; der andere Tab, Aus meiner Bibliothek, ist für Songs, die du auf der Seite generiert hast.
  2. Klick auf das gestrichelte Feld und wähl deine Aufnahme. Der Dateiname erscheint im Feld.

Das Formular des KI-Vocal-Removers auf der Seite des Hintergrundmusik-Entferners mit ausgewähltem Tab Datei hochladen, einer Aufnahme namens take-1.mp3 im gestrichelten Upload-Feld, den Grenzen MP3, WAV, M4A oder das Audio in einer MP4 bis 10 MB und darunter dem Button Gesang entfernen (10 Credits)

  1. Drück Gesang entfernen (10 Credits). Bist du nicht angemeldet, öffnet sich zuerst ein Anmeldefenster; berechnet wird erst, wenn der Job wirklich startet.
  2. Der Job läuft im Hintergrund —je nach Länge meist ein bis drei Minuten—, und du kannst die Seite verlassen. Er erscheint in der Aufgabenliste rechts.
  3. Wenn er fertig ist, hast du zwei Dateien: die isolierte Stimme (die A-cappella) und die Musik ohne Stimme (das Instrumental). Hör dir beide an und lad die Stimme herunter.

Auf dem Button steht «Gesang entfernen», weil dasselbe Tool auch andersherum genutzt wird: um den Sänger für Karaoke aus einem Song zu nehmen. Bei einer Sprachaufnahme ist die Datei, die du willst, die Stimmspur. Schlägt eine Trennung fehl, werden die Credits automatisch erstattet.

Schritt 2 Die Stimme mit einem Equalizer polieren

Eine getrennte Stimme ist oft etwas dumpf oder dröhnend: Das Modell hat die Musik entfernt, aber jedes tieffrequente Rumpeln behalten, das das Mikrofon aufgenommen hat. Zwei Minuten mit einem Equalizer beheben das meiste.

  1. Öffne den Equalizer und klick auf Audiodatei wählen, um die getrennte Stimme zu laden.
  2. Wähl ein Preset. Für Sprache fang mit Podcast an: Es senkt die tiefsten Bänder deutlich ab (−8 dB bei 31 Hz, −6 bei 62 Hz), lässt die Mitte in Ruhe und hebt den Präsenzbereich um 1–2 kHz um 3 dB an, wo Konsonanten und Verständlichkeit sitzen.
  3. Drück Abspielen und hör zu, während du einzelne Regler nachjustierst. Jedes der zehn Bänder —31, 62, 125, 250, 500 Hz und 1, 2, 4, 8, 16 kHz— bewegt sich um ±12 dB, und du hörst die Änderung beim Ziehen.
  4. Exportier mit MP3 herunterladen oder WAV herunterladen. Der Export läuft durch dieselbe Filterkette wie die Vorschau, die Datei klingt also genau wie das, was du gehört hast.

Der Zehnband-Equalizer mit geladener Datei und angewendetem Preset Podcast: Die Regler stehen von 31 Hz bis 16 kHz auf −8, −6, −2, +1, +2, +3, +3, +2, 0 und −2, die Vorschau läuft, und die Buttons MP3 herunterladen und WAV herunterladen sitzen neben Zurücksetzen

Als wir unsere Testdatei als WAV exportiert haben, kam eine vollständige, 41 MB große Datei mit dem Suffix -eq im Namen heraus, bereit für einen Editor. Der Equalizer lädt nie etwas hoch —die Datei wird in deinem Browser verarbeitet— und ist kostenlos, ohne Konto.

Welches Preset für welche Aufnahme

Die fünf Presets sind Startpunkte, keine Urteile:

AufnahmeFang an mitDann probier
Gesprochene Sprachnotiz, Interview, PodcastPodcast16 kHz weiter absenken, wenn es rauscht
Gesang, Rap, Voice-over, das später Musik bekommtStimme+1 oder +2 bei 4 kHz für mehr Luft
Stimme, die dumpf oder weit weg klingtBrillant250 Hz um 2–3 dB absenken, um den Kistenklang zu entfernen
Dünne HandyaufnahmeLinear, dann +2 bei 125–250 Hz31–62 Hz abgesenkt lassen gegen Rumpeln
Alles, was du überbearbeitet hastZurücksetzenBei Linear neu anfangen

Eine Regel hilft mehr als jedes Preset: erst absenken, dann anheben. Jedes Band anzuheben heißt nur, die ganze Datei lauter zu drehen, bis sie übersteuert. Wegzunehmen, was stört —das Rumpeln unten, den Kistenklang um 250–500 Hz—, bringt der Verständlichkeit meist mehr, als Höhen hinzuzufügen.

Fehlerbehebung

«Diese Datei ist größer als 10 MB.» Schneid den Teil heraus, den du brauchst, oder exportier mit niedrigerer Bitrate. Eine MP3 mit 96 kbps reicht für Sprache und fasst in 10 MB etwa 14 Minuten.

Die Stimme hat wässrige, wirbelnde Artefakte. Das passiert dort, wo Musik und Stimme auf denselben Frequenzen bei ähnlicher Lautstärke konkurrierten. Trenn eine Kopie, die nur bei der Sprache anfängt und endet, damit das Modell insgesamt weniger Musik hört. Eine sanfte Absenkung um 4–8 kHz im Equalizer mildert die Artefakte ebenfalls.

Die Musik ist weg, aber es rauscht oder der Verkehr ist noch da. Trennung entfernt Musik, kein Rauschen. Nimm den Equalizer, um die Extreme zu beschneiden (Tiefensperre gegen Rumpeln, eine kleine Absenkung bei 8–16 kHz gegen Rauschen), und für ernsthaftes Rauschen ein eigenes Rauschunterdrückungs-Tool.

Der Equalizer sagt, die Datei ließ sich nicht dekodieren. Nimm MP3, WAV oder M4A. Manche ungewöhnliche Codecs in Videodateien kann der Browser nicht dekodieren; wandle vorher in MP3 um.

Der Export ist fehlgeschlagen. Sehr lange Dateien können den Browserspeicher ausschöpfen. Teil die Aufnahme in kürzere Stücke und exportier jedes einzeln.

Echte Situationen, die das löst

  • Die Sprachnotiz aus dem Café. Du hast eine Songidee aufs Handy gesungen, und der Café-Lautsprecher spielte einen Popsong. Trenn sie, behalt die Stimme und nimm sie als Guide-Vocal.
  • Das Redevideo. Ein Hochzeitstoast, gefilmt, während die Band spielte. Die getrennte Stimme, durch das Podcast-Preset geschickt, ist klar genug für ein Highlight-Video.
  • Der Podcast-Take mit Musik im Hintergrund. Jemand hat während eines Interviews eine Playlist laufen lassen. Die Trennung rettet den Take ohne Neuaufnahme.
  • Urheberrechtlich geschützte Musik aus einem Vlog tauschen. Trennen, Stimme behalten und einen Track darunterlegen, der dir gehört, zum Beispiel einen, den du selbst im KI-Musikgenerator erzeugst. Unser Ratgeber KI-Musik für YouTube behandelt, was Plattformen markieren.
  • Über einem Karaoke-Track singen. Behalt die Stimme für ein Cover oder das Instrumental zum Üben. Wenn Karaoke das Ziel ist, geht der Ratgeber zur Karaoke-Version diesen Weg.

Häufige Fragen

Ist das Entfernen von Hintergrundmusik aus einer Sprachaufnahme kostenlos?

Der Equalizer-Schritt ist kostenlos, ohne Konto. Der Trennschritt nutzt KI auf unseren Servern und kostet 10 Credits pro Lauf; neue Konten bekommen 16 Gratis-Credits, genug für eine Trennung.

Welche Dateien kann ich hochladen?

MP3, WAV, M4A oder ein MP4-Video (die Tonspur wird genutzt), bis 10 MB pro Datei.

Bekomme ich die Musik auch zurück?

Ja. Jede Trennung liefert zwei Dateien: die isolierte Stimme und die Musik ohne Stimme. Beide lassen sich aus der Aufgabenliste abspielen und herunterladen.

Entfernt sie Wind, Rauschen oder Verkehrsgeräusche?

Nein. Die Trennung ist dafür gebaut, Stimme und Musik zu teilen. Sie zielt nicht auf Rauschen, und die Seite des Voice Cleaners sagt das. Ein Equalizer kann Rauschen und Rumpeln mildern; starkes Rauschen braucht ein Rauschunterdrückungs-Tool.

Wie lange dauert es?

Die meisten Aufnahmen sind in ein bis drei Minuten fertig, je nach Länge. Der Job läuft im Hintergrund, du kannst also die Seite verlassen und zurückkommen.

Wird meine Aufnahme gespeichert?

Die hochgeladene Datei wird nur für diese Trennung genutzt und gelöscht, wenn der Job fertig ist. Der Equalizer lädt überhaupt nichts hoch.

Darf ich die gesäuberte Stimme kommerziell nutzen?

Wenn es deine eigene Aufnahme ist, ja. Eine Aufnahme zu trennen ändert nichts an den Eigentumsrechten, Stems aus dem kommerziellen Song eines anderen bleiben also für den privaten Gebrauch.

Fazit

Eine gute Sprachaufnahme, die durch Hintergrundmusik ruiniert ist, gehört zu den am besten reparierbaren Problemen im Audiobereich. Trenn sie mit dem Hintergrundmusik-Entferner, damit du Stimme und Musik als zwei Dateien hast, verbring dann zwei Minuten im Equalizer mit dem Preset Podcast oder Stimme und exportier. Bleib bei den Erwartungen ehrlich —sie nimmt Musik heraus, keinen Wind und kein Rauschen—, und die meisten Café-Notizen, gefilmten Reden und unterbrochenen Podcast-Takes werden wieder brauchbar.