Kurz gesagt
Läuft hinter einer Stimme Musik —ein Lautsprecher im Café, ein Song unter einem Handyvideo, ein Track, der während eines Podcast-Takes weiterlief—, brauchst du die Originalsession nicht, um die Stimme zurückzubekommen. Lad die Datei in den Hintergrundmusik-Entferner (dieselbe Engine steckt hinter dem Voice Cleaner und dem Vocal Remover), und die KI-Trennung liefert zwei Spuren: die Stimme allein und die Musik allein. Sie nimmt MP3, WAV, M4A oder das Audio in einer MP4, bis 10 MB; eine Trennung kostet 10 Credits und ist meist in ein bis drei Minuten fertig. Dann lädst du die Stimme in den kostenlosen Equalizer, wählst das Preset Podcast oder Stimme und exportierst eine MP3 oder WAV. Eine ehrliche Grenze: Die Trennung entfernt Musik. Sie ist keine Rauschunterdrückung für Rauschen, Wind oder Verkehr.
In diesem Ratgeber
- Was Trennung kann und was nicht
- Bevor du anfängst
- Schritt 1 Stimme und Musik trennen
- Schritt 2 Die Stimme mit einem Equalizer polieren
- Welches Preset für welche Aufnahme
- Fehlerbehebung
- Echte Situationen, die das löst
- Häufige Fragen
- Fazit
Was Trennung kann und was nicht
Ältere Tricks zur «Stimmisolation» arbeiteten mit Phasenauslöschung: Sie zogen den linken Kanal vom rechten ab und hofften, dass die Stimme in der Mitte lag. Das zerstörte die Stimme genauso oft, wie es die Musik entfernte. Moderne Trennung ist anders. Ein neuronales Netz, trainiert mit Tausenden isolierter Vocals und Instrumentals, hört den ganzen Mix und baut zwei neue Dateien auf: eine nur mit der Stimme, eine mit allem anderen. Weil es modelliert, wie eine Stimme klingt, statt darauf zu schauen, wo sie im Stereobild sitzt, funktioniert es auch bei Mono-Handyaufnahmen.
Worin sie gut ist:
- Musik unter Sprache. Ein Song im Hintergrund eines Vlogs, ein Café-Lautsprecher unter einer Sprachnotiz, ein DJ-Set, das in ein Interview blutet.
- Gesang über einem Begleittrack. Ein Probenvideo, aus dem du nur den Sänger willst.
- Beide Hälften behalten. Du bekommst die Musik auch als eigene Spur, praktisch, wenn du sie gegen etwas austauschen willst, an dem du die Rechte hast.
Was sie nicht ist:
- Eine Rauschunterdrückung. Rauschen, Brummen, Wind, Verkehr und Raumhall sind keine Musik, und das Modell versucht nicht, sie zu entfernen. Genau deshalb sagt die Seite des Voice Cleaners das klar.
- Zauberei bei einer vergrabenen Stimme. Ist die Musik viel lauter als der Sprecher, ist die getrennte Stimme brauchbar, aber dünner. Je lauter die Stimme im Original war, desto sauberer das Ergebnis.
Bevor du anfängst
- Format und Größe. MP3, WAV, M4A oder ein MP4-Video (das Audio wird daraus genommen), bis 10 MB. Eine 10-MB-MP3 mit 128 kbps sind rund zehn Minuten; ist deine Datei größer, schneid vorher den Teil heraus, den du brauchst.
- Ein Konto und Credits. Die Trennung läuft auf unseren Servern, du musst also angemeldet sein. Jeder Lauf kostet 10 Credits; neue Konten starten mit 16 Gratis-Credits, das reicht für eine Trennung. Weitere Credits gibt es mit jedem Tarif oder Credit-Paket.
- Deine Datei wird nicht behalten. Die hochgeladene Datei wird für diese eine Trennung genutzt und gelöscht, wenn der Job fertig ist.
- Rechte. Eine Aufnahme zu trennen ändert nichts daran, wem sie gehört. Stems aus deinen eigenen Aufnahmen gehören dir; Stems aus dem kommerziellen Song eines anderen sind für den privaten Gebrauch.
Schritt 1 Stimme und Musik trennen
- Öffne den Hintergrundmusik-Entferner. Er öffnet auf Datei hochladen; der andere Tab, Aus meiner Bibliothek, ist für Songs, die du auf der Seite generiert hast.
- Klick auf das gestrichelte Feld und wähl deine Aufnahme. Der Dateiname erscheint im Feld.

- Drück Gesang entfernen (10 Credits). Bist du nicht angemeldet, öffnet sich zuerst ein Anmeldefenster; berechnet wird erst, wenn der Job wirklich startet.
- Der Job läuft im Hintergrund —je nach Länge meist ein bis drei Minuten—, und du kannst die Seite verlassen. Er erscheint in der Aufgabenliste rechts.
- Wenn er fertig ist, hast du zwei Dateien: die isolierte Stimme (die A-cappella) und die Musik ohne Stimme (das Instrumental). Hör dir beide an und lad die Stimme herunter.
Auf dem Button steht «Gesang entfernen», weil dasselbe Tool auch andersherum genutzt wird: um den Sänger für Karaoke aus einem Song zu nehmen. Bei einer Sprachaufnahme ist die Datei, die du willst, die Stimmspur. Schlägt eine Trennung fehl, werden die Credits automatisch erstattet.
Schritt 2 Die Stimme mit einem Equalizer polieren
Eine getrennte Stimme ist oft etwas dumpf oder dröhnend: Das Modell hat die Musik entfernt, aber jedes tieffrequente Rumpeln behalten, das das Mikrofon aufgenommen hat. Zwei Minuten mit einem Equalizer beheben das meiste.
- Öffne den Equalizer und klick auf Audiodatei wählen, um die getrennte Stimme zu laden.
- Wähl ein Preset. Für Sprache fang mit Podcast an: Es senkt die tiefsten Bänder deutlich ab (−8 dB bei 31 Hz, −6 bei 62 Hz), lässt die Mitte in Ruhe und hebt den Präsenzbereich um 1–2 kHz um 3 dB an, wo Konsonanten und Verständlichkeit sitzen.
- Drück Abspielen und hör zu, während du einzelne Regler nachjustierst. Jedes der zehn Bänder —31, 62, 125, 250, 500 Hz und 1, 2, 4, 8, 16 kHz— bewegt sich um ±12 dB, und du hörst die Änderung beim Ziehen.
- Exportier mit MP3 herunterladen oder WAV herunterladen. Der Export läuft durch dieselbe Filterkette wie die Vorschau, die Datei klingt also genau wie das, was du gehört hast.

Als wir unsere Testdatei als WAV exportiert haben, kam eine vollständige, 41 MB große Datei mit dem Suffix -eq im Namen heraus, bereit für einen Editor. Der Equalizer lädt nie etwas hoch —die Datei wird in deinem Browser verarbeitet— und ist kostenlos, ohne Konto.
Welches Preset für welche Aufnahme
Die fünf Presets sind Startpunkte, keine Urteile:
| Aufnahme | Fang an mit | Dann probier |
|---|---|---|
| Gesprochene Sprachnotiz, Interview, Podcast | Podcast | 16 kHz weiter absenken, wenn es rauscht |
| Gesang, Rap, Voice-over, das später Musik bekommt | Stimme | +1 oder +2 bei 4 kHz für mehr Luft |
| Stimme, die dumpf oder weit weg klingt | Brillant | 250 Hz um 2–3 dB absenken, um den Kistenklang zu entfernen |
| Dünne Handyaufnahme | Linear, dann +2 bei 125–250 Hz | 31–62 Hz abgesenkt lassen gegen Rumpeln |
| Alles, was du überbearbeitet hast | Zurücksetzen | Bei Linear neu anfangen |
Eine Regel hilft mehr als jedes Preset: erst absenken, dann anheben. Jedes Band anzuheben heißt nur, die ganze Datei lauter zu drehen, bis sie übersteuert. Wegzunehmen, was stört —das Rumpeln unten, den Kistenklang um 250–500 Hz—, bringt der Verständlichkeit meist mehr, als Höhen hinzuzufügen.
Fehlerbehebung
«Diese Datei ist größer als 10 MB.» Schneid den Teil heraus, den du brauchst, oder exportier mit niedrigerer Bitrate. Eine MP3 mit 96 kbps reicht für Sprache und fasst in 10 MB etwa 14 Minuten.
Die Stimme hat wässrige, wirbelnde Artefakte. Das passiert dort, wo Musik und Stimme auf denselben Frequenzen bei ähnlicher Lautstärke konkurrierten. Trenn eine Kopie, die nur bei der Sprache anfängt und endet, damit das Modell insgesamt weniger Musik hört. Eine sanfte Absenkung um 4–8 kHz im Equalizer mildert die Artefakte ebenfalls.
Die Musik ist weg, aber es rauscht oder der Verkehr ist noch da. Trennung entfernt Musik, kein Rauschen. Nimm den Equalizer, um die Extreme zu beschneiden (Tiefensperre gegen Rumpeln, eine kleine Absenkung bei 8–16 kHz gegen Rauschen), und für ernsthaftes Rauschen ein eigenes Rauschunterdrückungs-Tool.
Der Equalizer sagt, die Datei ließ sich nicht dekodieren. Nimm MP3, WAV oder M4A. Manche ungewöhnliche Codecs in Videodateien kann der Browser nicht dekodieren; wandle vorher in MP3 um.
Der Export ist fehlgeschlagen. Sehr lange Dateien können den Browserspeicher ausschöpfen. Teil die Aufnahme in kürzere Stücke und exportier jedes einzeln.
Echte Situationen, die das löst
- Die Sprachnotiz aus dem Café. Du hast eine Songidee aufs Handy gesungen, und der Café-Lautsprecher spielte einen Popsong. Trenn sie, behalt die Stimme und nimm sie als Guide-Vocal.
- Das Redevideo. Ein Hochzeitstoast, gefilmt, während die Band spielte. Die getrennte Stimme, durch das Podcast-Preset geschickt, ist klar genug für ein Highlight-Video.
- Der Podcast-Take mit Musik im Hintergrund. Jemand hat während eines Interviews eine Playlist laufen lassen. Die Trennung rettet den Take ohne Neuaufnahme.
- Urheberrechtlich geschützte Musik aus einem Vlog tauschen. Trennen, Stimme behalten und einen Track darunterlegen, der dir gehört, zum Beispiel einen, den du selbst im KI-Musikgenerator erzeugst. Unser Ratgeber KI-Musik für YouTube behandelt, was Plattformen markieren.
- Über einem Karaoke-Track singen. Behalt die Stimme für ein Cover oder das Instrumental zum Üben. Wenn Karaoke das Ziel ist, geht der Ratgeber zur Karaoke-Version diesen Weg.
Häufige Fragen
Ist das Entfernen von Hintergrundmusik aus einer Sprachaufnahme kostenlos?
Der Equalizer-Schritt ist kostenlos, ohne Konto. Der Trennschritt nutzt KI auf unseren Servern und kostet 10 Credits pro Lauf; neue Konten bekommen 16 Gratis-Credits, genug für eine Trennung.
Welche Dateien kann ich hochladen?
MP3, WAV, M4A oder ein MP4-Video (die Tonspur wird genutzt), bis 10 MB pro Datei.
Bekomme ich die Musik auch zurück?
Ja. Jede Trennung liefert zwei Dateien: die isolierte Stimme und die Musik ohne Stimme. Beide lassen sich aus der Aufgabenliste abspielen und herunterladen.
Entfernt sie Wind, Rauschen oder Verkehrsgeräusche?
Nein. Die Trennung ist dafür gebaut, Stimme und Musik zu teilen. Sie zielt nicht auf Rauschen, und die Seite des Voice Cleaners sagt das. Ein Equalizer kann Rauschen und Rumpeln mildern; starkes Rauschen braucht ein Rauschunterdrückungs-Tool.
Wie lange dauert es?
Die meisten Aufnahmen sind in ein bis drei Minuten fertig, je nach Länge. Der Job läuft im Hintergrund, du kannst also die Seite verlassen und zurückkommen.
Wird meine Aufnahme gespeichert?
Die hochgeladene Datei wird nur für diese Trennung genutzt und gelöscht, wenn der Job fertig ist. Der Equalizer lädt überhaupt nichts hoch.
Darf ich die gesäuberte Stimme kommerziell nutzen?
Wenn es deine eigene Aufnahme ist, ja. Eine Aufnahme zu trennen ändert nichts an den Eigentumsrechten, Stems aus dem kommerziellen Song eines anderen bleiben also für den privaten Gebrauch.
Fazit
Eine gute Sprachaufnahme, die durch Hintergrundmusik ruiniert ist, gehört zu den am besten reparierbaren Problemen im Audiobereich. Trenn sie mit dem Hintergrundmusik-Entferner, damit du Stimme und Musik als zwei Dateien hast, verbring dann zwei Minuten im Equalizer mit dem Preset Podcast oder Stimme und exportier. Bleib bei den Erwartungen ehrlich —sie nimmt Musik heraus, keinen Wind und kein Rauschen—, und die meisten Café-Notizen, gefilmten Reden und unterbrochenen Podcast-Takes werden wieder brauchbar.
