重點摘要
如果人聲背後在放音樂——咖啡廳的喇叭、手機影片底下的一首歌、錄 Podcast 時忘了關的曲子——你不需要原始專案檔也能把人聲找回來。把檔案上傳到背景音樂去除(人聲清理和人聲分離用的也是同一個引擎),AI 分離會回傳兩條音軌:單獨的人聲,和單獨的音樂。它接受 MP3、WAV、M4A 或 MP4 裡的音訊,最大 10 MB;一次分離花 10 點數,通常一到三分鐘完成。然後把人聲載入免費的等化器,套用 Podcast 或人聲預設,匯出 MP3 或 WAV。說句老實話:分離去掉的是音樂。它不是用來去除底噪、風聲或車流聲的降噪器。
本文目錄
分離能做什麼、不能做什麼
舊式的「人聲擷取」技巧靠的是相位抵消:用右聲道減掉左聲道,指望人聲剛好在正中間。它毀掉人聲的次數和去掉音樂的次數差不多。現代的分離不一樣。一個用成千上萬條單獨人聲和伴奏訓練出來的神經網路,會聽完整段混音,然後重建出兩個新檔案——一個只有人聲,一個是其餘所有東西。因為它是在模擬人聲聽起來是什麼樣子,而不是看它在立體聲場裡待在哪裡,所以單聲道的手機錄音也一樣能處理。
它擅長的:
- 壓在說話聲下面的音樂。 vlog 背景裡的一首歌、語音備忘錄底下的咖啡廳喇叭、滲進訪談裡的 DJ 串燒。
- 跟著伴奏的演唱。 一段練習影片,你想要單獨的歌聲。
- 兩半都留著。 你還會拿到單獨一條音樂音軌,如果你想把它換成自己有版權的音樂,這很方便。
它不是:
- 降噪器。 底噪、嗡聲、風聲、車流聲和房間回音都不是音樂,模型也不會去處理它們。正因為如此,人聲清理頁面上清清楚楚寫著這一點。
- 能把被埋掉的人聲變出來的魔法。 如果音樂比說話的人大聲得多,分離出來的人聲能用,但會比較單薄。原始錄音裡人聲越大聲,結果越乾淨。
開始之前
- 格式和大小。 MP3、WAV、M4A,或 MP4 影片(會從中取出音訊),最大 10 MB。一個 128 kbps 的 10 MB MP3 大約十分鐘;檔案更大的話,先把你需要的部分剪出來。
- 帳號和點數。 分離在我們的伺服器上執行,所以需要登入。每次執行花 10 點數;新帳號送 16 點免費點數,夠一次分離。更多點數來自任何方案或點數包。
- 你的檔案不會被保留。 上傳的檔案只用於那一次分離,任務結束後就會刪除。
- 權利。 分離一段錄音並不會改變它歸誰所有。從你自己的錄音分出的分軌歸你;從別人的商業歌曲分出來的分軌僅供個人使用。
第一步 把人聲和音樂分開
- 打開背景音樂去除。它預設在上傳檔案分頁;另一個分頁從我的曲庫選是給你在本站生成的歌用的。
- 點虛線框,選你的錄音。檔名會出現在框裡。

- 按去除人聲(10 點數)。如果你還沒登入,會先跳出登入視窗;任務真正開始之前不會扣任何點數。
- 任務在背景執行——依長度通常一到三分鐘——你可以離開網頁。它會出現在右側的任務清單裡。
- 完成之後你會得到兩個檔案:單獨的人聲(清唱)和去掉人聲的音樂(伴奏)。兩個都聽聽看,然後下載人聲。
按鈕上寫「去除人聲」,是因為同一個工具也會反過來用——把歌手從一首歌裡拿掉做 K 歌伴奏。對一段人聲錄音來說,你要的是人聲那個檔案。如果分離失敗,點數會自動退回。
第二步 用等化器修飾人聲
分離出來的人聲常常有點悶或有點轟:模型去掉了音樂,卻保留了麥克風收到的每一點低頻隆隆聲。用等化器花兩分鐘,大部分問題都能解決。
- 打開等化器,點選一個音訊檔載入分離出的人聲。
- 選一個預設。說話的錄音先從 Podcast 開始:它把最低的幾個頻段大幅衰減(31 Hz −8 dB,62 Hz −6),中間保持不動,並把 1–2 kHz 附近的臨場感頻段提升 3 dB,子音和清晰度就在那裡。
- 按播放,邊聽邊微調單一滑桿。十個頻段——31、62、125、250、500 Hz 以及 1、2、4、8、16 kHz——每個都能動 ±12 dB,拖動時就聽得到變化。
- 用下載 MP3或下載 WAV匯出。匯出走的是和預覽同一條濾波鏈,所以檔案聽起來和你剛才聽到的一模一樣。

我們把測試檔匯出為 WAV 時,得到的是一個完整長度、41 MB、檔名帶 -eq 字尾的檔案,可以直接拿進剪輯軟體。等化器從不上傳任何東西——檔案在你的瀏覽器裡處理——免費,不用帳號。
什麼錄音用什麼預設
五個預設只是起點,不是定論:
| 錄音 | 先用 | 再試 |
|---|---|---|
| 說話的語音備忘錄、訪談、Podcast | Podcast | 有底噪的話把 16 kHz 再往下拉 |
| 唱歌、饒舌、之後要配樂的旁白 | 人聲 | 在 4 kHz 加 +1 或 +2,多一點空氣感 |
| 聽起來發悶或很遠的人聲 | 明亮 | 把 250 Hz 衰減 2–3 dB,去掉箱子味 |
| 單薄的手機錄音 | 先平直,再在 125–250 Hz 加 +2 | 31–62 Hz 保持衰減,避免隆隆聲 |
| 任何你處理過頭的東西 | 歸零 | 從平直重新開始 |
有一條規則比任何預設都有用:先減後加。每個頻段都提升,只不過是把整個檔案開大直到削波。把礙事的東西去掉——底部的隆隆聲、250–500 Hz 附近的箱子味——通常比加高音更能讓聲音清楚。
疑難排解
「這個檔案超過 10 MB。」 把你需要的部分剪出來,或用更低的位元率匯出。96 kbps 的 MP3 對說話來說完全夠用,10 MB 能裝下大約 14 分鐘。
人聲裡有水水的、打旋的痕跡。 這發生在音樂和人聲在同樣的頻率、差不多的音量上互相搶的地方。試著分離一個只在說話處開始和結束的副本,讓模型整體上聽到的音樂比較少。在等化器裡把 4–8 kHz 附近輕輕衰減一點,也能讓這些痕跡柔和一些。
音樂沒了,但還有底噪或車流聲。 分離去掉的是音樂,不是噪音。用等化器把兩端削掉(低切去隆隆聲,在 8–16 kHz 稍微衰減去底噪),噪音嚴重的話用專門的降噪工具。
等化器說檔案無法解碼。 用 MP3、WAV 或 M4A。影片檔裡有些不常見的編碼瀏覽器解不了;先轉成 MP3。
匯出失敗了。 很長的檔案可能會耗盡瀏覽器記憶體。把錄音分成幾段比較短的,分別匯出。
它能解決的真實情境
- 咖啡廳裡的語音備忘錄。 你用手機錄了一個歌的點子,咖啡廳喇叭正在放一首流行歌。分離一下,留下人聲,拿它當參考人聲。
- 致詞影片。 一段樂團演奏時拍下的婚禮致詞。分離出的人聲套上 Podcast 預設,清楚到足以剪進精華影片。
- 滲了音樂的 Podcast 錄音。 有人在訪談時讓歌單一直播著。分離能救回這段錄音,不用重錄。
- 把 vlog 裡有版權的音樂換掉。 分離,留下人聲,底下墊一首你有權使用的曲子——例如你自己在 AI 音樂生成器上生成的。我們的 YouTube 用的 AI 音樂指南講了平台會標記什麼。
- 跟著伴奏唱的錄音。 留下人聲做翻唱,或留下伴奏拿來練習。如果目標是 K 歌,伴奏版指南講的是這個方向。
常見問題
去掉錄音裡的背景音樂免費嗎?
等化器那一步免費,不用帳號。分離那一步在我們的伺服器上用 AI 執行,每次花 10 點數;新帳號送 16 點免費點數,夠一次分離。
能上傳哪些檔案?
MP3、WAV、M4A,或 MP4 影片(使用其中的音軌),每個檔案最大 10 MB。
音樂也能拿回來嗎?
能。每次分離都會回傳兩個檔案:單獨的人聲,和去掉人聲的音樂。兩個都能在任務清單裡播放和下載。
它能去掉風聲、底噪或車流聲嗎?
不能。分離是為了把人聲和音樂分開而做的。它不針對噪音,人聲清理頁面上也寫明了這一點。等化器可以讓底噪和隆隆聲柔和一些;嚴重的噪音需要降噪工具。
要多久?
大多數錄音一到三分鐘完成,取決於長度。任務在背景執行,所以你可以離開網頁再回來。
我的錄音會被保存嗎?
上傳的檔案只用於那一次分離,任務結束後就會刪除。等化器則根本不上傳任何東西。
清理後的人聲能商用嗎?
如果是你自己的錄音,可以。分離一段錄音不會改變它的所有權,所以從別人的商業歌曲分出來的分軌仍然僅供個人使用。
結語
一段被背景音樂毀掉的好錄音,是音訊裡最修得好的問題之一。用背景音樂去除把它分成人聲和音樂兩個檔案,再在等化器裡用 Podcast 或人聲預設花兩分鐘,然後匯出。期望要實際一點——它抽掉的是音樂,不是風聲或底噪——大多數咖啡廳備忘錄、拍下來的致詞和被打斷的 Podcast 錄音都能救回來用。
