23:59:59

免費 2 個月

指南

怎麼去掉錄音裡的背景音樂:先把人聲找回來,再把它修好(2026)

在咖啡廳錄的語音備忘錄、放著音樂時拍下的致詞、底下滲著一首歌的 Podcast 錄音——音樂是可以抽出來的。AI 分離怎麼把一段錄音拆成人聲和音樂、它能修什麼不能修什麼,以及怎麼用免費的十段等化器幫清理後的人聲收尾。

Suno AI Music
編輯團隊閱讀約 2 分鐘
全部文章

重點摘要

如果人聲背後在放音樂——咖啡廳的喇叭、手機影片底下的一首歌、錄 Podcast 時忘了關的曲子——你不需要原始專案檔也能把人聲找回來。把檔案上傳到背景音樂去除(人聲清理和人聲分離用的也是同一個引擎),AI 分離會回傳兩條音軌:單獨的人聲,和單獨的音樂。它接受 MP3、WAV、M4A 或 MP4 裡的音訊,最大 10 MB;一次分離花 10 點數,通常一到三分鐘完成。然後把人聲載入免費的等化器,套用 Podcast 或人聲預設,匯出 MP3 或 WAV。說句老實話:分離去掉的是音樂。它不是用來去除底噪、風聲或車流聲的降噪器。

本文目錄

分離能做什麼、不能做什麼

舊式的「人聲擷取」技巧靠的是相位抵消:用右聲道減掉左聲道,指望人聲剛好在正中間。它毀掉人聲的次數和去掉音樂的次數差不多。現代的分離不一樣。一個用成千上萬條單獨人聲和伴奏訓練出來的神經網路,會聽完整段混音,然後重建出兩個新檔案——一個只有人聲,一個是其餘所有東西。因為它是在模擬人聲聽起來是什麼樣子,而不是看它在立體聲場裡待在哪裡,所以單聲道的手機錄音也一樣能處理。

它擅長的:

  • 壓在說話聲下面的音樂。 vlog 背景裡的一首歌、語音備忘錄底下的咖啡廳喇叭、滲進訪談裡的 DJ 串燒。
  • 跟著伴奏的演唱。 一段練習影片,你想要單獨的歌聲。
  • 兩半都留著。 你還會拿到單獨一條音樂音軌,如果你想把它換成自己有版權的音樂,這很方便。

它不是:

  • 降噪器。 底噪、嗡聲、風聲、車流聲和房間回音都不是音樂,模型也不會去處理它們。正因為如此,人聲清理頁面上清清楚楚寫著這一點。
  • 能把被埋掉的人聲變出來的魔法。 如果音樂比說話的人大聲得多,分離出來的人聲能用,但會比較單薄。原始錄音裡人聲越大聲,結果越乾淨。

開始之前

  • 格式和大小。 MP3、WAV、M4A,或 MP4 影片(會從中取出音訊),最大 10 MB。一個 128 kbps 的 10 MB MP3 大約十分鐘;檔案更大的話,先把你需要的部分剪出來。
  • 帳號和點數。 分離在我們的伺服器上執行,所以需要登入。每次執行花 10 點數;新帳號送 16 點免費點數,夠一次分離。更多點數來自任何方案或點數包。
  • 你的檔案不會被保留。 上傳的檔案只用於那一次分離,任務結束後就會刪除。
  • 權利。 分離一段錄音並不會改變它歸誰所有。從你自己的錄音分出的分軌歸你;從別人的商業歌曲分出來的分軌僅供個人使用。

第一步 把人聲和音樂分開

  1. 打開背景音樂去除。它預設在上傳檔案分頁;另一個分頁從我的曲庫選是給你在本站生成的歌用的。
  2. 點虛線框,選你的錄音。檔名會出現在框裡。

背景音樂去除頁面上的 AI 人聲分離器表單,選了上傳檔案分頁,虛線上傳框裡載入了一個叫 take-1.mp3 的錄音,限制寫著 MP3、WAV、M4A 或 MP4 裡的音訊,最大 10 MB,下面是去除人聲(10 點數)按鈕

  1. 按去除人聲(10 點數)。如果你還沒登入,會先跳出登入視窗;任務真正開始之前不會扣任何點數。
  2. 任務在背景執行——依長度通常一到三分鐘——你可以離開網頁。它會出現在右側的任務清單裡。
  3. 完成之後你會得到兩個檔案:單獨的人聲(清唱)和去掉人聲的音樂(伴奏)。兩個都聽聽看,然後下載人聲。

按鈕上寫「去除人聲」,是因為同一個工具也會反過來用——把歌手從一首歌裡拿掉做 K 歌伴奏。對一段人聲錄音來說,你要的是人聲那個檔案。如果分離失敗,點數會自動退回。

第二步 用等化器修飾人聲

分離出來的人聲常常有點悶或有點轟:模型去掉了音樂,卻保留了麥克風收到的每一點低頻隆隆聲。用等化器花兩分鐘,大部分問題都能解決。

  1. 打開等化器,點選一個音訊檔載入分離出的人聲。
  2. 選一個預設。說話的錄音先從 Podcast 開始:它把最低的幾個頻段大幅衰減(31 Hz −8 dB,62 Hz −6),中間保持不動,並把 1–2 kHz 附近的臨場感頻段提升 3 dB,子音和清晰度就在那裡。
  3. 按播放,邊聽邊微調單一滑桿。十個頻段——31、62、125、250、500 Hz 以及 1、2、4、8、16 kHz——每個都能動 ±12 dB,拖動時就聽得到變化。
  4. 用下載 MP3或下載 WAV匯出。匯出走的是和預覽同一條濾波鏈,所以檔案聽起來和你剛才聽到的一模一樣。

載入檔案並套用 Podcast 預設的十段等化器:從 31 Hz 到 16 kHz 的滑桿分別為 −8、−6、−2、+1、+2、+3、+3、+2、0 和 −2,預覽正在播放,下載 MP3 和下載 WAV 按鈕在歸零旁邊

我們把測試檔匯出為 WAV 時,得到的是一個完整長度、41 MB、檔名帶 -eq 字尾的檔案,可以直接拿進剪輯軟體。等化器從不上傳任何東西——檔案在你的瀏覽器裡處理——免費,不用帳號。

什麼錄音用什麼預設

五個預設只是起點,不是定論:

錄音先用再試
說話的語音備忘錄、訪談、PodcastPodcast有底噪的話把 16 kHz 再往下拉
唱歌、饒舌、之後要配樂的旁白人聲在 4 kHz 加 +1 或 +2,多一點空氣感
聽起來發悶或很遠的人聲明亮把 250 Hz 衰減 2–3 dB,去掉箱子味
單薄的手機錄音先平直,再在 125–250 Hz 加 +231–62 Hz 保持衰減,避免隆隆聲
任何你處理過頭的東西歸零從平直重新開始

有一條規則比任何預設都有用:先減後加。每個頻段都提升,只不過是把整個檔案開大直到削波。把礙事的東西去掉——底部的隆隆聲、250–500 Hz 附近的箱子味——通常比加高音更能讓聲音清楚。

疑難排解

「這個檔案超過 10 MB。」 把你需要的部分剪出來,或用更低的位元率匯出。96 kbps 的 MP3 對說話來說完全夠用,10 MB 能裝下大約 14 分鐘。

人聲裡有水水的、打旋的痕跡。 這發生在音樂和人聲在同樣的頻率、差不多的音量上互相搶的地方。試著分離一個只在說話處開始和結束的副本,讓模型整體上聽到的音樂比較少。在等化器裡把 4–8 kHz 附近輕輕衰減一點,也能讓這些痕跡柔和一些。

音樂沒了,但還有底噪或車流聲。 分離去掉的是音樂,不是噪音。用等化器把兩端削掉(低切去隆隆聲,在 8–16 kHz 稍微衰減去底噪),噪音嚴重的話用專門的降噪工具。

等化器說檔案無法解碼。 用 MP3、WAV 或 M4A。影片檔裡有些不常見的編碼瀏覽器解不了;先轉成 MP3。

匯出失敗了。 很長的檔案可能會耗盡瀏覽器記憶體。把錄音分成幾段比較短的,分別匯出。

它能解決的真實情境

  • 咖啡廳裡的語音備忘錄。 你用手機錄了一個歌的點子,咖啡廳喇叭正在放一首流行歌。分離一下,留下人聲,拿它當參考人聲。
  • 致詞影片。 一段樂團演奏時拍下的婚禮致詞。分離出的人聲套上 Podcast 預設,清楚到足以剪進精華影片。
  • 滲了音樂的 Podcast 錄音。 有人在訪談時讓歌單一直播著。分離能救回這段錄音,不用重錄。
  • 把 vlog 裡有版權的音樂換掉。 分離,留下人聲,底下墊一首你有權使用的曲子——例如你自己在 AI 音樂生成器上生成的。我們的 YouTube 用的 AI 音樂指南講了平台會標記什麼。
  • 跟著伴奏唱的錄音。 留下人聲做翻唱,或留下伴奏拿來練習。如果目標是 K 歌,伴奏版指南講的是這個方向。

常見問題

去掉錄音裡的背景音樂免費嗎?

等化器那一步免費,不用帳號。分離那一步在我們的伺服器上用 AI 執行,每次花 10 點數;新帳號送 16 點免費點數,夠一次分離。

能上傳哪些檔案?

MP3、WAV、M4A,或 MP4 影片(使用其中的音軌),每個檔案最大 10 MB。

音樂也能拿回來嗎?

能。每次分離都會回傳兩個檔案:單獨的人聲,和去掉人聲的音樂。兩個都能在任務清單裡播放和下載。

它能去掉風聲、底噪或車流聲嗎?

不能。分離是為了把人聲和音樂分開而做的。它不針對噪音,人聲清理頁面上也寫明了這一點。等化器可以讓底噪和隆隆聲柔和一些;嚴重的噪音需要降噪工具。

要多久?

大多數錄音一到三分鐘完成,取決於長度。任務在背景執行,所以你可以離開網頁再回來。

我的錄音會被保存嗎?

上傳的檔案只用於那一次分離,任務結束後就會刪除。等化器則根本不上傳任何東西。

清理後的人聲能商用嗎?

如果是你自己的錄音,可以。分離一段錄音不會改變它的所有權,所以從別人的商業歌曲分出來的分軌仍然僅供個人使用。

結語

一段被背景音樂毀掉的好錄音,是音訊裡最修得好的問題之一。用背景音樂去除把它分成人聲和音樂兩個檔案,再在等化器裡用 Podcast 或人聲預設花兩分鐘,然後匯出。期望要實際一點——它抽掉的是音樂,不是風聲或底噪——大多數咖啡廳備忘錄、拍下來的致詞和被打斷的 Podcast 錄音都能救回來用。