豆包 Seed Audio 1.0 上線:人聲+配樂+環境聲一步生成

字節跳動旗下豆包團隊本週正式發表音訊生成模型 Seed Audio 1.0,同步上線火山方舟體驗中心開放創作者測試。這款模型把人聲、配樂、音效、環境聲視為同一個聲音場景,一次生成長達 2 分鐘、支援 20 餘種語言的完整音軌。
(前情提要:字節跳動發布AI模型「OmniHuman-1」:讓黃仁勳變Rapper、泰勒絲唱日文歌,網讚超逼真)
(背景補充:字節跳動首創「豆包股」!發行獨立期權防堵騰訊挖角,打響 AI 人才保衛戰)

本文目錄

Toggle

  • 從念稿子到搭場景
  • 為什麼要把聲音拆開重新看待
  • ElevenLabs 的三步,豆包的一步

字節跳動旗下豆包本週正式發表 Seed Audio 1.0,也叫豆包音訊生成模型 1.0,同步上線火山方舟體驗中心開放創作者測試,企業端 API 也一起邀測。

過去做一段配音,人聲、配樂、音效通常得分開錄、分開對時間軸,最後才在剪輯軟體裡手動拼在一起。這次豆包想做的,是讓一次推理就把整個聲音場景生出來,人不用再當中間的接線生。

個人用戶可以在火山方舟體驗中心直接上手,國際開發者則透過 BytePlus 接入,這個模型也已經整合進豆包 app 本身。

從念稿子到搭場景

Seed Audio 1.0 不是傳統的 TTS。TTS 是文字轉語音,簡單來說就是把一段文字唸出來;而 Seed Audio 1.0 把人聲、背景音樂、音效、環境聲都當成同一個聲音場景裡的元素,對映進一個統一的聲學表徵。

簡單來說就是,模型不是分開處理誰在說話跟背景在放什麼,而是把整個場景當一件事一起生出來。

它支援零樣本(zero-shot)多模態參考,簡單來說就是,不用重新訓練,丟一段文字或一段音訊當範例,模型就能模仿那個聲音的音色與風格。一條提示詞可以同時安排多角色對白、背景音樂與擬音特效,擬音也就是配音圈說的音效;就算生成的音訊拉長到將近 2 分鐘,裡面好幾個角色的音色也不會中途走調。

時間軸的控制精度到 100 毫秒,對白什麼時候開口、音效什麼時候進場,都能卡得很準。語言支援超過 20 種,中文、英語、日語都在裡面,音色和風格也可以分開調,不必為了換一種說話方式重新換一個聲音。

這套能力對應的是影視級音訊創作,涵蓋配音、配樂、擬音、混音等環節,也延伸到有聲書、廣播劇、Podcast、短影音、遊戲與互動媒體,等於把過去需要一整組後期團隊分工的活,收攏到一個模型裡。

為什麼要把聲音拆開重新看待

過去語音生成的思路,通常是把任務拆成好幾條線:語音合成一條、配樂一條、音效一條,各自訓練、各自輸出,用戶再自己把它們對在同一條時間軸上。

Seed Audio 1.0 的邏輯反過來,先把所有聲音元素放進同一個表徵空間,再一次生成。這麼做的好處,是角色之間的音色、場景裡的音樂與音效,天生就是同步的,不用事後校準。

ElevenLabs 的三步,豆包的一步

拿 ElevenLabs 的 Studio 對照最清楚。ElevenLabs 的做法是語音、音樂、音效三個獨立 API,各自生成,用戶要自己在時間軸上拼接對齊;豆包想用一次推理取代這幾個環節。

價格上,ElevenLabs Pro 一個月要 99 美元,豆包走火山引擎的 token 計費,也就是按用量算錢,在中文場景下成本明顯更低。

配音、配樂、音效,過去是三個工種,三套軟體,三次匯出。Seed Audio 1.0 想證明的是,這些工序可以壓進同一次推理裡完成。

至於它能不能真的取代影視配音、有聲書、Podcast 這些場景裡的專業分工,就創作者用了之後怎麼說。

此頁面可能包含第三方內容,僅供參考(非陳述或保證),不應被視為 Gate 認可其觀點表述,也不得被視為財務或專業建議。詳見聲明
  • 打賞
  • 回覆
  • 轉發
  • 分享
回覆
請輸入回覆內容
請輸入回覆內容
暫無回覆
  • 已置頂