開源 · 本機優先 · Higgs Audio、ElevenLabs 等

你的影片,任何語言,你自己的聲音。

上傳一段某種語言的影片,再選另一種語言。OpenDub 會把人聲從配樂中分離、寫成逐字稿、把每一句翻譯成剛好塞得進那個時間點的長度,再用複製出來的原聲說回來 —— 最後把新語言的字幕燒進畫面。

  • 開源。每一個步驟都是你看得懂、跑得動、也換得掉的程式碼。
  • 除了語音模型,全都在本機。分離、語音偵測、對時、混音與算圖都在你的裝置上執行。影片不會離開它 —— 只有語音片段和文字會送到你選的語音模型。
  • 夠強。用複製出來的你的聲音說 17 種語言,每一句都對上你的嘴形、帶著你的語氣 —— 驚訝、熱切、平靜。
人聲
其他設定 複製聲音 · 逐句對應語氣
OmniVoice 免費且在本機執行,但比較慢,而且僅限非商業用途。或者選一個 Higgs 的預設聲音。
依字句內容,以及每一句說得多大聲、多快來判讀。

語速不是設定項目:它由每一句各自決定,好讓每一句都跟著說話者一起開始、一起結束。

取代原聲會保留配樂與音效,只換掉人聲。疊聲配音則讓原本的聲音輕輕留在底下。

運作方式

四個模型,各自只做它最擅長的那件事。

  1. 01

    分離

    Demucs 把人聲從配樂與音效中分開,讓原本的音軌在配音後仍然完整,也讓後面每一個模型都聽到乾淨的人聲。

  2. 02

    聆聽

    Silero VAD 找出有語音的段落。Higgs STT 不管說的是哪種語言,都把內容寫成文字;本機的 Whisper 只負責提供時間點,逐字對齊。

  3. 03

    翻得剛剛好

    Higgs 對話模型以整句為單位翻譯,每一句的長度都配合說話者原本花掉的時間 —— 新的聲音就會跟著他的嘴形一起開始、一起停下。

  4. 04

    說出來,再檢查

    Higgs TTS 從原片中一句乾淨的話複製出聲音,再依字句內容以及說話者當時的音量與語速,用原本的語氣說出每一句。每一句都會轉錄回文字核對,跑掉就重新生成,然後重說一次或輕輕拉伸,讓長度對回原句。