オープンソース · ローカル優先 · Higgs Audio、ElevenLabs ほか

あなたの動画を、どんな言語でも、あなたの声のままで。

動画をアップロードして、吹き替え先の言語を選ぶだけです。OpenDub は話し声を音楽から分離して書き起こし、その場の尺に収まる長さに一文ずつ翻訳して、元の声をクローンした声で読み上げます。最後に新しい言語の字幕を焼き込みます。

  • オープンソース。どの工程も、読んで、動かして、差し替えられるただのコードです。
  • 音声モデル以外はローカル。分離、発話検出、タイミング、ミックス、書き出しはすべて端末上で動きます。動画が端末から出ることはなく、選んだ音声モデルに届くのは話し声のクリップとテキストだけです。
  • 強力。クローンしたあなたの声が 17 言語に。各行は口の動きに合わせ、驚き、熱意、落ち着きといった口調まで運びます。
声
その他の設定 クローン音声 · 行ごとに口調を合わせる
OmniVoice は無料でローカル動作ですが低速で、非商用利用向けです。Higgs のプリセット音声を選ぶこともできます。
言葉の内容と、各行がどれくらいの大きさ・速さで話されたかから読み取ります。

話す速さは設定項目ではありません。各行が話者と同時に始まり、同時に終わるよう行ごとに決まります。

「声を差し替える」は音楽と効果音を残して話し声だけを入れ替えます。「ボイスオーバー」は元の声をうっすら下に残します。

仕組み

4 つのモデルが、それぞれ最も得意なことだけを担います。

  1. 01

    分離する

    Demucs が話し声を音楽や効果音から切り離します。だから吹き替え後もサウンドトラックは生き残り、以降のモデルはきれいな声だけを聞けます。

  2. 02

    聞き取る

    Silero VAD が発話区間を見つけます。Higgs STT はどの言語で話されていても言葉を書き起こし、ローカルの Whisper は単語単位で揃えたタイミングだけを受け持ちます。

  3. 03

    尺に合わせて訳す

    Higgs のチャットモデルが文ごとに翻訳し、それぞれを話者が話した長さに合う分量へ整えます。だから新しい声は、話者の口と同時に始まり同時に終わります。

  4. 04

    話し、確かめる

    Higgs TTS が元音声のきれいな一文から声をクローンし、言葉の内容と話者の声の大きさ・速さから読み取った口調で各行を読み上げます。各行は書き起こして照合し、ずれていれば作り直したうえで、元の長さに合うよう言い直すか、わずかに伸縮させます。