オープンソース · ローカル優先 · Higgs Audio、ElevenLabs ほか
あなたの動画を、どんな言語でも、あなたの声のままで。
動画をアップロードして、吹き替え先の言語を選ぶだけです。OpenDub は話し声を音楽から分離して書き起こし、その場の尺に収まる長さに一文ずつ翻訳して、元の声をクローンした声で読み上げます。最後に新しい言語の字幕を焼き込みます。
- オープンソース。どの工程も、読んで、動かして、差し替えられるただのコードです。
- 音声モデル以外はローカル。分離、発話検出、タイミング、ミックス、書き出しはすべて端末上で動きます。動画が端末から出ることはなく、選んだ音声モデルに届くのは話し声のクリップとテキストだけです。
- 強力。クローンしたあなたの声が 17 言語に。各行は口の動きに合わせ、驚き、熱意、落ち着きといった口調まで運びます。
その他の設定 クローン音声 · 行ごとに口調を合わせる
話す速さは設定項目ではありません。各行が話者と同時に始まり、同時に終わるよう行ごとに決まります。
「声を差し替える」は音楽と効果音を残して話し声だけを入れ替えます。「ボイスオーバー」は元の声をうっすら下に残します。
吹き替え中
—
いま行っていること
完了
—
吹き替えブロックをドラッグすると動かせ、端をドラッグすると長さを変えられます。ダブルクリックで元の位置に戻ります。
各行
翻訳・口調・タイミングを直して、その行だけに反映できます。ほかはそのまま残ります。
自分の動画を吹き替える
あるいは、OpenDub を自分のマシンで動かす。
上のカードなら、このタブのまま 5 分までの動画を吹き替えられます。パソコン版アプリには長さの制限がなく、声の除去も速く、どの行でも編集・口調変更・ドラッグして 10 秒ほどで吹き替え直せます。
Higgs の STT と翻訳、口調タグ付きのクローン音声。品質は最高で、上の吹き替えもこれで作りました。
Boson AI の従量料金
Whisper、ローカルの言語モデル、OmniVoice を使います。パソコンから何も出ず、料金もかかりません。
近日公開
開いて「インストール」を押すだけ。ターミナルも設定も要りません。
1 行で入れることもできますcurl -fsSL https://opendub.app/install.sh | bash
macOS と Linux。約 2 GB、数分。無料の音声を入れて起動するので、上のカードがそれで吹き替えられます。すべてこのパソコンの中だけで完結します。
- インストール:Python 3.12 と ffmpeg(Homebrew の
ffmpegに必要なものはすべて入っています)。 - キーを追加:Higgs を使うなら
BOSON_API_KEY=…を.envファイルに書きます。 - 起動:
./run.shを実行してhttp://127.0.0.1:8910を開きます。
すべてオープンソース、AGPL-3.0 です:github.com/opendubapp/opendub。
仕組み
4 つのモデルが、それぞれ最も得意なことだけを担います。
- 01
分離する
Demucs が話し声を音楽や効果音から切り離します。だから吹き替え後もサウンドトラックは生き残り、以降のモデルはきれいな声だけを聞けます。
- 02
聞き取る
Silero VAD が発話区間を見つけます。Higgs STT はどの言語で話されていても言葉を書き起こし、ローカルの Whisper は単語単位で揃えたタイミングだけを受け持ちます。
- 03
尺に合わせて訳す
Higgs のチャットモデルが文ごとに翻訳し、それぞれを話者が話した長さに合う分量へ整えます。だから新しい声は、話者の口と同時に始まり同時に終わります。
- 04
話し、確かめる
Higgs TTS が元音声のきれいな一文から声をクローンし、言葉の内容と話者の声の大きさ・速さから読み取った口調で各行を読み上げます。各行は書き起こして照合し、ずれていれば作り直したうえで、元の長さに合うよう言い直すか、わずかに伸縮させます。