开源 · 本地优先 · Higgs Audio、ElevenLabs 等
你的视频,任何语言,你自己的声音。
上传一段某种语言的视频,再选一种目标语言。OpenDub 会把人声从音乐里分出来、转写成文字,把每句话译成刚好贴合那一刻的长度,再用克隆的原声说出来 —— 最后把新语言的字幕压进画面。
- 开源。每一步都是你能读、能跑、能换掉的普通代码。
- 除语音模型外,全在本地。分离、人声检测、对时、混音和渲染都在你的设备上跑。视频从不离开设备 —— 只有人声片段和文字会发给你选的语音模型。
- 够强。用你自己的克隆声音说 17 种语言,每句都对上你的口型,也带着你的语气 —— 惊讶、热情、平静。
其他设置 克隆声音 · 逐句匹配语气
语速不是一个设置:它按句决定,好让每句和说话人同时开口、同时收尾。
替换原声会保留音乐和音效,只换掉说话声。叠加配音则让原声在底下轻轻留着。
配音中
—
正在做什么
完成
—
拖动配音块可以挪位置,拖两端可以改长度。双击可让它对回原句。
逐句
改任意一句的译文、语气或时间,只重做这几句 —— 其余保持不变。
给自己的视频配音
也可以在自己的机器上跑 OpenDub。
顶部那张卡片能直接在这个标签页里给五分钟以内的视频配音。装在电脑上的应用没有时长限制,去人声更快,还能改词、改语气或拖动任意一句,十秒左右就重配好。
Higgs 的语音识别、翻译,以及带语气标记的克隆声音。质量最好,上面那段配音就是它做的。
按 Boson AI 的用量价格计费
Whisper、一个本地语言模型和 OmniVoice。没有任何东西离开你的电脑,也不收一分钱。
即将推出
打开后点「安装」。不用终端,也不用配置。
或者用一行命令装curl -fsSL https://opendub.app/install.sh | bash
macOS 与 Linux。约 2 GB,几分钟。它会装好免费语音并启动,顶部的卡片就能用它配音。全部留在你的电脑上。
- 装好 Python 3.12 和 ffmpeg(Homebrew 的
ffmpeg已包含所需的一切)。 - 加一个密钥,走 Higgs 这条路:在
.env文件里写上BOSON_API_KEY=…。 - 启动它:运行
./run.sh,然后打开http://127.0.0.1:8910。
全部开源,AGPL-3.0:github.com/opendubapp/opendub。
工作原理
四个模型,各做各最拿手的那一件事。
- 01
分离
Demucs 把人声从音乐和音效里分开,这样原来的声轨在配音后仍然完好,后面每个模型听到的也都是干净的人声。
- 02
听
Silero VAD 找出有人声的地方。Higgs STT 按原来的语言把话记成文字;本地的 Whisper 只负责时间,逐词对齐。
- 03
按时长翻译
Higgs 对话模型整句整句地翻译,每句的长短都照说话人当时用了多久来定 —— 新的声音因此能和他的口型同起同落。
- 04
说出来,再核对
Higgs TTS 从原片里一句干净的话中克隆出声音,再用当时的语气说出每一句 —— 语气取自用词,也取自说话人当时有多响、多快。每句都会被回转写一遍,偏了就重新生成,然后重说或轻轻拉伸,让长度和原句对上。