开源 · 本地优先 · Higgs Audio、ElevenLabs 等

你的视频,任何语言,你自己的声音。

上传一段某种语言的视频,再选一种目标语言。OpenDub 会把人声从音乐里分出来、转写成文字,把每句话译成刚好贴合那一刻的长度,再用克隆的原声说出来 —— 最后把新语言的字幕压进画面。

  • 开源。每一步都是你能读、能跑、能换掉的普通代码。
  • 除语音模型外,全在本地。分离、人声检测、对时、混音和渲染都在你的设备上跑。视频从不离开设备 —— 只有人声片段和文字会发给你选的语音模型。
  • 够强。用你自己的克隆声音说 17 种语言,每句都对上你的口型,也带着你的语气 —— 惊讶、热情、平静。
人声
其他设置 克隆声音 · 逐句匹配语气
OmniVoice 免费且在本地跑,但更慢,且仅限非商业用途。也可以选一个 Higgs 预置声音。
从用词,以及每句说得多响、多快,判断出来。

语速不是一个设置:它按句决定,好让每句和说话人同时开口、同时收尾。

替换原声会保留音乐和音效,只换掉说话声。叠加配音则让原声在底下轻轻留着。

工作原理

四个模型,各做各最拿手的那一件事。

  1. 01

    分离

    Demucs 把人声从音乐和音效里分开,这样原来的声轨在配音后仍然完好,后面每个模型听到的也都是干净的人声。

  2. 02

    听

    Silero VAD 找出有人声的地方。Higgs STT 按原来的语言把话记成文字;本地的 Whisper 只负责时间,逐词对齐。

  3. 03

    按时长翻译

    Higgs 对话模型整句整句地翻译,每句的长短都照说话人当时用了多久来定 —— 新的声音因此能和他的口型同起同落。

  4. 04

    说出来,再核对

    Higgs TTS 从原片里一句干净的话中克隆出声音,再用当时的语气说出每一句 —— 语气取自用词,也取自说话人当时有多响、多快。每句都会被回转写一遍,偏了就重新生成,然后重说或轻轻拉伸,让长度和原句对上。