Código aberto · Local em primeiro lugar · Higgs Audio, ElevenLabs e mais

Seu vídeo, em qualquer idioma, na sua própria voz.

Envie um vídeo em um idioma e escolha outro. O OpenDub separa a fala da música, transcreve tudo, traduz cada frase para caber no tempo dela e fala de novo com um clone da voz original — depois embute as legendas no novo idioma.

  • Código aberto. Cada etapa é código simples, que você pode ler, rodar e trocar.
  • Local, menos os modelos de voz. Separação, detecção de fala, sincronia, mixagem e renderização rodam no seu dispositivo. Seu vídeo nunca sai dele — só os trechos de fala e o texto vão para o modelo de voz que você escolher.
  • Potente. Sua voz clonada em 17 idiomas, cada fala no tempo dos seus lábios e com o seu tom — surpresa, entusiasmo, calma.
Voz
Outras configurações Voz clonada · tom ajustado por fala
O OmniVoice é grátis e local, mas mais lento e só para uso não comercial. Ou escolha uma voz pronta da Higgs.
Deduzido das palavras e do volume e da velocidade de cada fala.

A velocidade da fala não é uma configuração: ela é escolhida fala a fala, para cada uma começar e terminar junto com o original.

Substituir a voz mantém a música e os efeitos e troca a fala. Voz sobreposta deixa o original baixinho por baixo.

Como funciona

Quatro modelos, cada um fazendo aquilo em que é melhor.

  1. 01

    Separar

    O Demucs separa a fala da música e dos efeitos, para a trilha sobreviver à dublagem e todos os modelos seguintes ouvirem uma voz limpa.

  2. 02

    Escutar

    O Silero VAD encontra a fala. O Higgs STT escreve as palavras no idioma em que foram ditas; um Whisper local entra só com a sincronia, alinhada palavra por palavra.

  3. 03

    Traduzir na medida

    O modelo de chat da Higgs traduz frases inteiras, cada uma no tamanho do tempo que a pessoa levou para dizê-la — assim a nova voz começa e para junto com os lábios dela.

  4. 04

    Falar e conferir

    O Higgs TTS clona a voz a partir de uma frase limpa do original e diz cada fala no tom em que ela foi dita, deduzido das palavras e do volume e da velocidade de quem falava. Cada fala é transcrita de volta e refeita se saiu do rumo, depois dita outra vez ou esticada de leve para bater com a duração original.