Código abierto · Primero en local · Higgs Audio, ElevenLabs y más

Tu vídeo, en cualquier idioma, con tu propia voz.

Sube un vídeo en un idioma y elige otro. OpenDub separa la voz de la música, la transcribe, traduce cada frase para que encaje en su momento y la dice con un clon de la voz original; después incrusta los subtítulos en el nuevo idioma.

  • Código abierto. Cada paso es código normal que puedes leer, ejecutar y sustituir.
  • En local, salvo los modelos de voz. La separación, la detección de voz, la sincronización, la mezcla y el renderizado se hacen en tu dispositivo. Tu vídeo nunca sale de él: al modelo de voz que elijas solo van fragmentos de voz y texto.
  • Potente. Tu propia voz clonada en 17 idiomas, con cada frase ajustada a tus labios y con tu tono: sorpresa, entusiasmo, calma.
Voz
Otros ajustes Voz clonada · tono ajustado por frase
OmniVoice es gratis y local, pero más lento y solo para uso no comercial. O elige una voz predefinida de Higgs.
Se deduce de las palabras y del volumen y la velocidad con que se dijo cada frase.

La velocidad al hablar no es un ajuste: se elige en cada frase para que empiece y termine con el hablante.

Sustituir la voz conserva la música y los efectos y cambia solo el habla. Voz superpuesta deja el original de fondo, muy bajo.

Cómo funciona

Cuatro modelos, cada uno haciendo aquello en lo que es mejor.

  1. 01

    Separar

    Demucs separa la voz de la música y los efectos, así la banda sonora sobrevive al doblaje y todos los modelos siguientes oyen una voz limpia.

  2. 02

    Escuchar

    Silero VAD encuentra la voz. Higgs STT escribe las palabras en el idioma en que se dicen; un Whisper local aporta solo la sincronización, alineada palabra por palabra.

  3. 03

    Traducir a medida

    El modelo de chat de Higgs traduce frases enteras, cada una ajustada al tiempo que tardó el hablante en decirla, para que la nueva voz empiece y acabe con sus labios.

  4. 04

    Hablar y comprobar

    Higgs TTS clona la voz a partir de una frase limpia del original y dice cada línea con el tono en que se dijo, deducido de las palabras y del volumen y la velocidad del hablante. Cada frase se vuelve a transcribir y se regenera si se desvió, y luego se repite o se estira ligeramente hasta durar lo mismo que la original.