Open Source · Läuft lokal · Higgs Audio, ElevenLabs und mehr

Ihr Video, in jeder Sprache, in Ihrer eigenen Stimme.

Laden Sie ein Video in einer Sprache hoch und wählen Sie eine andere. OpenDub trennt die Sprache von der Musik, schreibt sie mit, übersetzt jeden Satz passend zu seinem Moment und spricht ihn in einem Klon der Originalstimme wieder ein — und brennt anschließend Untertitel in der neuen Sprache ein.

  • Open Source. Jeder Schritt ist schlichter Code, den Sie lesen, ausführen und ersetzen können.
  • Lokal, bis auf die Stimmmodelle. Trennung, Sprachaktivitätserkennung, Timing, Mischung und Rendering laufen auf Ihrem Gerät. Ihr Video verlässt es nie — nur Sprachausschnitte und Text gehen an das Stimmmodell Ihrer Wahl.
  • Leistungsstark. Ihre eigene geklonte Stimme in 17 Sprachen, jede Zeile auf Ihre Lippen getimt und in Ihrem Tonfall — Überraschung, Begeisterung, Ruhe.
Stimme
Weitere Einstellungen Geklonte Stimme · Tonfall pro Zeile
OmniVoice ist kostenlos und lokal, aber langsamer und nur für nicht-kommerzielle Nutzung. Oder wählen Sie eine voreingestellte Higgs-Stimme.
Abgelesen aus den Worten und daraus, wie laut und schnell jede Zeile gesprochen wurde.

Das Sprechtempo ist keine Einstellung: Es wird pro Zeile so gewählt, dass jede Zeile zusammen mit der sprechenden Person beginnt und endet.

„Stimme ersetzen“ behält Musik und Effekte und tauscht nur die Sprache. Voice-over lässt das Original leise darunter stehen.

So funktioniert es

Vier Modelle, jedes für genau das, was es am besten kann.

  1. 01

    Trennen

    Demucs trennt die Sprache von Musik und Effekten, damit der Ton die Synchronisation übersteht und jedes folgende Modell eine saubere Stimme hört.

  2. 02

    Zuhören

    Silero VAD findet die gesprochenen Stellen. Higgs STT schreibt die Worte mit, in welcher Sprache sie auch gesagt werden; ein lokales Whisper liefert allein das Timing, Wort für Wort ausgerichtet.

  3. 03

    Passgenau übersetzen

    Das Higgs-Chatmodell übersetzt ganze Sätze, jeden so bemessen, wie lange die sprechende Person dafür gebraucht hat — damit die neue Stimme mit ihren Lippen einsetzt und aufhört.

  4. 04

    Sprechen, dann prüfen

    Higgs TTS klont die Stimme aus einem sauberen Satz des Originals und spricht jede Zeile in dem Tonfall, in dem sie gesagt wurde — abgelesen aus den Worten und daraus, wie laut und schnell gesprochen wurde. Jede Zeile wird zurücktranskribiert und neu erzeugt, wenn sie abgewichen ist, dann noch einmal gesprochen oder sanft gedehnt, bis sie zur ursprünglichen Länge passt.