오픈 소스 · 로컬 우선 · Higgs Audio, ElevenLabs 외

내 영상을, 어떤 언어로든, 내 목소리로.

한 언어로 된 영상을 올리고 바꿀 언어를 고르세요. OpenDub은 말소리와 음악을 분리하고, 받아쓰고, 문장마다 그 순간에 맞는 길이로 번역한 뒤, 원래 목소리를 복제해 다시 말합니다. 그리고 새 언어의 자막을 영상에 새겨 넣습니다.

  • 오픈 소스. 모든 단계가 읽고, 실행하고, 갈아 끼울 수 있는 코드입니다.
  • 음성 모델만 빼면 전부 로컬. 분리, 음성 검출, 타이밍, 믹싱, 렌더링이 내 기기에서 돌아갑니다. 영상은 기기를 벗어나지 않고, 선택한 음성 모델에는 말소리 클립과 텍스트만 전송됩니다.
  • 강력합니다. 복제한 내 목소리로 17개 언어를, 문장마다 입 모양에 맞춘 길이로, 놀람이나 열의, 차분함 같은 어조까지 담아 말합니다.
목소리
기타 설정 복제 목소리 · 문장별 어조 일치
OmniVoice는 무료이고 로컬에서 돌아가지만 더 느리며 비상업적 용도 전용입니다. 또는 Higgs 프리셋 목소리를 고르세요.
말의 내용과, 각 문장을 얼마나 크고 빠르게 말했는지에서 읽어 냅니다.

말하기 속도는 설정이 아닙니다. 문장마다 화자와 함께 시작하고 끝나도록 자동으로 정해집니다.

「목소리 교체」는 음악과 효과음을 남기고 말소리만 바꿉니다. 「보이스오버」는 원음을 아래에 희미하게 남깁니다.

작동 방식

네 개의 모델이, 저마다 가장 잘하는 한 가지를 맡습니다.

  1. 01

    분리

    Demucs가 말소리를 음악·효과음에서 떼어 냅니다. 덕분에 사운드트랙은 더빙 뒤에도 그대로 남고, 아래의 모든 모델은 깨끗한 목소리를 듣습니다.

  2. 02

    듣기

    Silero VAD가 말소리를 찾아냅니다. Higgs STT가 어떤 언어로 말했든 그대로 받아쓰고, 로컬 Whisper는 단어 단위로 맞춘 타이밍만 제공합니다.

  3. 03

    길이에 맞춰 번역

    Higgs 챗 모델이 문장 단위로 번역하되, 화자가 그 말을 하는 데 걸린 시간에 맞춰 길이를 잡습니다. 그래서 새 목소리가 화자의 입과 함께 시작하고 멈춥니다.

  4. 04

    말하고, 확인하기

    Higgs TTS가 원본의 깨끗한 문장 하나에서 목소리를 복제하고, 말의 내용과 화자의 성량·속도에서 읽어 낸 어조 그대로 각 문장을 말합니다. 문장마다 다시 받아써서 확인하고, 어긋났으면 다시 만든 뒤, 원본 길이에 맞도록 다시 말하거나 살짝 늘립니다.