KORDAR
написатьwrite

008CLI 11.2025

AI Video Dubber

Пайплайн дубляжа с клонированием голоса

A dubbing pipeline with voice cloning

Видео на чужом языке возвращается с вашим собственным голосом. Один скрипт — от извлечения дорожки до сборки.

Video in a language you do not speak comes back in your own voice. One script, from pulling the track to the final cut.

задачаproblem

Профессиональный дубляж стоит дорого и делается днями. Субтитры — компромисс: пока читаешь, картинку не смотришь.

Professional dubbing is expensive and takes days. Subtitles are a compromise: while you read them you are not watching the picture.

решениеapproach

Пайплайн вынимает дорожку через FFmpeg, расшифровывает её Whisper с таймкодами, переводит дословно, синтезирует речь клонированным голосом через ElevenLabs и собирает видео обратно. Всё это — один запуск.

The pipeline pulls the track with FFmpeg, transcribes it with Whisper keeping timecodes, translates literally, synthesises speech in a cloned voice through ElevenLabs and assembles the video again. All of it in one run.

стекstack

  • Python
  • OpenAI Whisper API
  • ElevenLabs API
  • FFmpeg

что умеетwhat it does

  • Извлечение звуковой дорожки через FFmpegAudio track extraction with FFmpeg
  • Расшифровка через OpenAI Whisper с таймкодамиTranscription through OpenAI Whisper with timecodes
  • Дословный перевод сегментовLiteral translation of each segment
  • Клонирование голоса через ElevenLabsVoice cloning through ElevenLabs
  • Синтез с сохранением интонацииSynthesis that keeps the intonation
  • Автоматическая сборка готового видеоAutomatic assembly of the finished video
  • Один скрипт — весь пайплайнOne script — the whole pipeline

архитектураarchitecture

Input: video.mp4
  ↓ FFmpeg
extracted audio.wav
  ↓ OpenAI Whisper API
transcription (timestamped segments)
  ↓ translation
translated text
  ↓ ElevenLabs API (voice clone)
synthesised audio.wav (cloned voice)
  ↓ FFmpeg (merge)
Output: dubbed_video.mp4