Instant-клон в ElevenLabs с голоса ведущего «Кинопоиска» — проверяем, тянет ли этот тембр спокойную вдумчивую подачу на русском и английском.
Голос снят с ролика «Кинопоиска» про Netflix и кино, клонирован в ElevenLabs и прогнан на двух самостоятельно написанных фразах — русской и английской — без смены voice_id.
Клон снят с 60 секунд только русской речи. Когда тем же voice_id генерится английский текст напрямую (eleven_multilingual_v2), модель реконструирует английские фонемы через призму русской подачи оригинала — акцент слышен. Это системная особенность instant-клонов на одноязычном сэмпле, не баг конкретной генерации.
Ниже — оба варианта для честного сравнения: первый прогон «в лоб» (с акцентом) и исправленный через Speech-to-Speech.
«Есть фильмы, которые не рассказывают историю, а оставляют после себя тишину. И в этой тишине, если прислушаться, вдруг узнаёшь самого себя.»
7.8 секунды · eleven_multilingual_v2
«Every ruin was once someone's home. We walk through the wreckage searching for meaning, tracing fingers over stone that no one remembers naming, as if beauty was always hiding in what got left behind.»
11.7 секунды · eleven_multilingual_sts_v2 (Speech-to-Speech)
Как получено: нейтивный английский голос (премейд-диктор ElevenLabs) начитал ту же фразу с правильным произношением → прогнан через Speech-to-Speech в наш voice_id — тембр перенесён на клон, произношение осталось нейтивным.
«Every ruin was once someone's home. We walk through the wreckage searching for meaning, tracing fingers over stone that no one remembers naming, as if beauty was always hiding in what got left behind.»
9.2 секунды · eleven_multilingual_v2, прямой кросс-язык — слышен русский акцент
voice_id: mHTHoLso8VWtnUcq17pt · аккаунт ElevenLabs (рабочий, ключ в ~/.claude/.accounts/elevenlabs.env)
EL=~/ai-system/.claude/skills/voice-clone-channel/helpers/el.py
python3 $EL tts mHTHoLso8VWtnUcq17pt out.mp3 \
--text "Твой текст" --preset narrator
# длинный сценарий из файла, с нарезкой на предложения:
python3 $EL tts mHTHoLso8VWtnUcq17pt out.mp3 \
--text-file script.txt --preset calm --chunk
Пресеты интонации (один и тот же клон, разный «характер» подачи):
Прямой TTS кросс-языка с одноязычного клона тащит акцент оригинала. Чтобы получить чистое произношение на другом языке тем же голосом — два шага:
EL=~/ai-system/.claude/skills/voice-clone-channel/helpers/el.py
# 1. нейтивный голос той же интонации начитывает текст правильным произношением
python3 $EL tts nPczCjzI2devNBz1zQrb source.mp3 \
--text "Твой текст на целевом языке" --preset narrator
# 2. Speech-to-Speech переносит тембр клона на эту подачу
python3 $EL sts mHTHoLso8VWtnUcq17pt source.mp3 out.mp3 --preset narrator
Нейтивный источник может быть любым премейд-голосом ElevenLabs подходящей интонации на нужном языке — nPczCjzI2devNBz1zQrb (Brian) использован здесь как пример.
Это instant-клон (черновик) — обучен на паре минут исходника, тембр и интонации приблизительные. Для финального голоса канала нужен PVC (Professional Voice Clone) на длинном чистом материале — а это доступно только на тарифе Creator+, выше текущего.
Формат синтеза сейчас — 128 kbps (192 kbps тоже требует Creator+). Выборка теста — 2 фразы, этого достаточно чтобы понять направление тембра, но не чтобы утверждать финальный кастинг канала.