
Как сделать русскую озвучку в Seedance 2.5, простое правило которое работает
Seedance 2.5 умеет озвучивать ролики, но стоит написать реплику русскими буквами, и персонаж начинает бормотать что-то невнятное. Разбираем простое правило, которое решает эту проблему за пару секунд, и показываем, как настроить звук прямо в интерфейсе unitool.ai.
Почему Seedance плохо говорит по-русски
Seedance 2.5 создаёт ролик длиной до 30 секунд за одну генерацию и сразу со звуком, мы подробно разбирали её возможности в отдельной статье про эту модель. Модель сама озвучивает речь, шумы и музыку по смыслу промпта, и это её большое преимущество перед конкурентами.
Но есть нюанс, с которым сталкивается каждый русскоязычный пользователь. Пишешь в промпте реплику кириллицей, например «Ты готов?», и на выходе получаешь либо невнятное бормотание, либо речь с таким акцентом, что слова не разобрать. Ролик приходится переделывать, токены уходят впустую, и складывается впечатление, что модель просто не умеет делать русский язык.
На самом деле умеет. Просто ей нужно объяснить задачу на понятном ей языке, и делается это одной простой заменой, о которой дальше и пойдёт речь.
Главное правило, пиши латиницей так, как звучит
Всё правило умещается в одну строку. Русские реплики в промпте пишутся латинскими буквами, причём не по правилам транслитерации, а так, как фраза звучит вслух.
Не «Ты готов?», а Ty gotov?
Не «Да-да! Точно!», а Da-da! Tochno!
Логика тут простая. Модель воспринимает текст в кавычках как инструкцию, что именно должен произнести персонаж, и опирается на латинские буквы как на фонетическую запись. Когда ты пишешь кириллицей, модель пытается угадать произношение и часто промахивается. Когда пишешь латиницей на слух, она читает ровно то, что видит.
Ключевое слово здесь именно «как звучит», а не «как пишется». Всё остальное в этом гайде крутится вокруг этого одного правила.
Что работает, а что нет
Практика показывает, что латиница сама по себе ещё не гарантия хорошего результата. Важно, насколько фраза удобна для произношения.
Вот примеры, которые стабильно получаются хорошо,
Просто и естественно,
Ty gotov?Короткие фразы,
Da-da! Tochno!Легко проговаривается,
Sekret v kommentariyakh!Чёткие команды,
Tri! Dva! Odin! Start!
А вот такое ломается почти всегда,
Длинные сложные предложения
Редкие и странные слова
Много слогов подряд без пауз
Фразы, которые тяжело произнести даже человеку
Показательный пример неудачной реплики выглядит так, Ozvuchka v SiDens na russkom vozmozhna?!. Формально всё по правилу, латиница на месте, но фраза перегружена согласными и слишком длинная, поэтому модель на ней спотыкается. Проверить легко, попробуй сам произнести реплику вслух, и если язык заплетается, у нейросети будет ровно та же проблема.
Как переделать фразу за четыре шага
Порядок действий простой, и после нескольких раз он входит в привычку.
Подумай. Проговори фразу вслух и послушай, как она реально звучит. Не как пишется в словаре, а как ты её произносишь в жизни.
Напиши. Запиши её латинскими буквами именно так, как услышал. Без оглядки на официальную транслитерацию и без попыток передать все буквы один в один.
Проверь. Прочитай получившуюся латинскую запись вслух ещё раз. Если читается легко и естественно, всё в порядке.
Упрости. Если фраза оказалась тяжёлой, сократи её или замени слова на более простые. Смысл важнее дословности.

Два примера превращения фразы
Теория понятнее на живых примерах, разберём два случая.
Простой случай. Берём фразу «Ты готов?». Проговариваем вслух и слышим что-то вроде «тай готов». Записываем латиницей, получается Ty gotov?. Фраза короткая, читается легко, упрощать ничего не нужно. Результат стабильно рабочий с первой попытки.
Сложный случай. Берём фразу «Озвучка в Seedance на русском возможна?». Проговариваем и понимаем, что звучит она громоздко, а латинская запись выходит и вовсе неудобной. Тут включается четвёртый шаг, упрощение. Сокращаем смысл до сути и получаем A na russkom mozhet?!. Смысл сохранён, произносить легко, модель справляется без проблем.
Отсюда золотое правило, чем короче фраза, тем лучше она генерируется. Оптимальная длина реплики составляет пять-семь слов, дальше качество начинает заметно падать.
Готовые шаблоны промптов
Чтобы не собирать всё с нуля, вот несколько готовых заготовок под частые задачи. Описание сцены пишется по-английски, реплика вставляется в кавычках и латиницей.
Обращение к зрителю в начале ролика
A young man looks directly into the camera in a bright modern room and says "Ty gotov?"
Отсчёт перед действием
A girl stands on a rooftop at sunset, raises her hand and counts "Tri! Dva! Odin! Start!"
Призыв к действию в конце ролика
A man smiles at the camera, points to the side and says "Podpishis! Budet interesno!"
Короткий диалог двух персонажей
Two friends sit at a cafe table. The first one asks "Ty gotov?", the second one nods and answers "Da-da! Tochno!"
Схема одинаковая во всех случаях. Сначала описываешь, кто в кадре и что происходит, потом ставишь реплику в кавычках. Модель сама подберёт интонацию под настроение сцены, поэтому эмоцию удобнее задавать через описание действия, а не через саму реплику.
Как включить и настроить звук на unitool.ai
Теперь про практику. В интерфейсе Seedance 2.5 на нашем сайте за озвучку отвечает отдельный тумблер «Добавить звук» в правой панели настроек. Пока он выключен, модель выдаёт видео без звука вообще, поэтому первым делом включи его.

Под тумблером есть важная подсказка, которую многие пропускают. Модель озвучит ролик речью, шумами и музыкой по смыслу промпта, а реплики нужно брать в кавычки. Это принципиальный момент, именно кавычки говорят модели, что внутри находится прямая речь, а не описание сцены.
Обрати внимание на одну деталь. В самом промпте нужны обычные прямые кавычки, а не русские «ёлочки», иначе модель может не распознать границы реплики и просто зачитает её как часть описания.
Сколько это стоит и как не переплачивать
Стоимость генерации в интерфейсе считается заранее и показывается прямо под окном ввода, так что сюрпризов не будет. Складывается она из двух настроек.
Качество. Доступны 480p, 720p и 1080p, и чем выше качество, тем дороже обходится каждая секунда
Длительность. Ползунок работает в диапазоне от 4 до 30 секунд, а итоговая цена получается умножением длительности на стоимость секунды

Отсюда простой практический совет. Пока подбираешь формулировку реплики, ставь 480p и минимальную длительность, чтобы проверить, как модель произносит фразу. Когда транслитерация подобрана и звучит правильно, поднимай качество и длину до нужных и генерируй финальный вариант. Так на подбор уходит в разы меньше токенов.
Отдельно про референсное видео. Если ты продлеваешь или монтируешь ролик, тарифицируются секунды входа и выхода вместе, это тоже стоит учитывать при расчёте бюджета.
Частые ошибки, из-за которых ролик не получается
Помимо неудачной транслитерации есть ещё несколько причин, по которым генерация не запускается или выдаёт не то.
Известные персонажи. Запрос с героями фильмов или мультфильмов вернёт ошибку про ограничения авторских прав, такое модель не генерирует
Реальные лица. При загрузке изображения в поле первого кадра модель отклоняет фотографии реальных людей
Первый кадр вместе с референсами. Загруженное изображение первого кадра нельзя использовать одновременно с референсами, нужно выбрать что-то одно
Последний кадр отдельно. Он передаётся только вместе с первым кадром, сам по себе не работает
Соотношение сторон. При монтаже, продлении видео, а также при использовании первого или последнего кадра модель принимает только режим «Авто»

Большинство этих ошибок всплывает уже после списания токенов за попытку, поэтому настройки проще проверить заранее. Требования к загружаемым изображениям тоже стоит держать в голове, стороны от 300 до 6000 пикселей, соотношение от 0.4 до 2.5 и размер файла до 30 мегабайт.
Просто, коротко, латиницей
Весь секрет русской озвучки в Seedance 2.5 умещается в три слова. Никаких сложных конструкций, никаких длинных фраз, только латиница и запись на слух. Пять-семь слов в реплике, прямые кавычки вокруг речи, включённый тумблер звука, и модель заговорит по-русски внятно.
Приём этот работает не только в Seedance. Большинство видеомоделей обучались преимущественно на английских данных, поэтому фонетическая запись латиницей выручает и в других сервисах, где нужна русская речь. Стоит попробовать тот же подход везде, где модель спотыкается о кириллицу.
Проверить всё это можно прямо сейчас. Seedance 2.5 доступна на unitool.ai вместе с десятками других нейросетей для видео, изображений и звука, по одной подписке и без отдельной регистрации на каждой платформе. Начни с короткой тестовой фразы на 480p, подбери транслитерацию, а потом генерируй финальный ролик уже в нужном качестве.