Что это за задача
Озвучка текста — это когда у вас есть написанный текст (реклама, статья, реплика персонажа, объявление) и нужен файл с речью, которую можно вставить в видео, подкаст, ролик для соцсетей или использовать как есть. Результат — готовый аудиофайл, который можно скачать и использовать без монтажа голоса вживую.
Сюда попадает сразу несколько сценариев: озвучка рекламного ролика, начитка статьи для аудиоверсии, реплики персонажа в игре, голосовое сообщение для рассылки. В большинстве случаев достаточно готового голоса из библиотеки — записывать что-то самому не требуется.
Ниже — как выбрать модель и режим и как собрать текст, чтобы озвучка звучала естественно, а не как робот с ровным тоном.
Что понадобится
В Synty для озвучки текста доступны две модели:
- Fish Audio S2.1 Pro — основной инструмент: библиотека голосов, 83 языка, контроль темпа, плюс отдельные режимы для создания и клонирования голоса. Озвучка текста стоит 150 SC за 1000 символов.
- ElevenLabs TTS — три варианта качества: Turbo (от 250 SC за 1000 символов, быстро и дешевле), Multilingual (500 SC за 1000 символов, выше качество и точнее интонации) и Dialogue (500 SC за 1000 символов, для реплик с выраженной эмоциональной подачей).
Цена всегда считается блоками по 1000 символов с округлением вверх: текст на 1200 символов оплачивается как два блока, а не как 1.2. Итоговую сумму в SC вы видите до запуска генерации. Время ожидания зависит от длины текста — статус запроса виден прямо в интерфейсе.
Три разные задачи — не перепутайте
Здесь чаще всего путаются: это три разных инструмента с разной ценой и разным результатом.
Озвучка текста готовым голосом. Вы пишете текст и выбираете голос из готовой библиотеки — мужской или женский, разного возраста и стиля подачи. Ничего создавать не нужно, это базовый и самый дешёвый вариант. Подходит для 90% задач: реклама, статья, объявление, реплика без привязки к конкретному человеку.
Создание своего голоса по описанию. Вы не даёте образец записи, а словами описываете, каким должен быть голос — тембр, характер, манера речи. Модель создаёт новый голос с нуля по этому описанию. Нужен, когда в библиотеке нет подходящего варианта, а конкретного человека, чей голос нужно скопировать, у вас нет. В Fish Audio S2.1 Pro режим называется «Голос по описанию» и стоит 50 SC отдельно от последующей озвучки.
Клонирование голоса по образцу записи. У вас есть аудио конкретного человека — своё или чужое (с согласия) — и нужно, чтобы синтезированный текст звучал именно этим голосом. Это единственный способ повторить существующий, узнаваемый голос, а не подобрать похожий. Режим «Клонировать голос» стоит 200 SC. Чем чище образец — без музыки, шума и посторонних голосов — тем точнее клон; это влияет на сходство сильнее, чем любые настройки после.
Коротко: приятный голос для ролика — первый вариант. Голоса нет в библиотеке и записи ни у кого нет — второй. Есть запись конкретного человека и нужно повторить именно его — третий.
Ограничения — до того, как начнёте
- Тарификация идёт блоками по 1000 символов с округлением вверх. Несколько коротких фрагментов выгоднее объединить в один запрос, чем отправлять по отдельности — иначе на каждом блоке будет переплата за округление.
- Модель не понимает описания эмоций словами внутри текста. Фразы вроде «сказал он грустно» или «(смеётся)» будут прочитаны вслух буквально, а не сыграны голосом. Эмоция передаётся тем, как написан текст — длиной фраз, темпом, тем, где стоит пауза, — а не подписью к нему.
- У режима клонирования нет гарантии идеального совпадения на слабом или зашумлённом образце — модель ориентируется на то, что реально слышно.
- Голос иногда может немного сместить тон в середине длинной генерации — это особенность модели, не управляемая настройками. Проще перегенерировать, чем подгонять параметры.
- Если генерация не завершилась успешно, списанные SC возвращаются на баланс автоматически.
Пошагово
- Определите задачу. Готовый голос, новый по описанию или клон конкретного человека — от этого зависит режим (см. раздел выше).
- Выберите модель. Fish Audio S2.1 Pro — библиотека голосов плюс, возможно, клонирование или создание голоса в одном месте. ElevenLabs TTS — если приоритет на качество интонации (Multilingual) или диалог с несколькими репликами (Dialogue).
- Вставьте текст. Проверьте орфографию и пунктуацию заранее — модель озвучивает текст буквально, включая опечатки, и это слышно в результате.
- Выберите голос. В библиотеке голоса размечены по полу, возрасту и сфере применения. Ищите голос под задачу, а не первый попавшийся.
- Настройте параметры, если они есть. Темп, громкость, тон — не обязательны, но помогают подогнать голос под контекст.
- Проверьте стоимость. До запуска вы видите число символов и итоговую сумму в SC с учётом округления по блокам.
- Запустите синтез. Готовый файл доступен по прямой ссылке — вы можете сразу его скачать.
Разбор запроса
Пример текста для озвучки рекламного ролика:
ТЕКСТ. Открыли новую кофейню на Малой Ордынке. Свежая обжарка каждое утро,
никакого концентрата. Первый напиток — за наш счёт, просто покажите это
сообщение бариста.
ПОДАЧА. Голос мужской, тон дружелюбный, темп чуть быстрее разговорного.
Уверенно, но без напора и без интонаций телемагазина.
АКЦЕНТЫ. Ключевую мысль про бесплатный напиток выделить паузой перед ней,
а не громкостью. Адрес и слово «бариста» проговорить отчётливо, окончания
не глотать.
ТЕХНИЧЕСКОЕ. Ровная громкость, без фонового шума и музыки, паузы между
предложениями короткие.
Построчный разбор:
- ТЕКСТ — то, что будет озвучено дословно. Без него генерировать нечего; это единственный обязательный блок.
- ПОДАЧА — задаёт общий характер звучания: пол голоса выбирается в библиотеке, а тон и темп можно закрепить словами прямо в запросе, если подходящей настройки нет в интерфейсе. Без этого блока модель возьмёт нейтральную подачу по умолчанию — может не совпасть с задачей.
- АКЦЕНТЫ — подсказка, где по смыслу важна пауза или чёткость, а не команда «повысь голос здесь». Если убрать блок, вся речь прозвучит ровно, без выделения ключевой мысли — реклама потеряется в общем потоке.
- ТЕХНИЧЕСКОЕ — про формат звука, а не про содержание. Без него результат обычно нормальный, но блок полезен, если нужен чистый голос без пауз для последующего монтажа.
Для начитки статьи или реплики персонажа логика та же — меняется содержание блоков: вместо «АКЦЕНТЫ» может быть «СТРУКТУРА» с паузами между смысловыми частями, а вместо описания тона — указание, что эмоция должна быть слышна в темпе и дыхании, а не в подписанных ремарках вроде «зло» или «испуганно».
Типичные проблемы
| Симптом | Причина | Что сделать |
|---|---|---|
| Голос читает вслух ремарки эмоций («сказал он грустно») | Эмоция описана словами в тексте, а не показана через темп и паузы | Уберите ремарку из текста, передайте настроение длиной фраз и расстановкой пауз |
| Итоговая сумма SC больше, чем ожидали за короткий текст | Тарификация идёт блоками по 1000 символов с округлением вверх | Объединяйте несколько коротких фрагментов в один запрос вместо серии мелких |
| Числа и сокращения звучат криво или невнятно | Модель воспроизводит цифры и аббревиатуры не всегда так, как ожидается при чтении вслух | Запишите числа словами, аббревиатуры — так, как они реально произносятся |
| Тон голоса заметно меняется в середине длинного аудио | Особенность модели, не связанная с настройками | Перегенерируйте запрос — обычно повторный результат стабильнее |
| Клон звучит не похоже на оригинал, «роботизированно» | Слабый или зашумлённый образец записи | Используйте чистую запись без музыки, эха и посторонних голосов — от этого сходство зависит сильнее всего |
| Генерация не завершилась, файла нет | Сбой на стороне модели при обработке запроса | Списанные SC возвращаются на баланс автоматически — попробуйте запустить синтез заново |
Чек-лист перед публикацией результата
- Текст перед отправкой проверен на орфографию и пунктуацию, включая букву «ё» — это напрямую слышно в озвучке.
- Числа записаны словами, а не цифрами.
- В тексте нет ремарок эмоций словами — настроение задано темпом и паузами.
- Файл прослушан целиком, а не только начало — на случай смены тона в середине.
- Голос по полу, возрасту и подаче соответствует задаче и аудитории.
- Итоговая стоимость сверена по числу блоков в 1000 символов до запуска.
- Готовый файл скачан по прямой ссылке и сохранён отдельно от истории генераций.
Что дальше
Если нужно наоборот — превратить аудиозапись в текст, это отдельная задача распознавания речи, доступная в Fish Audio S2.1 Pro (режим «Речь → Текст»). Для готовых заготовок промптов под озвучку в библиотеке есть каркасы «Дикторская озвучка рекламы», «Начитка статьи — подкаст-формат» и «Характерный голос персонажа» — можно взять за основу и подставить свой текст вместо шаблонных блоков.