База знаний
Звук и музыка

Как озвучить текст голосом

8 мин чтения

Что это за задача

Озвучка текста — это когда у вас есть написанный текст (реклама, статья, реплика персонажа, объявление) и нужен файл с речью, которую можно вставить в видео, подкаст, ролик для соцсетей или использовать как есть. Результат — готовый аудиофайл, который можно скачать и использовать без монтажа голоса вживую.

Сюда попадает сразу несколько сценариев: озвучка рекламного ролика, начитка статьи для аудиоверсии, реплики персонажа в игре, голосовое сообщение для рассылки. В большинстве случаев достаточно готового голоса из библиотеки — записывать что-то самому не требуется.

Ниже — как выбрать модель и режим и как собрать текст, чтобы озвучка звучала естественно, а не как робот с ровным тоном.

Что понадобится

В Synty для озвучки текста доступны две модели:

  • Fish Audio S2.1 Pro — основной инструмент: библиотека голосов, 83 языка, контроль темпа, плюс отдельные режимы для создания и клонирования голоса. Озвучка текста стоит 150 SC за 1000 символов.
  • ElevenLabs TTS — три варианта качества: Turbo (от 250 SC за 1000 символов, быстро и дешевле), Multilingual (500 SC за 1000 символов, выше качество и точнее интонации) и Dialogue (500 SC за 1000 символов, для реплик с выраженной эмоциональной подачей).

Цена всегда считается блоками по 1000 символов с округлением вверх: текст на 1200 символов оплачивается как два блока, а не как 1.2. Итоговую сумму в SC вы видите до запуска генерации. Время ожидания зависит от длины текста — статус запроса виден прямо в интерфейсе.

Три разные задачи — не перепутайте

Здесь чаще всего путаются: это три разных инструмента с разной ценой и разным результатом.

Озвучка текста готовым голосом. Вы пишете текст и выбираете голос из готовой библиотеки — мужской или женский, разного возраста и стиля подачи. Ничего создавать не нужно, это базовый и самый дешёвый вариант. Подходит для 90% задач: реклама, статья, объявление, реплика без привязки к конкретному человеку.

Создание своего голоса по описанию. Вы не даёте образец записи, а словами описываете, каким должен быть голос — тембр, характер, манера речи. Модель создаёт новый голос с нуля по этому описанию. Нужен, когда в библиотеке нет подходящего варианта, а конкретного человека, чей голос нужно скопировать, у вас нет. В Fish Audio S2.1 Pro режим называется «Голос по описанию» и стоит 50 SC отдельно от последующей озвучки.

Клонирование голоса по образцу записи. У вас есть аудио конкретного человека — своё или чужое (с согласия) — и нужно, чтобы синтезированный текст звучал именно этим голосом. Это единственный способ повторить существующий, узнаваемый голос, а не подобрать похожий. Режим «Клонировать голос» стоит 200 SC. Чем чище образец — без музыки, шума и посторонних голосов — тем точнее клон; это влияет на сходство сильнее, чем любые настройки после.

Коротко: приятный голос для ролика — первый вариант. Голоса нет в библиотеке и записи ни у кого нет — второй. Есть запись конкретного человека и нужно повторить именно его — третий.

Ограничения — до того, как начнёте

  • Тарификация идёт блоками по 1000 символов с округлением вверх. Несколько коротких фрагментов выгоднее объединить в один запрос, чем отправлять по отдельности — иначе на каждом блоке будет переплата за округление.
  • Модель не понимает описания эмоций словами внутри текста. Фразы вроде «сказал он грустно» или «(смеётся)» будут прочитаны вслух буквально, а не сыграны голосом. Эмоция передаётся тем, как написан текст — длиной фраз, темпом, тем, где стоит пауза, — а не подписью к нему.
  • У режима клонирования нет гарантии идеального совпадения на слабом или зашумлённом образце — модель ориентируется на то, что реально слышно.
  • Голос иногда может немного сместить тон в середине длинной генерации — это особенность модели, не управляемая настройками. Проще перегенерировать, чем подгонять параметры.
  • Если генерация не завершилась успешно, списанные SC возвращаются на баланс автоматически.

Пошагово

  1. Определите задачу. Готовый голос, новый по описанию или клон конкретного человека — от этого зависит режим (см. раздел выше).
  2. Выберите модель. Fish Audio S2.1 Pro — библиотека голосов плюс, возможно, клонирование или создание голоса в одном месте. ElevenLabs TTS — если приоритет на качество интонации (Multilingual) или диалог с несколькими репликами (Dialogue).
  3. Вставьте текст. Проверьте орфографию и пунктуацию заранее — модель озвучивает текст буквально, включая опечатки, и это слышно в результате.
  4. Выберите голос. В библиотеке голоса размечены по полу, возрасту и сфере применения. Ищите голос под задачу, а не первый попавшийся.
  5. Настройте параметры, если они есть. Темп, громкость, тон — не обязательны, но помогают подогнать голос под контекст.
  6. Проверьте стоимость. До запуска вы видите число символов и итоговую сумму в SC с учётом округления по блокам.
  7. Запустите синтез. Готовый файл доступен по прямой ссылке — вы можете сразу его скачать.

Разбор запроса

Пример текста для озвучки рекламного ролика:

ТЕКСТ. Открыли новую кофейню на Малой Ордынке. Свежая обжарка каждое утро,
никакого концентрата. Первый напиток — за наш счёт, просто покажите это
сообщение бариста.

ПОДАЧА. Голос мужской, тон дружелюбный, темп чуть быстрее разговорного.
Уверенно, но без напора и без интонаций телемагазина.

АКЦЕНТЫ. Ключевую мысль про бесплатный напиток выделить паузой перед ней,
а не громкостью. Адрес и слово «бариста» проговорить отчётливо, окончания
не глотать.

ТЕХНИЧЕСКОЕ. Ровная громкость, без фонового шума и музыки, паузы между
предложениями короткие.

Построчный разбор:

  • ТЕКСТ — то, что будет озвучено дословно. Без него генерировать нечего; это единственный обязательный блок.
  • ПОДАЧА — задаёт общий характер звучания: пол голоса выбирается в библиотеке, а тон и темп можно закрепить словами прямо в запросе, если подходящей настройки нет в интерфейсе. Без этого блока модель возьмёт нейтральную подачу по умолчанию — может не совпасть с задачей.
  • АКЦЕНТЫ — подсказка, где по смыслу важна пауза или чёткость, а не команда «повысь голос здесь». Если убрать блок, вся речь прозвучит ровно, без выделения ключевой мысли — реклама потеряется в общем потоке.
  • ТЕХНИЧЕСКОЕ — про формат звука, а не про содержание. Без него результат обычно нормальный, но блок полезен, если нужен чистый голос без пауз для последующего монтажа.

Для начитки статьи или реплики персонажа логика та же — меняется содержание блоков: вместо «АКЦЕНТЫ» может быть «СТРУКТУРА» с паузами между смысловыми частями, а вместо описания тона — указание, что эмоция должна быть слышна в темпе и дыхании, а не в подписанных ремарках вроде «зло» или «испуганно».

Типичные проблемы

СимптомПричинаЧто сделать
Голос читает вслух ремарки эмоций («сказал он грустно»)Эмоция описана словами в тексте, а не показана через темп и паузыУберите ремарку из текста, передайте настроение длиной фраз и расстановкой пауз
Итоговая сумма SC больше, чем ожидали за короткий текстТарификация идёт блоками по 1000 символов с округлением вверхОбъединяйте несколько коротких фрагментов в один запрос вместо серии мелких
Числа и сокращения звучат криво или невнятноМодель воспроизводит цифры и аббревиатуры не всегда так, как ожидается при чтении вслухЗапишите числа словами, аббревиатуры — так, как они реально произносятся
Тон голоса заметно меняется в середине длинного аудиоОсобенность модели, не связанная с настройкамиПерегенерируйте запрос — обычно повторный результат стабильнее
Клон звучит не похоже на оригинал, «роботизированно»Слабый или зашумлённый образец записиИспользуйте чистую запись без музыки, эха и посторонних голосов — от этого сходство зависит сильнее всего
Генерация не завершилась, файла нетСбой на стороне модели при обработке запросаСписанные SC возвращаются на баланс автоматически — попробуйте запустить синтез заново

Чек-лист перед публикацией результата

  • Текст перед отправкой проверен на орфографию и пунктуацию, включая букву «ё» — это напрямую слышно в озвучке.
  • Числа записаны словами, а не цифрами.
  • В тексте нет ремарок эмоций словами — настроение задано темпом и паузами.
  • Файл прослушан целиком, а не только начало — на случай смены тона в середине.
  • Голос по полу, возрасту и подаче соответствует задаче и аудитории.
  • Итоговая стоимость сверена по числу блоков в 1000 символов до запуска.
  • Готовый файл скачан по прямой ссылке и сохранён отдельно от истории генераций.

Что дальше

Если нужно наоборот — превратить аудиозапись в текст, это отдельная задача распознавания речи, доступная в Fish Audio S2.1 Pro (режим «Речь → Текст»). Для готовых заготовок промптов под озвучку в библиотеке есть каркасы «Дикторская озвучка рекламы», «Начитка статьи — подкаст-формат» и «Характерный голос персонажа» — можно взять за основу и подставить свой текст вместо шаблонных блоков.