ElevenLabs. Голос вашего дела. От первой кнопки до собственного голосового агента

- -
- 100%
- +
«Звучит как робот, хотя я ничего не менял».
«Голос читает номер телефона слитно, а сумму — как набор цифр».
«Каждый раз получается по-разному, я не могу повторить удачный дубль».
«Не понимаю, какую модель выбрать из четырёх».
Шаг первый: выбрать модельМодель — это движок синтеза. Их несколько, и они не «лучше-хуже», а «для разного».

Табл. 3.1— Модели синтеза речи и их сильные стороны. Полный перечень — в справочнике моделей.
ПРАВИЛО ВЫБОРА В ОДНУ СТРОКУ

Шаг второй: выбрать голос
Голос влияет на результат сильнее любой настройки. Плохой голос с идеальными ползунками звучит хуже, чем хороший голос с настройками по умолчанию. Подробно про поиск и создание голосов — глава 5; пока просто откройте библиотеку и отберите три-четыре кандидата, прослушав их на одной и той же фразе из вашего реального текста.
Слушайте кандидатов на своём тексте, а не на демонстрационном. Голос, идеально читающий рекламу автомобиля, может рассыпаться на медицинской терминологии.
Шаг третий: настройкиВ панели справа четыре регулятора. Рекомендованная официальной документацией отправная точка: стабильность около 50, сходство около 75, стиль 0.

Рис. 3.1— Регуляторы голоса в TexttoSpeech. SpeakerBoost— пятый, дополнительный переключатель: слегка усиливает сходство ценой задержки, разница обычно едва слышна.
Почему два одинаковых запроса звучат по-разномуСинтез недетерминирован. Настройки задают не точку, а диапазон допустимой случайности— примерно как живой актёр, читающий один и тот же текст дважды. Чем ниже стабильность, тем шире разброс. Если нужен воспроизводимый результат, работайте через API с параметром seed — но и он даёт лишь близкое, а не побитово идентичное совпадение.
Шаг четвёртый: подготовить текстСамая недооценённая часть работы. Модель читает то, что видит, — и на сложных конструкциях спотыкается. Крупные модели справляются лучше: Multilingual v2 прочитает «$1 000 000» как «один миллион долларов», а Flash v2.5 — как «одна тысяча тысяч долларов».
Опасные места
Табл. 3.2— Нормализация текста перед озвучкой: типичные ловушки и их обход.
Переписывать всё вручную не обязательно — эту работу можно поручить языковой модели. Промт ниже проверен и работает в любом чат-ассистенте.
ВАЖНО: ДАЛЕЕ В КНИГЕ ВЫ УВИДЕТЕ ПРОМТЫ, КОТОРЫЕ МОЖНО ИСПОЛЬЗОВАТЬ В РАБОТЕ.
ТЕКСТ /ПРОМТА/ ВЫДЕЛЯЕТСЯ КОСЫМИ ЛИНИЯМИ.
ВСТАВЛЯТЬ В ЗАПРОС ТЕКСТ НУЖНО БЕЗ /КОСЫХ ЛИНИЙ/, ЧТОБЫ ЗАПРОС РАБОТАЛ КОРРЕКТНО.
📝Промт 3.1 · Нормализация текста под озвучку
ПОДГОТОВКА
/Преобразуй текст ниже в формат, пригодный для синтеза речи. Правила:
1. Все числа, суммы, даты, время и телефоны запиши словами так, как их произносит носитель русского языка.
2. Аббревиатуры раскрой или запиши по буквам через дефис (например: ООО О-О-О), сохранив узнаваемость.
3. Замени символы валют, процентов и математические знаки словами.
4. Ссылки и адреса электронной почты перепиши произносимо.
5. Не сокращай и не пересказывай текст — только переформатируй.
6. Сохрани абзацы и знаки препинания.
Верни только готовый текст, без пояснений.
ТЕКСТ:
"""
[вставьте сюда ваш текст]
"""/
Экономит 10–15 минут вычитки на каждой странице и убирает большинство ошибок произношения ещё до генерации.
Длинные тексты: как не потерятьинтонацию
Модель v3 принимает до 5000 символов за раз, Multilingual v2 — до 10 000. Длинный материал приходится резать. Три правила:
Режьте по смыслу, а не по счётчику.Граница куска должна совпадать с концом абзаца или сцены.
Не начинайте кусок с местоимения или союза.Модель не знает, что было до, и поставит неверную интонацию.
При работе через APIпередавайте соседние кускив параметрах previous_text и next_text — тогда интонация на швах не рвётся.
Форматы выводаДоступны MP3 разного качества, WAV/PCM, μ-law и Opus. На бесплатном тарифе выдаётся MP3 128 кбит/с — этого достаточно для соцсетей. Для монтажа в видеоредакторе или для последующей обработки берите WAV (доступен с Pro). Для телефонии применяют μ-law 8 кГц — он звучит хуже, зато совместим с АТС.
ЧАСТАЯ ОШИБКА НОВИЧКА
Сгенерировать сразу весь двадцатиминутный текст, услышать в третьей минуте неверное ударение и запустить всё заново. Проверяйте настройки на абзаце в 200–300 символов: это стоит 300 кредитов вместо 20 000.
Мини-практикум: озвучка ролика на 60 секунд1. Напишите или возьмите текст на 900–1000 знаков — это примерно минута речи.
2. Прогоните его через промт 3.1.
3. Возьмите первый абзац, выберите три голоса-кандидата и сгенерируйте по одной версии каждым.
4. Выберите победителя. Поставьте стабильность 50, сходство 75, стиль 0.
5. Сгенерируйте весь текст. Прослушайте и отметьте фразы, которые звучат не так.
6. Исправьте текств этих местах, а не ползунки. В девяти случаях из десяти проблема в тексте.
ЗАДАНИЯ ДЛЯ ЗАКРЕПЛЕНИЯ
1. Возьмите абзац со своей работы или учёбы, где есть числа, дата и аббревиатура. Озвучьте «как есть», послушайте. Затем прогоните через промт 3.1 и озвучьте снова. Запишите, сколько ошибок исчезло.
2. Один и тот же текст озвучьте трижды: стабильность 20, 50 и 85. Опишите словами, как менялась подача. Определите, какое значение подходит вашему жанру.
3. Сравните Eleven v3 и Multilingual v2 на тексте с большим количеством цифр. Отметьте, где различие заметно.
4. Разрежьте текст на 4000 знаков на три части по смыслу и озвучьте по очереди. Склейте в любом аудиоредакторе и проверьте, слышны ли швы.
ЧЕК-ЛИСТ ГЛАВЫ 3
Модель выбрана осознанно под задачу, а не оставлена по умолчанию
Голос отобран прослушиванием на моём реальном тексте
Стабильность 50 / сходство 75 / стиль 0 — как стартовая точка
Текст нормализован: числа, даты, аббревиатуры, ссылки
Настройки проверены на коротком фрагменте до полной генерации
Длинный текст разрезан по смыслу, а не по лимиту символов
Формат вывода соответствует назначению (MP3 для сети, WAV для монтажа)
Глава 4
Язык аудиотегов: промт-инжиниринг для голоса
Самая практичная глава книги. После
Конец ознакомительного фрагмента.
Текст предоставлен ООО «Литрес».
Прочитайте эту книгу целиком, купив полную легальную версию на Литрес.
Безопасно оплатить книгу можно банковской картой Visa, MasterCard, Maestro, со счета мобильного телефона, с платежного терминала, в салоне МТС или Связной, через PayPal, WebMoney, Яндекс.Деньги, QIWI Кошелек, бонусными картами или другим удобным Вам способом.



