Клонирование голоса на открытой модели: установка и первые команды
Открытая модель OmniVoice клонирует голос по короткому образцу и читает им текст на 600 с лишним языках. Внутри ссылка на проект, три способа попробовать без установки, порядок установки командами под копирование, разбор клонирования и создания голоса с нуля, плюс честные границы, о которых обычно узнают уже после установки.
Что это за инструмент и что он умеет
OmniVoice это открытая модель синтеза речи от команды k2-fsa. Она бесплатная, лежит на GitHub с лицензией Apache 2.0 и работает на твоём компьютере, поэтому подписки и оплаты за каждую минуту озвучки здесь нет вовсе.
- Клонирование голоса без обучения. Даёшь короткий образец записи, дальше модель читает этим голосом любой текст.
- Больше шестисот языков. Это самое широкое покрытие среди открытых моделей такого класса.
- Создание голоса по описанию, без образца вообще. Задаёшь пол, возраст, высоту, акцент, шёпот, и модель собирает голос под это описание.
- Живые мелочи речи. В текст можно вставлять пометки вроде смеха, и модель их отыгрывает.
- Работа пачкой. Список реплик озвучивается одним заходом, по одной запускать не нужно.
Три способа попробовать прямо сейчас, без установки
Перед установкой имеет смысл послушать результат на своём голосе. Для этого есть три готовых входа.
- Демо на HuggingFace: huggingface.co/spaces/k2-fsa/OmniVoice. Открываешь в браузере, грузишь свой образец, пишешь текст, слушаешь.
- Google Colab. В самом репозитории лежит готовый блокнот, он запускается в облаке и ничего не ставит на твой компьютер.
- Локальное веб-окно после установки, командой omnivoice-demo. Тот же интерфейс, но у себя и без очередей.
Установка на свой компьютер
Порядок такой. Сначала ставится сам движок расчётов под твою видеокарту, потом модель. Команды копируются целиком.
Шаг 1. Движок расчётов
Это вариант для компьютера без видеокарты NVIDIA. Видеокарта есть, ставь версию под неё, точная строка лежит на сайте pytorch.org в разделе Get Started.
Шаг 2. Сама модель
Шаг 3. Проверка
Команда поднимает веб-окно. Открой в браузере адрес localhost:8001 и озвучь любую фразу, это подтверждает, что установка прошла.
Клонирование голоса одной командой
Положи рядом файл с образцом, назови его ref.wav, и запусти команду. Меняй только текст в кавычках и имя итогового файла.
- --text это то, что будет сказано. Кавычки обязательны.
- --ref_audio это твой образец. Достаточно короткой чистой записи.
- --output это имя готового файла.
- Расшифровку образца можно не писать: модель распознает её сама. Хочешь точнее, добавь строку --ref_text с текстом образца дословно.
Голос с нуля, без образца
Когда своего голоса под задачу нет, голос собирается описанием. Это отдельный режим и отдельная команда.
В строку описания складываются пол, возраст, высота, темп, акцент и манера вплоть до шёпота. Меняй описание и слушай, подбор занимает несколько заходов.
Как подключить это к своему агенту
Отдельного разъёма для агентов у проекта нет, и это стоит знать заранее. Подключение делается через обычную команду, и работает оно ничуть не хуже.
- Поставь OmniVoice на ту же машину, где живёт агент.
- В файл правил проекта, тот самый CLAUDE.md, добавь строку: озвучка делается командой omnivoice-infer, образец голоса лежит по такому-то пути.
- Дальше проси агента словами: озвучь этот текст моим голосом и положи файл туда-то. Он соберёт команду сам.
Границы, о которых лучше знать заранее
- Образец записи должен быть на том же языке, на котором ты хочешь получить речь. Русский образец для английского текста даёт заметный акцент и плавающие интонации.
- Цифры модель читает неровно. Пиши числа словами либо включай авто-нормализацию текста, она ставится отдельной добавкой к пакету.
- Нужна видеокарта. На обычном процессоре синтез идёт, но заметно медленнее, для длинных текстов это неудобно.
- Чужой голос без разрешения человека использовать нельзя. Это касается и голосов известных людей, и голоса клиента, записанного на созвоне.
Чек-лист
- Послушал демо в браузере и результат устроил.
- Движок расчётов и сам пакет установлены, веб-окно открывается.
- Образец записан чисто, один голос, без музыки и эха.
- Первая команда клонирования отработала и файл получился.
- Описание голоса подобрано, если своего образца нет.
- Правило про команду озвучки записано в файл правил проекта.
Читать дальше в блоге
Эту тему я разбираю подробно в статье рабочий список нейросетей для контента. Там же лежат остальные разборы про нейросети.
Я собрал систему, по которой обычный человек запускает блог с нуля и набирает аудиторию без съёмок, монтажа и команды. Внутри разбор, с которого стартовал сам.
Открыть разбор: с чего начать→