Клонирование голоса на открытой модели: установка и первые команды

Открытая модель OmniVoice клонирует голос по короткому образцу и читает им текст на 600 с лишним языках. Внутри ссылка на проект, три способа попробовать без установки, порядок установки командами под копирование, разбор клонирования и создания голоса с нуля, плюс честные границы, о которых обычно узнают уже после установки.

Читается за 6 минут. Попробовать в браузере можно за пару минут, установка на свой компьютер занимает около получаса и требует видеокарты. Проект бесплатный, лицензия Apache 2.0.

Сначала пройди второй раздел и послушай, как модель звучит на твоём голосе, прямо в браузере. Понравится, ставь на свой компьютер по третьему разделу. Клонирование запускается одной командой из четвёртого раздела, голос с нуля собирается командой из пятого.

Что это за инструмент и что он умеет

OmniVoice это открытая модель синтеза речи от команды k2-fsa. Она бесплатная, лежит на GitHub с лицензией Apache 2.0 и работает на твоём компьютере, поэтому подписки и оплаты за каждую минуту озвучки здесь нет вовсе.

  1. Клонирование голоса без обучения. Даёшь короткий образец записи, дальше модель читает этим голосом любой текст.
  2. Больше шестисот языков. Это самое широкое покрытие среди открытых моделей такого класса.
  3. Создание голоса по описанию, без образца вообще. Задаёшь пол, возраст, высоту, акцент, шёпот, и модель собирает голос под это описание.
  4. Живые мелочи речи. В текст можно вставлять пометки вроде смеха, и модель их отыгрывает.
  5. Работа пачкой. Список реплик озвучивается одним заходом, по одной запускать не нужно.
Проект живой и обновляется: на конец августа 2026 у него около 9,5 тысяч звёзд на GitHub, последние правки в коде свежие. Ссылка на проект github.com/k2-fsa/OmniVoice

Три способа попробовать прямо сейчас, без установки

Перед установкой имеет смысл послушать результат на своём голосе. Для этого есть три готовых входа.

  1. Демо на HuggingFace: huggingface.co/spaces/k2-fsa/OmniVoice. Открываешь в браузере, грузишь свой образец, пишешь текст, слушаешь.
  2. Google Colab. В самом репозитории лежит готовый блокнот, он запускается в облаке и ничего не ставит на твой компьютер.
  3. Локальное веб-окно после установки, командой omnivoice-demo. Тот же интерфейс, но у себя и без очередей.
Образец записи бери чистый: без музыки, без эха, один голос. От качества образца результат зависит сильнее, чем от любых настроек.

Установка на свой компьютер

Порядок такой. Сначала ставится сам движок расчётов под твою видеокарту, потом модель. Команды копируются целиком.

Шаг 1. Движок расчётов

Промпт
pip install torch==2.8.0 torchaudio==2.8.0

Это вариант для компьютера без видеокарты NVIDIA. Видеокарта есть, ставь версию под неё, точная строка лежит на сайте pytorch.org в разделе Get Started.

Шаг 2. Сама модель

Промпт
pip install omnivoice

Шаг 3. Проверка

Промпт
omnivoice-demo --ip 0.0.0.0 --port 8001

Команда поднимает веб-окно. Открой в браузере адрес localhost:8001 и озвучь любую фразу, это подтверждает, что установка прошла.

Если модель не скачивается и вылетает ошибка соединения, перед запуском выполни строку export HF_ENDPOINT="https://hf-mirror.com" и повтори. Это зеркало, которое советуют сами авторы.

Клонирование голоса одной командой

Положи рядом файл с образцом, назови его ref.wav, и запусти команду. Меняй только текст в кавычках и имя итогового файла.

Промпт
omnivoice-infer \ --model k2-fsa/OmniVoice \ --text "Текст, который нужно озвучить моим голосом." \ --ref_audio ref.wav \ --output result.wav
  1. --text это то, что будет сказано. Кавычки обязательны.
  2. --ref_audio это твой образец. Достаточно короткой чистой записи.
  3. --output это имя готового файла.
  4. Расшифровку образца можно не писать: модель распознает её сама. Хочешь точнее, добавь строку --ref_text с текстом образца дословно.

Голос с нуля, без образца

Когда своего голоса под задачу нет, голос собирается описанием. Это отдельный режим и отдельная команда.

Промпт
omnivoice-infer --model k2-fsa/OmniVoice \ --text "Текст, который нужно озвучить." \ --instruct "мужской голос, спокойный, низкий, взрослый" \ --output voice.wav

В строку описания складываются пол, возраст, высота, темп, акцент и манера вплоть до шёпота. Меняй описание и слушай, подбор занимает несколько заходов.

Описание пиши на том же языке, на котором говоришь в тексте. Смешанные языки в описании дают непредсказуемый результат.

Как подключить это к своему агенту

Отдельного разъёма для агентов у проекта нет, и это стоит знать заранее. Подключение делается через обычную команду, и работает оно ничуть не хуже.

  1. Поставь OmniVoice на ту же машину, где живёт агент.
  2. В файл правил проекта, тот самый CLAUDE.md, добавь строку: озвучка делается командой omnivoice-infer, образец голоса лежит по такому-то пути.
  3. Дальше проси агента словами: озвучь этот текст моим голосом и положи файл туда-то. Он соберёт команду сам.
Проверь один раз руками, что команда отрабатывает, и только потом отдавай её агенту. Агент повторяет рабочую команду надёжно, а вот чинить сломанную установку он будет долго.

Границы, о которых лучше знать заранее

  • Образец записи должен быть на том же языке, на котором ты хочешь получить речь. Русский образец для английского текста даёт заметный акцент и плавающие интонации.
  • Цифры модель читает неровно. Пиши числа словами либо включай авто-нормализацию текста, она ставится отдельной добавкой к пакету.
  • Нужна видеокарта. На обычном процессоре синтез идёт, но заметно медленнее, для длинных текстов это неудобно.
  • Чужой голос без разрешения человека использовать нельзя. Это касается и голосов известных людей, и голоса клиента, записанного на созвоне.

Чек-лист

  1. Послушал демо в браузере и результат устроил.
  2. Движок расчётов и сам пакет установлены, веб-окно открывается.
  3. Образец записан чисто, один голос, без музыки и эха.
  4. Первая команда клонирования отработала и файл получился.
  5. Описание голоса подобрано, если своего образца нет.
  6. Правило про команду озвучки записано в файл правил проекта.

Читать дальше в блоге

Эту тему я разбираю подробно в статье рабочий список нейросетей для контента. Там же лежат остальные разборы про нейросети.

Следующий шаг
Хочешь так же, но под свой блог и продукт?

Я собрал систему, по которой обычный человек запускает блог с нуля и набирает аудиторию без съёмок, монтажа и команды. Внутри разбор, с которого стартовал сам.

Открыть разбор: с чего начать