Я хотел, чтобы мои собственные статьи были аудио: что-то, что я мог бы слушать на прогулке, как разговор между двумя голосами, а не как чтение одним голосом. Не облачный сервис. То, что я запускаю на уже имеющемся у меня оборудовании, без графического процессора. Теперь это работает. ...
Я хотел, чтобы мои собственные статьи были аудио: что-то, что я мог бы слушать на прогулке, как разговор между двумя голосами, а не как чтение одним голосом. Не облачный сервис. То, что я запускаю на уже имеющемся у меня оборудовании, без графического процессора.
Теперь это работает. Первая серия вышла на 6 минут 46 секунд, 58 поворотов, нормализованная до -16 LUFS. Чтобы добиться этого, потребовались две ошибки, обе похожие на что-то другое, и проверка лицензии, которая исключила голоса, которые мне были нужны больше всего. Вот что произошло на самом деле.
Форма этого
Четыре этапа: выборка → сценарий → голос → микширование. Каждый записывает свой вывод на диск (JSON статьи, повороты диалогов, один WAV за ход, финальный MP3), поэтому любой этап можно перезапустить самостоятельно. Это оказалось важнее всего остального в дизайне, потому что каждая ошибка, указанная ниже, была обнаружена при повторном запуске одного этапа, а не всего процесса.
Сценарий: местная модель 7B пишет диалоги по одному разделу статьи за раз.
Голос: Пайпер, с ней разговаривают по протоколу Вайоминга, с двумя стандартными британскими голосами, по одному на каждого динамика.
Микс: ffmpeg concat плюс короткие паузы, затем нормализация громкости.
Голос: Пайпер в Вайоминге, новых услуг нет.
У меня уже была служба Wyoming-Piper для моего домашнего голосового помощника.