Вы когда-нибудь экспортировали сценарий преобразования текста в речь и позже обнаруживали, что в него проскользнуло одно-единственное английское слово? У меня есть — и синтезированный голос настолько сильно исказил это место, что мне пришлось переделывать дубль. Все, что я на самом деле хочу, это...
Вы когда-нибудь экспортировали сценарий преобразования текста в речь и позже обнаруживали, что в него проскользнуло одно-единственное английское слово? У меня есть — и синтезированный голос настолько сильно исказил это место, что мне пришлось переделывать дубль.
Все, что мне на самом деле нужно, это проверить: «Есть ли примеси английского языка в этом японском сценарии?» Это оказывается на удивление раздражающим. Проверить все вручную нереально, поэтому стандартный ход — фильтрация регулярным выражением. Потом я заметил, что сервис под названием respan модели кораблей «создан для принятия решений» — официальный сайт respan.ai. Поэтому я попробовал, думая, что это может облегчить эту проблему.
Код и данные измерений: github.com/sunnydachs/span01-eval
Вердикт первый
В граничных случаях модель с большим отрывом превосходит регулярное выражение.
В предложениях, в которых смешаны названия брендов, URL-адреса, личные имена или аббревиатуры, регулярное выражение помечает каждое из них как дефект.
И наоборот, в моих реальных скриптах регулярного выражения было достаточно. Однако этот критерий несправедлив, и ниже я объясню, почему. Таким образом, практическая форма оказалась такой: «регулярное выражение в качестве первого этапа, модель в качестве второго» — это не случай выбора одного над другим.
Что это за штука на самом деле
Это