Как компания Shaip разработала масштабируемую программу оценки качества клонирования голоса для клиента, использующего искусственный интеллект для обработки речи.
От качества демонстрационного образца до готовности к развертыванию — как структурированная оценка человеком помогла клиенту речевого распознавания на основе ИИ сократить разрыв между лабораторными показателями и реальной производительностью.
Обзор проекта
Модели клонирования голоса могут впечатлять в демонстрациях, но в реальных условиях по-прежнему испытывают трудности. Клиенту был необходим надежный способ измерения того, действительно ли их модель улучшается, особенно для индийского английского языка, который являлся приоритетным рынком для внедрения.
Шаип был приглашен для разработки и управления программой оценки человеческих ресурсов, которая могла бы ответить на три ключевых бизнес-вопроса:
- Звучит ли речь естественно?
- Звучит ли по-прежнему так же, как и в оригинальной записи?
- Достаточно ли оно безопасно и надежно для использования в производственных целях?
Вместо того чтобы полагаться только на автоматизированные метрики, в проекте использовались обученные эксперты для оценки реальных аудиозаписей и выявления недостатков модели.
Ключевые метрики набора данных
Кейсы
Оценка качества клонирования голоса
Продолжительность проекта
12 недель
Проверенные образцы
12 400 синтезированных аудиоклипов
Развернуты аннотаторы
48 квалифицированных экспертов по оценке уровня английского языка
Проблемы оценки качества синтеза речи и клонирования голоса.
- Модель должна хорошо работать во всех областях. несколько английских акцентовособенно индийский вариант английского языка.
- Качество звука необходимо было улучшить способами, которые имеют значение для конечных пользователей, а не ограничиваться лабораторными показателями.
- Команде был необходим четкий способ идентификации. Что пошло не так в процессе вывода речи?.
- В длинных аудиозаписях со временем иногда теряется информация об авторе.
- Клиенту также потребовались чеки на безопасность, риск выдачи себя за другое лицо и наличие водяных знаков.
Решение: Система оценки качества голоса с помощью ИИ, основанная на человеческом факторе.
Стратегия оценки
Компания Shaip разработала структурированную систему оценки естественности, четкости, сходства голоса, согласованности и безопасности.
Масштабная экспертиза с участием человека
48 квалифицированных экспертов проанализировали 12 400 аудиозаписей на индийском английском, нейтральном американском английском и субдорожке на хинглише.
Трехэтапная оценка
- Рецензенты оценивали естественность и понятность звучания каждого фрагмента.
- Они сравнили пары видеороликов, чтобы определить, какой вариант лучше.
- Они отметили повторяющиеся проблемы с качеством, такие как неестественный ритм, проблемы с высотой тона и смещение говорящего.
Контроль качества
Для обеспечения согласованности и надежности результатов оценки Шаип использовал калибровочные задания, эталонные проверки, повторные обзоры и мониторинг качества.
Петля обратной связи, позволяющая принимать действенные решения
Результаты каждого спринта использовались в процессе настройки модели клиентом, что помогало улучшать ее в течение нескольких раундов.
Объем проекта: Языки, акценты и обзор результатов.
| Район | Объем |
|---|---|
| Язык | Английский |
| Приоритетные акценты | Индийский английский, нейтральный американский английский |
| Вторичное покрытие | Британский английский, поддорожка хинглиш |
| Типы образцов | Короткие отрывки, фрагменты видео, длинные речи. |
| Обзор вывода | Рейтинги качества, метки предпочтений, маркировка проблем |
| Продолжительность помолвки | 12 недель |
Результаты: Измеримые улучшения в клонировании голоса.
- Заметное улучшение качества голоса: Общий показатель качества модели улучшился с 3.41 до 4.12, что свидетельствует о том, что речь стала более естественной и готовой к воспроизведению.
- Более точный подбор акустических систем: Система значительно улучшила способность сохранять исходный голос говорящего, повысив коэффициент сходства с 0.71 до 0.87.
- Меньше заметных ошибок: Количество случаев проблем с речью снизилось с 31% в исходных образцах до 11% к финальному этапу.
- Высокая разборчивость: Процент ошибок в написании заключительных слов на индийском английском языке достиг 4.8%, превысив целевой порог.
- Более безопасная готовность к развертыванию: В ходе оценки также были подтверждены высокие показатели по ключевым проверкам безопасности, включая проверку на риск выдачи себя за другое лицо и проверку водяных знаков.
Компания Shaip помогла нам превратить субъективную оценку качества звука в измеримую программу улучшения. Их система оценки дала нам четкие указания на то, что нужно исправить, где нужно улучшить и как уверенно приблизиться к запуску производства.
— Руководитель направления разработки речевых продуктов на основе ИИ