Пример исследования по сбору речевых данных на индийских языках: 300 часов на хинди, телугу и английском.

Компания предложила высококачественные услуги по сбору, транскрипции и аннотированию аудиоданных для обучения своего многоязычного голосового пакета обработки речи на основе искусственного интеллекта.

Многоязычный разговорный ИИ для индийских языков

Обзор проекта: Речевые данные для платформы локализации индийских языков.

Клиент разрабатывает технологии, которые помогают преодолеть языковой барьер в цифровом мире. Благодаря платформе Language-as-a-Service контент из приложений и порталов может доставляться на нескольких языках в режиме реального времени. Платформа Language Platform обеспечивает доставку статического и динамического контента из приложений и порталов на нескольких языках в режиме реального времени.

Они предоставляют услуги локализации языков для различных клиентов, таких как производители мобильных устройств, производители чипсетов, интернет-магазины, банки и финансовые учреждения, образовательные учреждения, государственные органы, развлекательные компании и многие другие.

Разговорный ИИ

Основные результаты: собрано 300 часов информации на 3 языках.

Собранные, расшифрованные и аннотированные аудиоданные

300 ч

Количество
Языки

3 (100 часов x 3 языков)

Языки транскрибированы и аннотированы.

Индийский английский, хинди, телугу

Проект
Лента

12 недель

Задача: поиск разговорной речи для демографически разнообразной аудитории.

Отсутствие доступа к квалифицированным лингвистам, экспертам по аннотированию данных и жесткие сроки стали препятствием на пути развития и внедрения разговорного ИИ. Поиск лингвистов, транскрибирование и аннотирование больших объемов данных с требуемым качеством, достаточным для создания возможностей ИИ, — это трудоемкая и дорогостоящая задача, требующая квалифицированных специалистов из различных областей.

Критическими требованиями клиента были:

  1. Доступ к высококвалифицированным лингвистам для сбора аудиоматериалов: Соберите 300 часов аудиоматериалов на таких языках, как индийский английский, хинди и телугу, от экспертов-лингвистов, представляющих различные демографические группы.
  2. Комплексная транскрипция и аннотирование аудиозаписей с минимальной точностью 90%:
    • Была произведена полная расшифровка аудиофайлов, зафиксированы все произнесенные слова, включая паузы, слова-паразиты, фальшивые начала и другие речевые особенности.
    • Несмотря на строгие правила транскрипции, связанные с диалектными произношениями, неправильным произношением слов, нестандартным использованием слов и пунктуацией, результат транскрипции оказался безошибочным.
  3. Доставка данных: Предоставление высококачественных и разнообразных аудиофайлов вместе с соответствующими расшифровками (в формате JSON) на 3 языках в течение 12 недель.

Решение: Специализированный сбор, транскрипция и аннотирование аудиоматериалов.

Благодаря нашему глубокому пониманию разговорного ИИ, мы помогли клиенту собрать, расшифровать и аннотировать данные командой экспертов-лингвистов и аннотаторов для обучения их многоязычного голосового пакета на основе ИИ.

После оценки множества поставщиков клиент выбрал компанию Shaip благодаря нашему опыту в реализации проектов по разработке разговорного ИИ в сжатые сроки, экономично и с требуемым качеством. Их команда также была впечатлена надежными и всесторонними возможностями Shaip по выполнению проектов.

Язык Количество часов Незапланированная общая беседа (50%) Незапланированный разговор в колл-центре (30%) Онлайн-контент, удаленный из интернета (20%)
Хинди 100 50 30 20
Английский 100 50 30 20
телугу 100 50 30 20
Всего 300 150 90 60
  1. Дополнительные требования к сбору аудиоматериалов
    • Частота: частота дискретизации – 16 кГц
    • Формат: WAV
    • Продолжительность – Общая продолжительность (5-30 минут) – разговоры
    • Сфера применения речи – банковский и финансовый сектор, телекоммуникации и розничная торговля.
    • Демографическое разнообразие – соотношение полов 1:1, возрастной диапазон: 18-60 лет, фиксация идентификаторов докладчиков для идентификации каждого уникального докладчика.
  2. Соблюдены рекомендации по сегментации, транскрипции и аннотированию аудиоматериалов.

    2.1 Сегментация
    • Для отдельных файлов размером более 30 секунд создавайте сегменты по 15 секунд каждый (с метками времени в миллисекундах).
    • Типы сегментированных звуков – речь, лепет, музыка, шум, наложение.
    • Маркировка сегментов – время начала, время окончания, идентификатор сегмента, уровень громкости, основной тип звука,
      языковой код, идентификатор говорящего


    2.2 Транскрипция и аннотирование

    • Была произведена полная расшифровка аудиофайлов, зафиксированы все произнесенные слова, включая паузы, слова-паразиты, фальшивые начала и другие речевые особенности, такие как символы, знаки препинания.
    • Несмотря на строгие правила транскрипции, связанные с диалектными произношениями, неправильно произнесенными словами, нестандартным использованием слов, пунктуацией, заглавными буквами, аббревиатурами, сокращениями, числами, акронимами, невнятной и нечеткой речью, а также нецелевым текстом, результат транскрипции оказался безошибочным.
      языки и многое другое.
  3. Доставка данных
    Все аудиофайлы в формате WAV и текстовые расшифровки были предоставлены в формате JSON в соответствии с уникальными демографическими данными говорящих, включенных в исследование в течение 12 недель.

Результат: готовый к использованию многоязычный голосовой пакет.

Высококачественные аннотированные аудиоданные от экспертов-лингвистов позволили клиенту точно обучить свой многоязычный голосовой пакет на основе искусственного интеллекта для обработки речи на трех языках: индийском английском, хинди и телугу, в установленные сроки.

Используя эталонные обучающие наборы данных, клиент смог предложить интеллектуальные и надежные сервисы преобразования речи в текст, языкового перевода и многоязычных клавиатур для решения реальных задач.

Цитата значок

Нас впечатлили мощные возможности компании Shaip по реализации проектов, их опыт в поиске, транскрибировании и аннотировании необходимых аудиоданных от квалифицированных лингвистов. Многочисленные проверки качества, строгое соблюдение сроков и лидерство по соотношению цены и качества, которые они предлагают, не имеют себе равных.

★ ★ ★ ★ ★
Цитата значок