Транскрипция и аннотирование аудиозаписей на индийских языках: пример применения разговорного искусственного интеллекта.
Предлагались высококачественные услуги по транскрипции и аннотированию аудиозаписей для обучения их системы обработки речи на основе искусственного интеллекта.
Обзор проекта: Создание многоязычного речевого движка для индийских языков.
Клиент — ведущая индийская лаборатория по разработке продуктов на основе искусственного интеллекта, представленная на рынках США, Индии, Канады и ряда других стран. Их цель — раскрыть человеческий потенциал с помощью технологий. Они обладают более чем десятилетним опытом в области передовых методов обработки естественного языка (NLP), научных исследований в сфере искусственного интеллекта, машинного обучения, аналитики, визуализации и связанных с ними технологий.
Они расширяют границы взаимодействия человека и машины с помощью своих продуктов на основе искусственного интеллекта, таких как ICOG и Autovox. ICOG — это персонализированный интеллектуальный виртуальный помощник по обучению на основе ИИ, предназначенный для обучения и трансформации персонала, а Autovox — это голосовой помощник на основе ИИ.
Механизм обработки индийских языков.
Основные результаты: 1,200 часов работы, аннотированных на 6 языках.
Аудиозапись расшифрована и снабжена комментариями.
1,200 ч
Количество
Языки
6 (200 часов x 6 языков)
Языки транскрибированы и аннотированы.
Индийский английский, хинди, тамильский, телугу, каннада, малаялам
Проект
Лента
10 недель
Задача: поиск квалифицированных лингвистов для аннотирования аудиозаписей на индийских языках.
Отсутствие доступа к квалифицированным лингвистам, экспертам по аннотированию данных и сокращение сроков выхода на рынок стали препятствием на пути развития и внедрения разговорного ИИ. Поиск лингвистов, транскрибирование и аннотирование больших объемов данных с требуемым качеством, достаточным для создания возможностей ИИ, всегда были трудоемкой и дорогостоящей задачей, требующей квалифицированных специалистов из различных областей. Несмотря на наличие внутренней команды аннотаторов, они сталкивались с проблемами своевременной доставки и качества аннотирования.
Критическими требованиями клиента были:
- Доступ к высококвалифицированным лингвистам: Отсутствие доступа к квалифицированным лингвистам, специализирующимся на индийских языках, таких как индийский английский, хинди, тамильский, телугу, каннада, малаялам.
- Транскрипция и аннотирование аудиозаписей: Сложные правила аннотирования и транскрипции аудиозаписей с минимальной точностью 95%.
- Доставка данных: Текст стенограммы должен быть предоставлен в формате JSON в течение 10 недель.
Решение: расшифровка и аннотирование аудиозаписей опытными лингвистами.
Благодаря нашему глубокому пониманию разговорного ИИ, мы помогли клиенту расшифровать и аннотировать предоставленные наборы данных, используя команду экспертов-лингвистов и аннотаторов для обучения их системы обработки речи на основе ИИ для индийских языков.
После оценки множества поставщиков (включая нескольких крупных игроков отрасли) клиент выбрал компанию Shaip благодаря нашему опыту в реализации крупных проектов в области разговорного ИИ в сжатые сроки, а также качеству предоставляемых услуг по конкурентоспособным ценам.
- Соблюдены правила транскрипции и аннотирования аудиозаписей.
- Аннотированные типы аудиофайлов: речь и неречь.
- Если в выбранном сегменте в поле «Тип аудио» указано «речь», то необходимо выбрать тип речи, например: Чистая речь, Речь + Музыка, Речь + Шум, Неразборчивая речь.
- Выбранный фрагмент речи должен быть помечен конкретно языком, на котором говорит говорящий.
- Аннотатор должен отметить области тегами говорящих. Разные говорящие должны быть указаны.
отмечены различными метками динамиков. - Аннотатор должен указать пол говорящего, например, мужской или женский.
- Текст должен быть написан так, как он произносится в аудиозаписи, и должен быть грамматически правильным.
- Если выбранный тип аудио — неречевой, ему следует присвоить одну из следующих меток: отсутствие речи, музыка, причмокивание губами, дыхание, кашель, смех, звонок, DTMF-сигнал, бульканье, шум транспортного средства и прерывистый фоновый шум.
- Все фрагменты аудиозаписи должны быть помечены тегами, и только после этого их можно загружать в систему.
- Доставка данных
Все файлы с расшифровками были предоставлены в формате JSON в соответствии с указанными требованиями к метаданным в течение 10 недель.
Результат: готовый к внедрению многоязычный движок разговорного искусственного интеллекта.
Высококачественные аннотированные аудиоданные от экспертов-лингвистов позволили клиенту точно обучить свой движок обработки речи на основе искусственного интеллекта на 6 индийских языках: индийском английском, хинди, тамильском, телугу, каннада и малаялам, в установленные сроки.
Используя эталонные обучающие наборы данных, клиент сможет предложить интеллектуальную и надежную систему распознавания речи с многоязычными возможностями, которая применяет сквозные (E2E) и гибридные модели для решения реальных задач. Проще говоря, это создание разговорного ИИ (подобного Alexa, Siri), специально ориентированного на индийских потребителей.
Мы были приятно удивлены надежной системой управления рабочими процессами Shaip, быстрой обработкой заказов, их опытом в области разговорного ИИ и сетью экспертов-лингвистов. Более того, предлагаемое ими соотношение цены и качества не имеет себе равных.