Автоматическое распознавание речи

Что такое технология преобразования речи в текст и как она работает в автоматическом распознавании речи

Автоматическое распознавание речи (ASR) прошло долгий путь. Хотя он был изобретен давно, он почти никогда не использовался. Однако время и технологии сейчас существенно изменились. Аудиотранскрипция претерпела значительные изменения.

Такие технологии, как ИИ (искусственный интеллект), привели в действие процесс преобразования аудио в текст для получения быстрых и точных результатов. В результате его приложения в реальном мире также увеличились, а некоторые популярные приложения, такие как Tik Tok, Spotify и Zoom, встраивают этот процесс в свои мобильные приложения.

Итак, давайте рассмотрим ASR и узнаем, почему это одна из самых популярных технологий в 2022 году.

Что такое речь для текста?

Перевод речи в текст (STT), также называемый автоматическим распознаванием речи (ASR), преобразует устную речь в письменный текст. Современные системы представляют собой программные сервисы, которые анализируют аудиосигналы и выводят слова с временными метками и оценками достоверности.

Для команд, разрабатывающих UX для контакт-центров, здравоохранения и голосовых сервисов, STT — это шлюз к диалогам с возможностью поиска и анализа, вспомогательным субтитрам и последующим функциям искусственного интеллекта, таким как реферирование или контроль качества.

Общие названия преобразования речи в текст

Эта передовая технология распознавания речи также популярна и называется по именам:

  • Автоматическое распознавание речи (ASR)
  • Распознавание речи
  • Компьютерное распознавание речи
  • Аудио транскрипция
  • Чтение экрана

Применение технологии преобразования речи в текст

Контакт-центры

Расшифровки в режиме реального времени обеспечивают поддержку операторам в режиме реального времени; пакетные расшифровки способствуют контролю качества, аудиту соответствия и созданию архивов вызовов с возможностью поиска.

Пример : Используйте потоковое автоматическое распознавание речи для отображения подсказок в режиме реального времени во время спора по поводу выставления счетов, а затем запустите пакетную транскрипцию после звонка для оценки качества и автоматического создания сводки.

Здравоохранение

Врачи диктуют заметки и получают сводки посещений; расшифровки поддерживают кодирование (CPT/ICD) и клиническую документацию — всегда с защитой закрытой медицинской информации.

Пример : Врач записывает консультацию, запускает ASR для составления SOAP-записи и автоматически выделяет названия лекарств и показатели жизненно важных функций для проверки кодировщиком с применением процедуры удаления конфиденциальной медицинской информации.

СМИ и образование

Создавайте титры/субтитры для лекций, вебинаров и трансляций; добавляйте легкое редактирование вручную, когда вам нужна почти идеальная точность.

Пример : Университет осуществляет пакетную расшифровку видеолекций, затем рецензент исправляет имена и профессиональную терминологию перед публикацией доступных субтитлов.

Голосовые продукты и IVR

Распознавание ключевого слова и команд обеспечивает возможность использования пользовательского интерфейса без помощи рук в приложениях, киосках, транспортных средствах и смарт-устройствах; система интерактивного речевого ответа (IVR) использует расшифровки для маршрутизации и решения задач.

Пример : Банковская система интерактивного голосового ответа (IVR) распознает запрос «заблокировать мою карту», ​​подтверждает данные и запускает рабочий процесс — навигация с клавиатуры не требуется.

Операции и знания

Встречи и выездные вызовы становятся доступны для поиска в виде текста с временными метками, спикерами и планами действий для коучинга и аналитики.

Пример : Телефонные звонки клиентам расшифровываются, помечаются по темам (ценообразование, возражения) и подводятся итоги; менеджеры фильтруют звонки по показателю «риск продления контракта» для планирования последующих действий.

Почему стоит использовать преобразование речи в текст?

  • Сделайте разговоры доступными для обнаружения. Превратите часы аудиозаписей в текст с возможностью поиска для аудита, обучения и анализа потребностей клиентов. 
  • Автоматизировать ручную транскрипцию. Сократите время выполнения и затраты по сравнению с рабочими процессами, в которых задействован только человек, сохраняя при этом человеческий фактор там, где качество должно быть безупречным. 
  • Мощность нисходящего ИИ. Резюмирование транскриптов, извлечение намерений/тем, флаги соответствия и коучинг. 
  • Улучшить доступностьСубтитры и расшифровки помогают пользователям с потерей слуха и улучшают восприятие контента в шумной обстановке. 
  • Поддержка решений в реальном времени. Потоковая передача данных по протоколу ASR обеспечивает руководство по вызову, формы в реальном времени и мониторинг в режиме реального времени. 

Преимущества технологии преобразования речи в текст

Гибкость скорости и режима

Потоковая передача данных позволяет использовать фрагменты длительностью менее секунды для живого использования; пакетная передача данных позволяет справиться с задержками благодаря более глубокой постобработке.

Пример : потоковая обработка расшифровок для помощи агенту; повторная пакетная расшифровка позже для архива, соответствующего требованиям контроля качества.

Встроенные качественные функции

Используйте диаризацию, пунктуацию/регистр, временные метки и подсказки по фразам/пользовательский словарь для работы с жаргоном.

Пример : Подпишите обозначения для поворотов врача/пациента и улучшите названия лекарств, чтобы они правильно записывались.

Выбор развертывания

Используйте облачные API для масштабирования/обновлений или локальные/периферийные контейнеры для размещения данных и низкой задержки.

Пример : Больница использует систему автоматического распознавания речи (ASR) в своем центре обработки данных для хранения конфиденциальной медицинской информации (PHI) локально.

Настройка и многоязычность

Устраните пробелы в точности с помощью списков фраз и адаптации домена; поддерживайте несколько языков и переключение кодов.

Пример : Финтех-приложение продвигает названия брендов и тикеры на английском/хинглише, а затем корректирует их для нишевых терминов.

Понимание работы автоматического распознавания речи

Рабочий процесс распознавания речи

Работа программного обеспечения для перевода аудио в текст сложна и включает в себя выполнение нескольких шагов. Как мы знаем, преобразование речи в текст — это эксклюзивное программное обеспечение, предназначенное для преобразования аудиофайлов в редактируемый текстовый формат; он делает это, используя распознавание голоса.

Разработка

  • Первоначально с помощью аналого-цифрового преобразователя компьютерная программа применяет к предоставленным данным лингвистические алгоритмы, чтобы отличать вибрации от звуковых сигналов.
  • Затем соответствующие звуки фильтруются путем измерения звуковых волн.
  • Кроме того, звуки распределяются/сегментируются на сотые или тысячные доли секунды и сопоставляются с фонемами (измеримой единицей звука, позволяющей отличить одно слово от другого).
  • Затем фонемы проходят через математическую модель для сравнения существующих данных с хорошо известными словами, предложениями и фразами.
  • Результатом является текстовый или компьютерный аудиофайл.

[Также читайте: Подробный обзор автоматического распознавания речи ]

Каковы виды использования речи в текст?

Существует несколько вариантов использования программного обеспечения для автоматического распознавания речи, например

  • Поиск контента: Большинство из нас перешли от набора букв на телефонах к нажатию кнопки, чтобы программное обеспечение распознавало наш голос и предоставляло желаемые результаты.
  • Обслуживание клиентов: Чат-боты и помощники с искусственным интеллектом, которые могут провести клиентов через несколько начальных шагов процесса, стали обычным явлением.
  • Скрытые субтитры в реальном времени: С расширением глобального доступа к контенту скрытые субтитры в режиме реального времени стали заметным и значительным рынком, продвигая ASR вперед для его использования.
  • Электронная документация: Несколько административных отделов начали использовать ASR для выполнения задач документирования, обеспечивая более высокую скорость и эффективность.

Каковы основные проблемы распознавания речи?

Акценты и диалекты . Одно и то же слово может звучать совершенно по-разному в разных регионах, что сбивает с толку модели, обученные на «стандартной» речи. Решение простое: соберите и протестируйте аудиозаписи с различными акцентами и добавьте подсказки по фразам/произношению для названий брендов, мест и людей.

Контекст и омофоны. Выбор правильного слова («to/too/two») требует учета окружающего контекста и знаний предметной области. Используйте более совершенные языковые модели, адаптируйте их к собственному тексту из предметной области и проверяйте критически важные сущности, такие как названия лекарств или артикулы товаров.

Шум и плохое качество аудиоканалов . Транспортный поток, перекрестные помехи, кодеки вызовов и микрофоны дальнего действия заглушают важные звуки. Используйте шумоподавление и нормализацию звука, распознавание голосовой активности, имитируйте реальный шум/кодеки в процессе обучения и, по возможности, отдавайте предпочтение более качественным микрофонам.

Переключение кодов и многоязычная речь . Люди часто смешивают языки или переключаются посреди предложения, что нарушает модели одноязычной речи. Выбирайте многоязычные модели или модели, учитывающие переключение кодов, проводите оценку на аудиозаписях с использованием разных языков и поддерживайте списки фраз, специфичные для каждой локали.

При наличии нескольких говорящих и наложении голосов, в стенограммах размывается информация о том, кто что сказал. Включите диаризацию говорящих для обозначения реплик и используйте разделение/формирование луча, если доступен многомикрофонный звук.

Видеоподсказки в записях . В видео движения губ и текст на экране добавляют смысл, который один только звук может не уловить. Там, где качество имеет значение, используйте аудиовизуальные модели и сочетайте ASR с OCR для распознавания заголовков слайдов, имен и терминов.

Качество аннотирования и разметки . Несогласованные стенограммы, неправильные метки говорящего или небрежная пунктуация подрывают как обучение, так и оценку. Разработайте четкое руководство по стилю, регулярно проверяйте образцы и ведите небольшой эталонный набор для оценки согласованности аннотирования.

Конфиденциальность и соответствие требованиям . Телефонные звонки и клинические записи могут содержать персональные данные/защитную медицинскую информацию, поэтому хранение и доступ к ним должны строго контролироваться. Редактируйте или обезличивайте выходные данные, ограничивайте доступ и выбирайте облачное или локальное развертывание в соответствии с вашей политикой.

Как выбрать лучшего поставщика услуг преобразования речи в текст

Выбирайте поставщика, протестировав аудио (акценты, устройства, шум) и сопоставив точность с конфиденциальностью, задержкой и стоимостью. Начните с малого, измеряйте, затем масштабируйте.

Сначала определите потребности

  • Варианты использования: потоковая передача, пакетная обработка или и то, и другое
  • Языки/акценты (включая переключение кодов)
  • Аудиоканалы: телефон (8 кГц), приложение/настольный компьютер, дальнее поле
  • Конфиденциальность/местоположение: PII/PHI, регион, хранение, аудит
  • Ограничения: целевая задержка, SLA, бюджет, облако или локально/периферийное решение

Оцените свой аудиофайл

  • Точность: WER + точность сущностей (жаргон, имена, коды)
  • Многоговорящий: качество дневника (кто говорил, когда)
  • Форматирование: знаки препинания, регистр, числа/даты
  • Потоковая передача: задержка TTFT/TTF + стабильность
  • Функции: списки фраз, пользовательские модели, редактирование, временные метки

Спросите в запросе предложений

  • Показать необработанные результаты на нашем тестовом наборе (по акценту/шуму)
  • Обеспечить задержку потоковой передачи p50/p95 для наших клипов
  • Точность диаризации для 2–3 говорящих с перекрытием
  • Обработка данных: внутрирегиональная обработка, хранение, журналы доступа
  • Путь из списков фраз → пользовательская модель (данные, время, стоимость)

Следите за красными флагами

  • Отличная демоверсия, слабые результаты на вашем аудио
  • «Мы исправим это с помощью тонкой настройки», но нет плана/данных
  • Скрытые сборы за ведение дневника/редактирование/хранение

[Также читайте: Понимание процесса сбора аудиоданных для автоматического распознавания речи ]

Будущее технологии преобразования речи в текст

Более крупные многоязычные «базовые» модели. Ожидайте появления моделей, охватывающих более 100 языков, с более высокой точностью при низких затратах ресурсов, благодаря масштабному предварительному обучению и незначительной тонкой настройке.

Речь + перевод в одном стеке. Унифицированные модели будут обрабатывать автоматическое распознавание речи, перевод речи в текст и даже преобразование речи в речь, уменьшая задержку и количество связующего кода.

Более интеллектуальное форматирование и разбивка на разделы по умолчанию. Автоматическая пунктуация, регистр, цифры и надежная маркировка «кто говорил и когда» будут все чаще внедряться как в пакетную, так и в потоковую обработку.

Аудиовизуальное распознавание в сложных условиях. Подсказки по губам и текст на экране (OCR) повысят качество расшифровки аудиозаписей при наличии шума — это уже быстро развивающаяся область исследований и находится на стадии разработки первых прототипов продуктов.

Обучение с приоритетом конфиденциальности и размещение на устройствах/периферийных устройствах. Федеративное обучение и развертывание в контейнерах позволят сохранять данные локально, одновременно улучшая модели, что важно для регулируемых секторов.

Искусственный интеллект, учитывающий нормативные требования. Сроки, установленные Законом ЕС об ИИ, означают большую прозрачность, контроль рисков и заложенную в документацию основу для продуктов STT и закупок.

Более тщательная оценка, выходящая за рамки WER. Команды будут стандартизировать точность сущностей, качество диаризации, задержку (TTFT/TTF) и справедливость в отношении акцентов/устройств, а не ограничиваться только заголовком WER.

Как Shaip поможет вам этого добиться

По мере распространения этих тенденций успех по-прежнему зависит от ваших данных . Shaip предоставляет многоязычные наборы данных с богатым акцентом, безопасную для защиты персональных данных деидентификацию и эталонные тестовые наборы (WER, сущность, диаризация, задержка) для объективного сравнения поставщиков и настройки моделей — чтобы вы могли уверенно внедрять будущее STT. Обратитесь к экспертам Shaip по данным ASR , чтобы спланировать быстрый пилотный проект.

Понравилась статья? Подпишитесь на Шаипа в LinkedIn, чтобы получать больше новостей.

Социальная Поделиться