Вы когда-нибудь задумывались, как чат-боты и виртуальные помощники просыпаются, когда вы говорите «Привет, Siri» или «Alexa»? Это происходит из-за набора текстовых высказываний или триггерных слов, встроенных в программное обеспечение, которое активирует систему, как только слышит запрограммированное слово пробуждения.
Однако общий процесс создания звуков и данных о высказываниях не так прост. Это процесс, который должен выполняться с правильной техникой, чтобы получить желаемые результаты. Поэтому в этом блоге вы узнаете, как создавать хорошие высказывания/слова-триггеры, которые без проблем работают с вашим разговорным ИИ.
Что такое «Высказывание» в ИИ?
В разговорном ИИ (чат-ботах, голосовых помощниках) высказывание — это короткий фрагмент пользовательского ввода — точные слова, которые человек произносит или вводит. Модели используют высказывания для определения намерения пользователя (цели) и любых сущностей (таких как даты, названия продуктов, суммы).
Простые примеры
Бот для электронной коммерции
Высказывание: « Отследите мой заказ 123-456 ».
- Намерение: TrackOrder
- Сущность: order_id = 123-456
Телеком-бот
Высказывание: « Обновите мой тарифный план ».
- Намерение: ИзменитьПлан
- Сущность: тип_плана = данные
Банковский голосовой помощник
Произнесено: «Какой у меня сегодня баланс на расчетном счете? »
- Намерение: Проверка баланса
- Сущности: тип_аккаунта = проверка, дата = сегодня
Почему вашему разговорному ИИ нужны качественные данные о речевых высказываниях
Если вы хотите, чтобы ваш чат-бот или голосовой помощник казался полезным, а не ненадежным, начните с более качественных данных о высказываниях. Посмотрите, как мы это сделали в этом тематическом исследовании по сбору высказываний — 22 000 часов на 13 языках. Высказывания — это необработанные фразы, которые люди произносят или набирают, чтобы выполнить какое-либо действие («забронируйте мне номер на завтра», «изменить мой тариф», «какой статус?»). Они лежат в основе классификации намерений, извлечения сущностей и, в конечном итоге, улучшения пользовательского опыта. Если вы предпочитаете масштабировать это с помощью партнера, сервисы обработки данных разговорного ИИ от Shaip обеспечивают сбор, транскрипцию и аннотирование данных от начала до конца. Когда высказывания разнообразны, репрезентативны и хорошо размечены, ваши модели учатся определять правильные границы между намерениями и уверенно обрабатывают неструктурированный, реальный ввод.
Создание хранилища высказываний: простой рабочий процесс

1. Начните с реального языка пользователя
Анализируйте чаты, поисковые запросы, стенограммы IVR, заметки операторов и электронные письма клиентов. Сгруппируйте их по целям пользователей, чтобы выявить намерения. (Вы сможете обнаружить разговорные выражения и ментальные модели, о которых вы бы и не подумали, находясь в помещении.)
2. Создавайте вариации намеренно
Для каждого намерения приведите различные примеры:
- Перефразируйте глаголы и существительные («отменить», «остановить», «конец»; «план», «подписка»).
- Смешивайте длину и структуру предложений (вопрос, директива, фрагмент).
- Включите опечатки, сокращения, эмодзи (для чата), переключение кодов, где это уместно.
- Добавьте отрицательные случаи, которые выглядят похожими, но должны не карта соответствует этому намерению.
3. Сбалансируйте свои занятия
Чрезмерно несбалансированное обучение (например, 500 примеров для одного намерения и 10 для других) ухудшает качество прогнозирования. Поддерживайте относительно равномерные размеры намерений и увеличивайте их по мере того, как трафик будет вас обучать.
4. Проверка качества перед обучением
Блокировка данных с низким уровнем сигнала с помощью валидаторов во время создания/сбора данных:
- Определение языка: убедитесь, что примеры соответствуют целевому языку.
- Детектор тарабарщины: улавливайте бессмысленные строки.
- Проверки на дубликаты/почти дубликаты: поддерживайте высокое разнообразие.
- Регулярные выражения/орфография и грамматика: при необходимости применять правила стиля.
Умные валидаторы (такие, как Appen) могут автоматизировать значительную часть этого контроля.
5. Последовательно маркируйте объекты
Определите типы временных интервалов (даты, товары, адреса) и покажите аннотаторам, как отмечать границы . Шаблоны, такие как Pattern any в LUIS, могут помочь в различении длинных, переменных интервалов (например, названий документов), которые вводят модели в заблуждение.
6. Тестируйте так, как будто это производство
Отправляйте ранее не встречавшиеся реальные речевые фрагменты на конечную точку прогнозирования или в промежуточного бота, проверяйте ошибки классификации и добавляйте неоднозначные примеры в обучающую выборку. Создайте цикл: сбор → обучение → проверка → расширение.
Что на самом деле означает «грязная реальность» (и как с ней справиться)
Реальные пользователи редко говорят идеальными предложениями. Ожидайте:
- Фрагменты: «возврат платы за доставку»
- Сложные цели: «отменить заказ и заказать заново синим цветом»
- Неявные сущности: «доставить в мой офис» (вы должны знать, в какой офис)
- Двусмысленность: «изменить мой план» (какой план? когда вступит в силу?)
Практические решения
- Обеспечивать уточняющие подсказки только при необходимости; избегайте лишних вопросов.
- захват перенос контекста (местоимения типа «тот заказ», «последний»).
- Используйте резервные намерения с целевым возмещением: «Я могу помочь отменить или изменить планы — что бы вы хотели?»
- Монитор намерение здоровье (путаница, столкновение) и добавьте данные там, где они слабы
Голосовые помощники и слова для пробуждения: разные данные, схожие правила

Когда (и как) использовать готовые, а не пользовательские данные

- С полки: начните освещать ситуацию в новых регионах, а затем изучите, где сохраняется неясность.
- На заказ: зафиксируйте язык вашего домена (условия политики, названия продуктов) и «голос бренда».
- Смешанный: начните с общих данных, а затем добавьте высокоточные данные о намерениях с наибольшим отклонением или влиянием на доход.
Если вам нужен быстрый старт, Shaip предоставляет сбор речевых фрагментов и готовые наборы данных для речи/чата на многих языках; см. пример внедрения многоязычного голосового помощника в тематическом исследовании.
Контрольный список реализации

- Определите намерения и сущности с примерами и отрицательный кейсы
- Автор разнообразный, сбалансированный высказывания для каждого намерения (начните с малого, увеличивайте еженедельно)
- Добавьте валидаторы (язык, бессмысленные слова, дубликаты, регулярные выражения) перед обучением
- Создавать циклы обзора из реального трафика; продвигать неоднозначные элементы в обучение
- трек намерение здоровье и столкновения; исправить новыми высказываниями
- Повторная оценка по каналу/региону для раннего выявления отклонений
Как Шаип может помочь
- Сбор и маркировка индивидуальных высказываний (чат + голос) с валидаторами для поддержания высокого качества.
- Готовые к использованию наборы данных на более чем 150 языках/вариантах для быстрой загрузки.
- Текущие программы обзора которые безопасно преобразуют живой трафик в высокосигнальные обучающие данные (элементы управления персональными данными).
Ознакомьтесь с нашим примером использования многоязычной системы сбора речевых высказываний.