Самые надежные службы сбора речевых данных для вашего ИИ

Обучите свои модели НЛП, виртуальные помощники, прототипы TTS и многое другое с помощью качественных разговорных данных с помощью наших служб сбора аудио- и речевых данных.

Сбор речевых данных
Стран
0 +
Часов
Речевые данные
0 +
Проекты
0 +
Языки (более 100 диалектов)
0 +

8 / 16 / 44 / 48 кГц

Частота выборки

Профессиональные услуги по сбору аудио/голосовых данных

Любая тема. Любой сценарий.

В Shaip наша экспертиза заключается в создании высококачественных наборов речевых данных, разработанных для различных требований AI/ML. Мы предлагаем широкий спектр языков и записываем в различных условиях, что делает наши наборы данных всеобъемлющими и адаптируемыми. Мы сосредоточены на снабжении моделей наибольшим объемом пользовательских речевых данных в кратчайшие сроки. С нами на борту вы можете ожидать: 

Сбор речи
  • Специально подобранные высококачественные многоязычные аудио/голосовые данные для повышения точности
  • Максимально возможный уровень специфичности предметной области для решения разнообразных сценариев
  • Масштабируйте свою модель машинного обучения, чтобы она соответствовала различным демографическим характеристикам и вертикалям
  • Среда записи: Студийное качество, кристально чистый звук с минимальным фоновым шумом и Природная среда, где записи включают окружающие звуки, имитирующие реальные ситуации.

Наша Экспертиза

Согласуйте аудиоданные с более умными моделями НЛП

Shaip предлагает услуги по непрерывному сбору речевых / аудиоданных на более чем 100+ языках, чтобы позволить голосовым технологиям обслуживать самые разные аудитории по всему миру. Мы можем работать над проектами любого объема и размера; от лицензирования существующих готовых наборов аудиоданных до управления сбором пользовательских аудиоданных, транскрипции и аннотации аудиоданных. Независимо от того, насколько велик ваш проект по сбору речевых данных, мы можем настроить службы сбора аудиоданных в соответствии с вашими потребностями для создания высококачественных наборов данных НЛП, ориентированных на диалекты, тона и языки. Выбирайте из нашего широкого спектра наборов речевых данных и ресурсов для сбора аудиоданных для интеллектуальных настроек голосовой связи.

Монологическая речь

Монологическая и спонтанная речь

Он фокусируется на обработке речи одного говорящего. Используйте скриптовые подсказки для подачи в одноканальные аудиофайлы, обеспечивая запись уникальных речевых шаблонов, тонов и нюансов, характерных для конкретного человека.

Диалоговая речь

Диалог по сценарию и спонтанная речь

Взаимодействие двух человек, воспроизводящее реальные разговоры и диалоги с многоязычным доступом через двухканальные файлы и расшифрованные ресурсы.

Многосторонние разговоры

Группа / Мути-пати
Conversations

Обсуждения с участием нескольких человек, фиксирующие групповую динамику, совпадения и различные тона для точной тренировки речевых моделей.

Коллекция высказываний-пробуждений

Сборник пробуждающих слов/ключевых фраз/высказываний​

Обучите ИИ распознавать ключевые фразы или пробуждать слова или высказывания со схожим значением, используя разнообразные, насыщенные и аутентичные высказывания для расширенной обработки и понимания естественного языка.

Акустическая речь

Акустические данные

Мы можем профессионально записывать аудиоданные студийного качества, будь то рестораны, офисы или дома, или из разных сред и на разных языках, охватывая при этом более широкий акустический диапазон (комплексные наборы звуковых данных).

Автоматическое распознавание речи

Автоматическое распознавание речи (ASR)

Повысьте точность своих систем автоматического распознавания речи (ASR), получив доступ к современным диверсифицированным наборам речевых/аудиоданных из широкого спектра демографических данных.

Высказывание на естественном языке

Многоязычная речь/аудиообучающие данные

Наши квалифицированные лингвисты по всему миру предлагают многоязычные аудио/речевые данные на разных языках и диалектах. Эти усилия способствуют глобальному общению и преодолению языковых барьеров, способствуя созданию более инклюзивных и эффективных решений в области искусственного интеллекта.

Цифровые виртуальные помощники

Преобразование текста в речь
(ТТС)

Создайте многоязычную модель преобразования текста в речь (TTS) с помощью наших специалистов по всему миру, которые помогут вам собирать речевые данные на более чем 150 языках и диалектах, чтобы усовершенствовать ваши модели искусственного интеллекта — от элементов управления в автомобиле до чат-ботов и обучающих решений с высокой эффективностью. качественные аудиоданные.

Записи колл-центра

Call Center
Conversations

Настоящий обмен информацией между агентами и клиентами, поддерживающий множество языков, таких как испанский, немецкий, американский английский, бенгальский, японский, китайский и хинди.

случай

Наборы данных разговорного ИИ, содержащие более 3 тысяч часов данных на 8 языках.

Стремясь создать многоязычную платформу для индийских языков, клиент заключил партнерское соглашение с Shaip для сбора, сегментации и расшифровки больших наборов данных на нескольких индийских языках. Это поможет разработать эффективные речевые модели, которые могут стать основой новой инновационной платформы клиента.

Задача: собрать более 3,000 часов аудиоданных на 8 индийских языках, сегментировать и расшифровать их для разработки системы автоматического распознавания речи.

Решение: Мы обеспечили сбор данных, сегментацию, транскрипцию и предоставили JSON-файлы с метаданными. Для проекта клиента по разработке речевых технологий мы собрали 3000 часов аудиоданных на 8 индийских языках в масштабе, соответствующем потребностям заказчика.

Пример сбора речевых данных

Причины выбрать Shaip в качестве надежного партнера по сбору речевых данных

Люди

Люди

Выделенные и обученные команды:

  • Более 30,000 сотрудников по созданию, маркировке и контролю качества данных
  • Аттестованная команда управления проектами
  • Опытная команда по разработке продуктов
  • Команда поиска и адаптации кадрового резерва
Разработка

Разработка

Наивысшая эффективность процесса обеспечивается:

  • Надежный 6-сигма-технологический процесс
  • Специальная команда «черных поясов 6 сигм» - владельцы ключевых процессов и соблюдение требований к качеству
  • Непрерывное совершенствование и обратная связь
Платформа

Платформа

Запатентованная платформа предлагает преимущества:

  • Сквозная веб-платформа
  • Безупречное качество
  • Быстрее ТАТ
  • Бесшовная доставка

Готовые наборы речевых/аудиоданных

Языковой набор данныхЧастота дискретизацииТип набора данныхВсего часов аудио
+Афроамериканский диалект8 кГцКолл-центр211
ОписаниеДанные колл-центра для афроамериканцев
Описание набора данныхСинтетический телефонный разговор без сценария между «агентом» и «клиентом», прибл. Продолжительность звука (диапазон) 5-15 минут,
АудиоканалаДвойной
Платформа записиРабочий стол
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщин: 612, Мужчин: 1242, Неизвестно: 12
+16 кГцПодкасты154
ОписаниеДанные афроамериканских народных СМИ
Описание набора данныхЛицензируемые общедоступные аудио/видеофайлы, такие как интервью, подкасты и т. д. — от 1 до 5 человек. прибл. Продолжительность аудио (диапазон) 15-60 минут
АудиоканалаМоно
Платформа записиВеб-поиск
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщин: 151, Мужчин: 150, Неизвестно: 10
+Африкаанс8 кГцОбщий разговор368
ОписаниеДанные общего разговора на африкаанс
Описание набора данныхНезаписанный телефонный разговор между двумя людьми. прибл. Продолжительность аудио (диапазон) — 15–60 минут, африкаанс, на котором говорят в Африке.
АудиоканалаДвойной
Платформа записиРабочий стол
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщин: 502, Мужчин: 390, Неизвестно: 2
+16 кГцПодкасты658
ОписаниеМедиафайлы на африкаанс
Описание набора данныхЛицензируемые общедоступные аудио/видеофайлы, такие как интервью, подкасты и т. д. — от 1 до 5 человек. прибл. Продолжительность аудио (диапазон) 15-60 минут
АудиоканалаМоно
Платформа записиВеб-поиск
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщин: 750, Мужчин: 1278, Неизвестно: 52
+арабском 8 кГцОбщий разговор292
ОписаниеДанные для общего разговора на арабском языке
Описание набора данныхНезаписанный телефонный разговор между двумя людьми. прибл. Продолжительность аудио (диапазон) - 15-60 минут, арабский язык из стран Персидского залива
АудиоканалаДвойной
Платформа записиРабочий стол
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщин: 171, Мужчин: 534, Неизвестно: 1
+48 кГцМонолог по сценарию1,947
ОписаниеМонолог на арабском языке
Описание набора данныхЗаписи одного высказывания, которые, как правило, попадают в диапазон от 5 до 30 секунд.
АудиоканалаМоно
Платформа записиМобильное приложение
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщина 838 Мужчина 1209 Неизвестно 78
+Ассамский (в разработке) Call-центр60
ОписаниеАссамский (в разработке) Данные колл-центра
Описание набора данныхСинтетический телефонный разговор без сценария между «агентом» и «клиентом», прибл. Продолжительность звука (диапазон) 5-15 минут,
Аудиоканала
Платформа записиРабочий стол
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиков
+Общий разговор100
ОписаниеАссамский (в разработке) Общие данные разговора
Описание набора данныхСинтетический телефонный разговор без сценария между «агентом» и «клиентом», прибл. Продолжительность звука (диапазон) 5-15 минут,
Аудиоканала
Платформа записиРабочий стол
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиков
+Подкасты40
ОписаниеАудиоданные мультимедиа на ассамском языке (в разработке)
Описание набора данныхЛицензируемые общедоступные аудио/видеофайлы, такие как интервью, подкасты и т. д. — от 1 до 5 человек. прибл. Продолжительность аудио (диапазон) 15-60 минут
Аудиоканала
Платформа записиВеб-поиск
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиков
+Бенгальский (в разработке) Call-центр60
ОписаниеБенгальский (в разработке) данные колл-центра
Описание набора данныхСинтетический телефонный разговор без сценария между «агентом» и «клиентом», прибл. Продолжительность звука (диапазон) 5-15 минут,
Аудиоканала
Платформа записиРабочий стол
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиков
+Общий разговор100
ОписаниеБенгальский (In Pipeline) Общие данные разговора
Описание набора данныхСинтетический телефонный разговор без сценария между «агентом» и «клиентом», прибл. Продолжительность звука (диапазон) 5-15 минут,
Аудиоканала
Платформа записиРабочий стол
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиков
+Подкасты40
ОписаниеБенгальский (In Pipeline) Медиа-аудиоданные
Описание набора данныхЛицензируемые общедоступные аудио/видеофайлы, такие как интервью, подкасты и т. д. — от 1 до 5 человек. прибл. Продолжительность аудио (диапазон) 15-60 минут
Аудиоканала
Платформа записиВеб-поиск
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиков
+Бостонский английский8 кГцCall-центр177
ОписаниеДанные колл-центра Бостона
Описание набора данныхСинтетический телефонный разговор без сценария между «агентом» и «клиентом», прибл. Продолжительность звука (диапазон) 5-15 минут,
АудиоканалаДвойной
Платформа записиРабочий стол
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщин: 605, Мужчин: 711, Неизвестно: 0
+8 кГцОбщий разговор32
ОписаниеДанные общего разговора в Бостоне
Описание набора данныхНезаписанный телефонный разговор между двумя людьми. прибл. Продолжительность аудио (диапазон) - 15-60 минут,
АудиоканалаДвойной
Платформа записиРабочий стол
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщин: 53, Мужчин: 83, Неизвестно: 0
+16 кГцПодкасты93
ОписаниеАудиоданные Boston Media
Описание набора данныхЛицензируемые общедоступные аудио/видеофайлы, такие как интервью, подкасты и т. д. — от 1 до 5 человек. прибл. Продолжительность аудио (диапазон) 15-60 минут
АудиоканалаМоно
Платформа записиВеб-поиск
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщин: 43, Мужчин: 181, Неизвестно: 2
+Канадский французский48 кГцМонолог по сценарию1,222
ОписаниеКанадский французский
Описание набора данныхЗаписи одного высказывания, которые, как правило, попадают в диапазон от 5 до 30 секунд.
АудиоканалаМоно
Платформа записиМобильное приложение
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщина 974 Мужчина 631 Неизвестно 1
+Китайский английский8 кГцCall-центр169
ОписаниеДанные китайского колл-центра
Описание набора данныхСинтетический телефонный разговор без сценария между «агентом» и «клиентом», прибл. Продолжительность звука (диапазон) 5-15 минут,
АудиоканалаДвойной
Платформа записиРабочий стол
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщин: 1790, Мужчин: 523 и Неизвестно: 13
+16 кГцПодкасты249
ОписаниеАудиоданные китайских СМИ
Описание набора данныхЛицензируемые общедоступные аудио/видеофайлы, такие как интервью, подкасты и т. д. — от 1 до 5 человек. прибл. Продолжительность аудио (диапазон) 15-60 минут
АудиоканалаМоно
Платформа записиВеб-поиск
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщин: 126, Мужчин: 346 и Неизвестно: 6
+Китайский упрощенный48 кГцМонолог по сценарию2,762
ОписаниеКитайский упрощенный
Описание набора данныхЗаписи одного высказывания, которые, как правило, попадают в диапазон от 5 до 30 секунд.
АудиоканалаМоно
Платформа записиМобильное приложение
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщина 1920 Мужчина 1535 Неизвестно 270
+Традиционный китайский48 кГцМонолог по сценарию1,028
ОписаниеТрадиционный китайский
Описание набора данныхЗаписи одного высказывания, которые, как правило, попадают в диапазон от 5 до 30 секунд.
АудиоканалаМоно
Платформа записиМобильное приложение
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщина 1069 Мужчина 262 Неизвестно 3
+Датский8 кГцОбщий разговор372
ОписаниеДатские общие разговорные данные
Описание набора данныхНезаписанный телефонный разговор между двумя людьми. прибл. Продолжительность аудио (диапазон) - 15-60 минут,
АудиоканалаДвойной
Платформа записиРабочий стол
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщин: 311, Мужчин: 417, Неизвестно: 0
+16 кГцПодкасты664
ОписаниеАудиоданные датских СМИ
Описание набора данныхЛицензируемые общедоступные аудио/видеофайлы, такие как интервью, подкасты и т. д. — от 1 до 5 человек. прибл. Продолжительность аудио (диапазон) 15-60 минут
АудиоканалаМоно
Платформа записиВеб-поиск
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщин: 369, Мужчин: 864, Неизвестно: 27
+48 кГцМонолог по сценарию2,579
ОписаниеМонолог на датском языке
Описание набора данныхЗаписи с одним высказыванием, длительностью от 5 до 30 секунд, датский из Дании.
АудиоканалаМоно
Платформа записиМобильное приложение
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщина 1551 Мужчина 1233 Неизвестно 42
+Английский Deep South8 кГцCall-центр151
ОписаниеEnglish Данные колл-центра Deep South
Описание набора данныхСинтетический телефонный разговор без сценария между «агентом» и «клиентом», прибл. Продолжительность звука (диапазон) 5-15 минут,
АудиоканалаДвойной
Платформа записиРабочий стол
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщина 221, Мужчина 1004, Неизвестно 7
+8 кГцОбщий разговор56
ОписаниеДанные английского Deep South General Conversation
Описание набора данныхНезаписанный телефонный разговор между двумя людьми. прибл. Продолжительность аудио (диапазон) - 15-60 минут,
АудиоканалаДвойной
Платформа записиРабочий стол
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщина 99, Мужчина 31, Неизвестно 0
+16 кГцПодкасты266
ОписаниеАудиоданные Deep South Media на английском языке
Описание набора данныхЛицензируемые общедоступные аудио/видеофайлы, такие как интервью, подкасты и т. д. — от 1 до 5 человек. прибл. Продолжительность аудио (диапазон) 15-60 минут
АудиоканалаМоно
Платформа записиВеб-поиск
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщина 204, Мужчина 356, Неизвестно 21
+Немецкий8 кГцCall-центр64
ОписаниеДанные немецкого колл-центра
Описание набора данныхСинтетический телефонный разговор без сценария между «агентом» и «клиентом», прибл. Продолжительность звука (диапазон) 5-15 минут,
АудиоканалаМоно
Платформа записиРабочий стол
Вер (%)
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщина 478 Мужчина 1440 Неизвестно 0
+8 кГц IVR200
ОписаниеIVR-данные Германии
Описание набора данныхЧеловек к машине. Тип потока IVR, в котором есть подсказка TTS (например, «Чем я могу вам помочь»), за которой следует спонтанный ответ человека.
АудиоканалаМоно
Платформа записиРабочий стол
Вер (%)
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщина 10115 Мужчина 8750 Неизвестно 0
+Гуджарати (в разработке) Call-центр60
ОписаниеГуджарати (в разработке) Данные колл-центра
Описание набора данныхСинтетический телефонный разговор без сценария между «агентом» и «клиентом», прибл. Продолжительность звука (диапазон) 5-15 минут,
Аудиоканала
Платформа записиРабочий стол
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиков
+Общий разговор100
ОписаниеГуджарати (в конвейере) Общие данные разговора
Описание набора данныхСинтетический телефонный разговор без сценария между «агентом» и «клиентом», прибл. Продолжительность звука (диапазон) 5-15 минут,
Аудиоканала
Платформа записиРабочий стол
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиков
+Подкасты40
ОписаниеАудиоданные мультимедиа гуджарати (в конвейере)
Описание набора данныхЛицензируемые общедоступные аудио/видеофайлы, такие как интервью, подкасты и т. д. — от 1 до 5 человек. прибл. Продолжительность аудио (диапазон) 15-60 минут
Аудиоканала
Платформа записиВеб-поиск
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиков
+древнееврейский8 кГцОбщий разговор399
ОписаниеДанные общего разговора на иврите
Описание набора данныхНезаписанный телефонный разговор между двумя людьми. прибл. Продолжительность аудио (диапазон) - 15-60 минут, иврит в Израиле
АудиоканалаДвойной
Платформа записиРабочий стол
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщина 414 , Мужчина 399 , Неизвестно 1
+16 кГцПодкасты427
ОписаниеАудиоданные на иврите Media
Описание набора данныхЛицензируемые общедоступные аудио/видеофайлы, такие как интервью, подкасты и т. д. — от 1 до 5 человек. прибл. Продолжительность аудио (диапазон) 15-60 минут
АудиоканалаМоно
Платформа записиВеб-поиск
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщина 361, Мужчина 513, Неизвестно 13
+Хинди16 кГцПодкасты219
ОписаниеАудиоданные хинди-медиа
Описание набора данныхЛицензируемые общедоступные аудио/видеофайлы, такие как интервью, подкасты и т. д. — от 1 до 5 человек. прибл. Продолжительность аудио (диапазон) 15-60 минут
АудиоканалаМоно
Платформа записиВеб-поиск
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщина 83, Мужчина 309, Неизвестно 0
+48 кГцМонолог по сценарию2,867
ОписаниеМонолог по сценарию на хинди
Описание набора данныхЗаписи одного высказывания, которые, как правило, попадают в диапазон от 5 до 30 секунд.
АудиоканалаМоно
Платформа записиМобильное приложение
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщина 1977 Мужчина 1864 Неизвестно 147
+хинглиш8 кГцCall-центр208
ОписаниеHINGLISH Данные колл-центра
Описание набора данныхСинтетический телефонный разговор без сценария между «агентом» и «клиентом», прибл. Продолжительность звука (диапазон) 5-15 минут,
АудиоканалаДвойной
Платформа записиРабочий стол
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщина 822, Мужчина 1262, Неизвестно 0
+16 кГцПодкасты216
ОписаниеHINGLISH Мультимедийные аудиоданные
Описание набора данныхЛицензируемые общедоступные аудио/видеофайлы, такие как интервью, подкасты и т. д. — от 1 до 5 человек. прибл. Продолжительность аудио (диапазон) 15-60 минут
АудиоканалаМоно
Платформа записиВеб-поиск
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщина 75, Мужчина 380, Неизвестно 0
+Латиноамериканский английский8 кГцCall-центр212
ОписаниеДанные колл-центра для латиноамериканцев
Описание набора данныхСинтетический телефонный разговор без сценария между «агентом» и «клиентом», прибл. Продолжительность звука (диапазон) 5-15 минут,
АудиоканалаДвойной
Платформа записиРабочий стол
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщина 822, Мужчина 1262, Неизвестно 0
+16 кГцПодкасты155
ОписаниеАудио для латиноамериканского звонка
Описание набора данныхЛицензируемые общедоступные аудио/видеофайлы, такие как интервью, подкасты и т. д. — от 1 до 5 человек. прибл. Продолжительность аудио (диапазон) 15-60 минут
АудиоканалаМоно
Платформа записиВеб-поиск
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщина 140, Мужчина 219, Неизвестно 5
+Индонезийский8 кГцОбщий разговор496
ОписаниеДанные индонезийского общего разговора
Описание набора данныхНезаписанный телефонный разговор между двумя людьми. прибл. Продолжительность аудио (диапазон) — 15–60 минут, индонезийский индонезийский
АудиоканалаДвойной
Платформа записиРабочий стол
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщина 524, Мужчина 454, Неизвестно 2
+16 кГцПодкасты643
ОписаниеАудиоданные индонезийских СМИ
Описание набора данныхЛицензируемые общедоступные аудио/видеофайлы, такие как интервью, подкасты и т. д. — от 1 до 5 человек. прибл. Продолжительность аудио (диапазон) 15-60 минут
АудиоканалаМоно
Платформа записиВеб-поиск
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщина 746, Мужчина 1507, Неизвестно 129
+ирландский8 кГцОбщий разговор192
ОписаниеДанные ирландского общего разговора
Описание набора данныхНезаписанный телефонный разговор между двумя людьми. прибл. Продолжительность аудио (диапазон) - 15-60 минут,
АудиоканалаДвойной
Платформа записиРабочий стол
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщина 213 , Мужчина 153 , Неизвестно 0
+Японский48 кГцМонолог по сценарию2,335
ОписаниеМонолог по японскому сценарию
Описание набора данныхЗаписи одного высказывания, которые, как правило, попадают в диапазон от 5 до 30 секунд.
АудиоканалаМоно
Платформа записиМобильное приложение
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщина 1460 Мужчина 1221 Неизвестно 194
+Каннада (в разработке) Call-центр60
ОписаниеКаннада (в разработке) Данные колл-центра
Описание набора данныхСинтетический телефонный разговор без сценария между «агентом» и «клиентом», прибл. Продолжительность звука (диапазон) 5-15 минут,
Аудиоканала
Платформа записиРабочий стол
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиков
+Общий разговор100
ОписаниеКаннада (в конвейере) Общие данные разговора
Описание набора данныхСинтетический телефонный разговор без сценария между «агентом» и «клиентом», прибл. Продолжительность звука (диапазон) 5-15 минут,
Аудиоканала
Платформа записиРабочий стол
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиков
+Подкасты40
ОписаниеКаннада (в конвейере) Медиа-аудиоданные
Описание набора данныхЛицензируемые общедоступные аудио/видеофайлы, такие как интервью, подкасты и т. д. — от 1 до 5 человек. прибл. Продолжительность аудио (диапазон) 15-60 минут
Аудиоканала
Платформа записиВеб-поиск
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиков
+Корейский8 кГцCall-центр107
ОписаниеДанные корейского колл-центра
Описание набора данныхСинтетический телефонный разговор без сценария между «агентом» и «клиентом», прибл. Продолжительность звука (диапазон) 5-15 минут,
АудиоканалаДвойной
Платформа записиРабочий стол
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщина 1086, Мужчина 210, Неизвестно 4
+16 кГцПодкасты204
ОписаниеЗвуковые данные корейских СМИ
Описание набора данныхЛицензируемые общедоступные аудио/видеофайлы, такие как интервью, подкасты и т. д. — от 1 до 5 человек. прибл. Продолжительность аудио (диапазон) 15-60 минут
АудиоканалаМоно
Платформа записиВеб-поиск
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщина 70 Мужчина 303, Неизвестно 25
+48 кГцМонолог по сценарию1,955
ОписаниеМонолог по корейскому сценарию
Описание набора данныхЗаписи одного высказывания, которые, как правило, попадают в диапазон от 5 до 30 секунд.
АудиоканалаМоно
Платформа записиМобильное приложение
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщина 1195 Мужчина 1134 Неизвестно 122
+Malay8 кГцОбщий разговор266
ОписаниеДанные малайского общего разговора
Описание набора данныхНезаписанный телефонный разговор между двумя людьми. прибл. Продолжительность аудио (диапазон) — 15–60 минут, малайский в Малайзии.
АудиоканалаДвойной
Платформа записиРабочий стол
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщина 316, Мужчина 176, Неизвестно 0
+16 кГцПодкасты344
ОписаниеАудиоданные малайских СМИ
Описание набора данныхЛицензируемые общедоступные аудио/видеофайлы, такие как интервью, подкасты и т. д. — от 1 до 5 человек. прибл. Продолжительность аудио (диапазон) 15-60 минут
АудиоканалаМоно
Платформа записиВеб-поиск
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщина 236, Мужчина 626, Неизвестно 47
+Малаялам (в разработке) Call-центр60
ОписаниеМалаялам (в разработке) Данные колл-центра
Описание набора данныхСинтетический телефонный разговор без сценария между «агентом» и «клиентом», прибл. Продолжительность звука (диапазон) 5-15 минут,
Аудиоканала
Платформа записиРабочий стол
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиков
+Общий разговор100
ОписаниеМалаялам (в конвейере) Общие данные разговора
Описание набора данныхСинтетический телефонный разговор без сценария между «агентом» и «клиентом», прибл. Продолжительность звука (диапазон) 5-15 минут,
Аудиоканала
Платформа записиРабочий стол
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиков
+Подкасты40
ОписаниеМалаялам (In Pipeline) Медиа-аудиоданные
Описание набора данныхЛицензируемые общедоступные аудио/видеофайлы, такие как интервью, подкасты и т. д. — от 1 до 5 человек. прибл. Продолжительность аудио (диапазон) 15-60 минут
Аудиоканала
Платформа записиВеб-поиск
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиков
+Маратхи (в разработке) Call-центр60
ОписаниеДанные колл-центра на языке маратхи (в разработке)
Описание набора данныхСинтетический телефонный разговор без сценария между «агентом» и «клиентом», прибл. Продолжительность звука (диапазон) 5-15 минут,
Аудиоканала
Платформа записиРабочий стол
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиков
+Общий разговор100
ОписаниеМаратхи (в конвейере) Общие данные разговора
Описание набора данныхСинтетический телефонный разговор без сценария между «агентом» и «клиентом», прибл. Продолжительность звука (диапазон) 5-15 минут,
Аудиоканала
Платформа записиРабочий стол
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиков
+Подкасты40
ОписаниеАудиоданные мультимедиа маратхи (в конвейере)
Описание набора данныхЛицензируемые общедоступные аудио/видеофайлы, такие как интервью, подкасты и т. д. — от 1 до 5 человек. прибл. Продолжительность аудио (диапазон) 15-60 минут
Аудиоканала
Платформа записиВеб-поиск
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиков
+Испанский (Мексика)48 кГцМонолог по сценарию1,492
ОписаниеМексиканский монолог по испанскому сценарию
Описание набора данныхЗаписи одного высказывания, которые, как правило, попадают в диапазон от 5 до 30 секунд.
АудиоканалаМоно
Платформа записиМобильное приложение
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщина 1016 Мужчина 1069 Неизвестно 95
+Голландский48 кГцМонолог по сценарию1,205
ОписаниеМонолог по голландскому сценарию
Описание набора данныхЗаписи одного высказывания, которые, как правило, попадают в диапазон от 5 до 30 секунд.
АудиоканалаМоно
Платформа записиМобильное приложение
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщина 1285 Мужчина 531 Неизвестно 3
+Нью-йоркский английский8 кГцCall-центр103
ОписаниеДанные колл-центра New York English
Описание набора данныхСинтетический телефонный разговор без сценария между «агентом» и «клиентом», прибл. Продолжительность звука (диапазон) 5-15 минут,
АудиоканалаДвойной
Платформа записиРабочий стол
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщина 610, Мужчина 532, Неизвестно 0
+8 кГцОбщий разговор107
ОписаниеДанные общего разговорного английского в Нью-Йорке
Описание набора данныхНезаписанный телефонный разговор между двумя людьми. прибл. Продолжительность аудио (диапазон) - 15-60 минут,
АудиоканалаДвойной
Платформа записиРабочий стол
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщина 118, Мужчина 114, Неизвестно 0
+16 кГцПодкасты140
ОписаниеАудиоданные New York English Media
Описание набора данныхЛицензируемые общедоступные аудио/видеофайлы, такие как интервью, подкасты и т. д. — от 1 до 5 человек. прибл. Продолжительность аудио (диапазон) 15-60 минут
АудиоканалаМоно
Платформа записиВеб-поиск
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщина 66, Мужчина 230, Неизвестно 11
+Новозеландский английский 8 кГцОбщий разговор148
ОписаниеДанные новозеландского английского для общего разговора
Описание набора данныхНезаписанный телефонный разговор между двумя людьми. прибл. Продолжительность аудио (диапазон) - 15-60 минут,
АудиоканалаДвойной
Платформа записиРабочий стол
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщина 167, мужчина 121, Неизвестно 4
+16 кГцПодкасты400
ОписаниеНовозеландский английский СМИ аудио
Описание набора данныхЛицензируемые общедоступные аудио/видеофайлы, такие как интервью, подкасты и т. д. — от 1 до 5 человек. прибл. Продолжительность аудио (диапазон) 15-60 минут
АудиоканалаМоно
Платформа записиВеб-поиск
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщина 367, мужчина 678, Неизвестно 26
+Ория (в разработке) Call-центр60
ОписаниеOriya (In Pipeline) Данные колл-центра
Описание набора данныхСинтетический телефонный разговор без сценария между «агентом» и «клиентом», прибл. Продолжительность звука (диапазон) 5-15 минут,
Аудиоканала
Платформа записиРабочий стол
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиков
+Общий разговор100
ОписаниеOriya (In Pipeline) Общие данные разговора
Описание набора данныхСинтетический телефонный разговор без сценария между «агентом» и «клиентом», прибл. Продолжительность звука (диапазон) 5-15 минут,
Аудиоканала
Платформа записиРабочий стол
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиков
+Подкасты40
ОписаниеАудиоданные мультимедиа Oriya (In Pipeline)
Описание набора данныхЛицензируемые общедоступные аудио/видеофайлы, такие как интервью, подкасты и т. д. — от 1 до 5 человек. прибл. Продолжительность аудио (диапазон) 15-60 минут
Аудиоканала
Платформа записиВеб-поиск
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиков
+Польский16 кГцПодкасты269
ОписаниеПольские СМИ аудио
Описание набора данныхЛицензируемые общедоступные аудио/видеофайлы, такие как интервью, подкасты и т. д. — от 1 до 5 человек. прибл. Продолжительность аудио (диапазон) 15-60 минут
АудиоканалаМоно
Платформа записиВеб-поиск
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщина 173 Мужчина 354 Неизвестно 6
+Польский (польша)48 кГцМонолог по сценарию1,482
ОписаниеПольская Польша - Монолог по сценарию
Описание набора данныхЗаписи одного высказывания, которые, как правило, попадают в диапазон от 5 до 30 секунд.
АудиоканалаМоно
Платформа записиМобильное приложение
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщина 1324 Мужчина 701 Неизвестно 24
+Пенджаби (в разработке) Call-центр60
ОписаниеПанджаби (в разработке) Данные колл-центра
Описание набора данныхСинтетический телефонный разговор без сценария между «агентом» и «клиентом», прибл. Продолжительность звука (диапазон) 5-15 минут,
Аудиоканала
Платформа записиРабочий стол
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиков
+Общий разговор100
ОписаниеПанджаби (в разработке) Общие данные разговора
Описание набора данныхСинтетический телефонный разговор без сценария между «агентом» и «клиентом», прибл. Продолжительность звука (диапазон) 5-15 минут,
Аудиоканала
Платформа записиРабочий стол
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиков
+Подкасты40
ОписаниеПенджаби (в конвейере) Медиа-аудиоданные
Описание набора данныхЛицензируемые общедоступные аудио/видеофайлы, такие как интервью, подкасты и т. д. — от 1 до 5 человек. прибл. Продолжительность аудио (диапазон) 15-60 минут
Аудиоканала
Платформа записиВеб-поиск
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиков
+Русский48 кГцМонолог по сценарию2,398
ОписаниеМонолог по русскому сценарию
Описание набора данныхЗаписи одного высказывания, которые, как правило, попадают в диапазон от 5 до 30 секунд.
АудиоканалаМоно
Платформа записиМобильное приложение
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщина 1689 Мужчина 1937 Неизвестно 214
+Шотландский (английский акцент)8 кГцОбщий разговор292
ОписаниеДанные шотландского общего разговора
Описание набора данныхНезаписанный телефонный разговор между двумя людьми. прибл. Продолжительность аудио (диапазон) - 15-60 минут,
АудиоканалаДвойной
Платформа записиРабочий стол
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщина 285, Мужчина 260, Неизвестно 3
+Сингапурский английский8 кГцCall-центр218
ОписаниеДанные колл-центра Сингапура
Описание набора данныхСинтетический телефонный разговор без сценария между «агентом» и «клиентом», прибл. Продолжительность звука (диапазон) 5-15 минут,
АудиоканалаДвойной
Платформа записиРабочий стол
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщина 2139, Мужчина 884, Неизвестно 21
+16 кГцПодкасты247
ОписаниеАудиоданные Сингапурских СМИ
Описание набора данныхЛицензируемые общедоступные аудио/видеофайлы, такие как интервью, подкасты и т. д. — от 1 до 5 человек. прибл. Продолжительность аудио (диапазон) 15-60 минут
АудиоканалаМоно
Платформа записиВеб-поиск
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщина 160, Мужчина 455, Неизвестно 37
+Южноафриканский английский8 кГцCall-центр261
ОписаниеДанные южноафриканского английского колл-центра
Описание набора данныхСинтетический телефонный разговор без сценария между «агентом» и «клиентом», прибл. Продолжительность звука (диапазон) 5-15 минут,
АудиоканалаДвойной
Платформа записиРабочий стол
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщина 1274 , Мужчина 935 , Неизвестно 1
+16 кГцПодкасты251
ОписаниеЗвуковые данные южноафриканских английских СМИ
Описание набора данныхЛицензируемые общедоступные аудио/видеофайлы, такие как интервью, подкасты и т. д. — от 1 до 5 человек. прибл. Продолжительность аудио (диапазон) 15-60 минут
АудиоканалаМоно
Платформа записиВеб-поиск
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщина 235, Мужчина 432, Неизвестно 36
+суахили8 кГцCall-центр230
ОписаниеДанные колл-центра на суахили
Описание набора данныхСинтетический телефонный разговор без сценария между «агентом» и «клиентом», прибл. Продолжительность звука (диапазон) 5-15 минут,
АудиоканалаДвойной
Платформа записиРабочий стол
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщина 611, Мужчина 833, Неизвестно 0
+16 кГцПодкасты265
ОписаниеАудиоданные СМИ суахили
Описание набора данныхЛицензируемые общедоступные аудио/видеофайлы, такие как интервью, подкасты и т. д. — от 1 до 5 человек. прибл. Продолжительность аудио (диапазон) 15-60 минут
АудиоканалаМоно
Платформа записиВеб-поиск
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщина 118, Мужчина 493, Неизвестно 25
+Шведский8 кГцCall-центр250
ОписаниеДанные шведского колл-центра
Описание набора данныхСинтетический телефонный разговор без сценария между «агентом» и «клиентом», прибл. Продолжительность звука (диапазон) 5-15 минут,
АудиоканалаДвойной
Платформа записиРабочий стол
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщина 1581, мужчина 727, Неизвестно 2
+16 кГцПодкасты278
ОписаниеАудиоданные шведских СМИ
Описание набора данныхЛицензируемые общедоступные аудио/видеофайлы, такие как интервью, подкасты и т. д. — от 1 до 5 человек. прибл. Продолжительность аудио (диапазон) 15-60 минут
АудиоканалаМоно
Платформа записиВеб-поиск
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщина 195, мужчина 500, Неизвестно 21
+Тамильский (в разработке) Call-центр60
ОписаниеТамильский (в разработке) Данные колл-центра
Описание набора данныхСинтетический телефонный разговор без сценария между «агентом» и «клиентом», прибл. Продолжительность звука (диапазон) 5-15 минут,
Аудиоканала
Платформа записиРабочий стол
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиков
+Общий разговор100
ОписаниеТамильский (в разработке) Общие данные разговора
Описание набора данныхСинтетический телефонный разговор без сценария между «агентом» и «клиентом», прибл. Продолжительность звука (диапазон) 5-15 минут,
Аудиоканала
Платформа записиРабочий стол
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиков
+Подкасты40
ОписаниеАудиоданные мультимедиа на тамильском языке (в разработке)
Описание набора данныхЛицензируемые общедоступные аудио/видеофайлы, такие как интервью, подкасты и т. д. — от 1 до 5 человек. прибл. Продолжительность аудио (диапазон) 15-60 минут
Аудиоканала
Платформа записиВеб-поиск
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиков
+Телугу8 кГцОбщий разговор553
ОписаниеОбщие разговорные данные на телугу
Описание набора данныхНезаписанный телефонный разговор между двумя людьми. прибл. Продолжительность аудио (диапазон) - 15-60 минут,
АудиоканалаДвойной
Платформа записиРабочий стол
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщина 574, Мужчина 564, Неизвестно 0
+16 кГцПодкасты648
ОписаниеАудиоданные телугу Media
Описание набора данныхЛицензируемые общедоступные аудио/видеофайлы, такие как интервью, подкасты и т. д. — от 1 до 5 человек. прибл. Продолжительность аудио (диапазон) 15-60 минут
АудиоканалаМоно
Платформа записиВеб-поиск
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщина 207, Мужчина 963, Неизвестно 2
+Телугу (в разработке) Call-центр30
ОписаниеТелугу (в разработке) Данные колл-центра
Описание набора данныхСинтетический телефонный разговор без сценария между «агентом» и «клиентом», прибл. Продолжительность звука (диапазон) 5-15 минут,
Аудиоканала
Платформа записиРабочий стол
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиков
+Общий разговор50
ОписаниеТелугу (в конвейере) Общие данные беседы
Описание набора данныхСинтетический телефонный разговор без сценария между «агентом» и «клиентом», прибл. Продолжительность звука (диапазон) 5-15 минут,
Аудиоканала
Платформа записиРабочий стол
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиков
+Подкасты20
ОписаниеТелугу (в конвейере) Медиа-аудиоданные
Описание набора данныхЛицензируемые общедоступные аудио/видеофайлы, такие как интервью, подкасты и т. д. — от 1 до 5 человек. прибл. Продолжительность аудио (диапазон) 15-60 минут
Аудиоканала
Платформа записиВеб-поиск
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиков
+Тайский8 кГцОбщий разговор183
ОписаниеТайский общий разговор
Описание набора данныхНезаписанный телефонный разговор между двумя людьми. прибл. Продолжительность аудио (диапазон) — 15–60 минут, неформальная регистрация, используемая между друзьями.
АудиоканалаДвойной
Платформа записиРабочий стол
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщина 338, Мужчина 96, Неизвестно 8
+16 кГцПодкасты173
ОписаниеТайские СМИ аудио
Описание набора данныхЛицензируемые общедоступные аудио/видеофайлы, такие как интервью, подкасты и т. д. — от 1 до 5 человек. прибл. Продолжительность аудио (диапазон) 15-60 минут
АудиоканалаМоно
Платформа записиВеб-поиск
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщина 143, Мужчина 502, Неизвестно 26
+Турецкая Турция48 кГцМонолог по сценарию2,027
ОписаниеТурецкая Турция
Описание набора данныхЗаписи одного высказывания, которые, как правило, попадают в диапазон от 5 до 30 секунд.
АудиоканалаМоно
Платформа записиМобильное приложение
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщина 1561 Мужчина 1241 Неизвестно 31
+Вьетнамский8 кГцОбщий разговор295
ОписаниеДанные вьетнамского общего разговора
Описание набора данныхСинтетический телефонный разговор без сценария между «агентом» и «клиентом», прибл. Продолжительность звука (диапазон) 5-15 минут, северный (например, Ханой), центральный и южный (например, Хошимин).
АудиоканалаДвойной
Платформа записиРабочий стол
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщины 400, мужчины 380, Неизвестные 2
+16 кГцПодкасты257
ОписаниеАудиоданные вьетнамских СМИ
Описание набора данныхЛицензируемые общедоступные аудио/видеофайлы, такие как интервью, подкасты и т. д. — от 1 до 5 человек. прибл. Продолжительность аудио (диапазон) 15-60 минут
АудиоканалаМоно
Платформа записиВеб-поиск
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщины 249, мужчины 200, Неизвестные 45
+Валлийский (английский акцент)8 кГцОбщий разговор278
ОписаниеДанные валлийского общего разговора
Описание набора данныхСинтетический телефонный разговор без сценария между «агентом» и «клиентом», прибл. Продолжительность звука (диапазон) 5-15 минут,
АудиоканалаДвойной
Платформа записиРабочий стол
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковЖенщина 270, Мужчина 324, Неизвестно 0
+Великобритания Английский16 кГцWake Word200 Выступающие
ОписаниеWake Word (Великобритания) английский
Описание набора данныхсбор данных по ключевым фразам
  • 200 колонки
  • 4 уникальные ключевые фразы на каждого говорящего
  • 25-30 повторяющихся записей ключевых фраз на одну уникальную ключевую фразу
  • 25-30 аудиофайлов на уникальную ключевую фразу
  • Всего 120 записанных высказываний на говорящего
Аудиоканала1 канал
Платформа записиМобильное приложение
Вер (%)5.0
Аудио форматы. Wav
Формат транскрипции.json
КейсыASR, виртуальный помощник, чат-бот, разговорный ИИ, речевая аналитика, TTS, языковое моделирование
Количество динамиковПол: 50% мужчин, 50% женщин, +/- 10%.

Предлагаемые услуги

Экспертный сбор текстовых данных - это не все, что нужно для комплексных настроек ИИ. В Shaip вы даже можете рассмотреть следующие услуги, чтобы сделать модели более распространенными, чем обычно:

Сбор текстовых данных

Услуги по сбору текстовых данных

Истинная ценность сервисов сбора когнитивных данных Shaip заключается в том, что они дают организациям ключ к разблокированию важной информации, содержащейся в неструктурированных данных.

Сбор данных изображений

Услуги по сбору данных об изображениях

Убедитесь, что ваша модель компьютерного зрения точно идентифицирует каждое изображение, чтобы беспрепятственно обучать модели искусственного интеллекта следующего поколения будущего.

Сбор видеоданных

Услуги по сбору видеоданных

Теперь сосредоточьтесь на компьютерном зрении вместе с НЛП, чтобы научить свои модели в совершенстве определять объекты, людей, сдерживающие факторы и другие визуальные элементы.

Избранные клиенты

Расширение возможностей команд для создания ведущих в мире продуктов искусственного интеллекта.

Свяжитесь с нами

Хотите создать свой собственный набор аудиоданных?

Свяжитесь с нашим штатным экспертом по сбору речевых данных, чтобы настроить репозиторий аудио, который наилучшим образом соответствует вашим требованиям.

  • Это поле для целей проверки и должны быть оставлены без изменений.
  • Регистрируясь, я соглашаюсь с Shaip Персональные данные и Условия Предоставления Услуг и даю свое согласие на получение маркетинговых сообщений B2B от Shaip.

Сбор речевых данных для модели машинного обучения — это процесс сбора аудиозаписей разговорной речи. Этот сборник помогает в обучении и совершенствовании алгоритмов машинного обучения, особенно тех, которые ориентированы на понимание и обработку человеческих голосов.

Если вы хотите собрать аудиоданные для автоматического распознавания речи (ASR), вам следует начать с определения конкретных потребностей вашего проекта, включая желаемый язык, акцент и тип речи. После установки этих параметров убедитесь, что вы получили все необходимые разрешения для соблюдения конфиденциальности пользователей. Затем используйте соответствующие записывающие устройства или программное обеспечение для записи четких аудиосэмплов. Каждая запись должна быть тщательно аннотирована ее транскрипцией или другими соответствующими метаданными и систематически храниться для облегчения доступа.

Набор речевых данных в машинном обучении имеет решающее значение для обучения, тестирования и проверки моделей, предназначенных для распознавания, транскрипции или интерпретации разговорной речи. Такие наборы данных открывают путь для множества приложений: от голосовых помощников и служб транскрипции до голосовой биометрии.

Для сбора точных данных о разных языках и акцентах жизненно важно сотрудничество с носителями языка желаемого языкового происхождения. Стремитесь к разнообразной и репрезентативной выборке, охватывающей широкий спектр демографических нюансов. Используйте стандартизированное записывающее оборудование в единых средах, чтобы обеспечить согласованность звука. И что немаловажно, аннотируйте каждый фрагмент данных подробными транскрипциями и метаданными, обозначая конкретный язык и акцент.