Приклад: Колекція висловлювань
Виконано понад 7 мільйонів висловлювань для створення багатомовних цифрових помічників 13 мовами
Рішення реального світу
Дані, що забезпечують глобальні розмови
Потреба в навчанні висловлювання виникає через те, що не всі клієнти використовують точні слова чи фрази під час взаємодії або задають запитання своїм голосовим помічникам у форматі сценарію. Ось чому конкретні голосові програми повинні бути навчені на спонтанних мовних даних. Наприклад, «Де знаходиться найближча лікарня?» «Знайти лікарню поруч зі мною» або «Чи є лікарня поблизу?» усі вказують на однакову мету пошуку, але формулюються по-різному.
Проблема
Щоб виконати план мовлення цифрового помічника клієнтів для мов у всьому світі, команді потрібно було отримати великі обсяги навчальних даних для моделі ШІ розпізнавання мовлення. Критичними вимогами клієнта були:
- Отримайте великі обсяги навчальних даних (підказки одного мовця тривалістю не більше 3-30 секунд) для служб розпізнавання мовлення 13 глобальними мовами
- Для кожної мови постачальник генеруватиме текстові підказки для тих, хто говорить (якщо не
клієнтські матеріали) і транскрибувати отримане аудіо. - Надайте аудіодані та транскрипцію записаних висловлювань із відповідними файлами JSON
містить метадані для всіх записів. - Забезпечте різноманітне поєднання мовців за віком, статтю, освітою та діалектом
- Забезпечте різноманітне поєднання середовищ запису відповідно до специфікацій.
- Кожен аудіозапис має бути принаймні 16 кГц, але краще 44 кГц
"Після оцінки багатьох постачальників клієнт обрав Shaip через їхній досвід у розмовних проектах штучного інтелекту. Ми були вражені компетентністю Shaip у виконанні проектів, їхнім досвідом у пошуку, транскрибуванні та доставці необхідних висловлювань експертів-лінгвістів 13 мовами в суворі терміни та з необхідною якістю".
Рішення
Завдяки нашому глибокому розумінню розмовного штучного інтелекту ми допомогли клієнту зібрати, транскрибувати та анотувати дані за допомогою команди експертів-лінгвістів і анотаторів, щоб навчити їх багатомовний голосовий пакет для обробки мовлення на базі ШІ.
Обсяг роботи для Shaip включав, але не обмежувався, отримання великих обсягів аудіонавчальних даних для розпізнавання мовлення, транскрипцію аудіозаписів кількома мовами для всіх мов у нашій дорожній карті мов рівня 1 і рівня 2, а також надання відповідних JSON файли, що містять метадані. Шайп збирав висловлювання тривалістю 3-30 секунд у масштабі, зберігаючи бажаний рівень якості, необхідний для навчання моделей ML для складних проектів.
- Аудіо зібрано, транскрибовано та анотовано: 22,250 годин
- Мови, що підтримуються: 13 (датська, корейська, арабська, саудівська, голландська, материкова та тайванська китайська, французька канадська, мексиканська іспанська, турецька, хінді, польська, японська, російська)
- Кількість висловлювань: 7M +
- Тимчасова шкала: 7-8 місяців

Збираючи аудіовисловлювання на 16 кГц, ми забезпечили здорове поєднання мовців за віком, статтю, освітою та діалектами в різних середовищах запису.
Результат
Високоякісні звукові дані від експертів-лінгвістів дозволили клієнту точно навчити свою багатомовну модель розпізнавання мовлення 13 глобальними мовами рівня 1 і 2. Завдяки наборам навчальних даних із золотим стандартом клієнт може запропонувати інтелектуальну та надійну цифрову допомогу для вирішення майбутніх реальних проблем.
Наша експертиза
Рекомендовані ресурси
Посібник покупця
Посібник покупця: Розмовний ШІ
Чат-бот, з яким ви спілкувалися, працює на передовій розмовній системі штучного інтелекту, яка навчена, протестована та створена з використанням безлічі наборів даних розпізнавання мовлення.
Блог
Стан розмовного ШІ 2025
Інфографіка Conversational AI 2025 розповідає про те, що таке Conversational AI, його еволюцію, типи, ринок Conversational AI за регіонами, випадки використання, проблеми тощо.
Блог
Як Siri та Alexa розуміють, що ви говорите?
Голосовими помічниками можуть бути ці круті, переважно жіночі голоси, які відповідають на ваші запити знайти найближчий ресторан або найкоротший шлях до торгового центру.