Тематичне дослідження збору даних про мовлення індійською мовою: 300 годин хінді, телугу та англійською мовами
Пропонували високоякісні послуги збору аудіоданих, транскрипції та анотації для навчання свого багатомовного голосового комплексу для обробки мовлення на базі штучного інтелекту.
Огляд проекту: Дані мовлення для платформи локалізації індійської мови
Клієнт створює технології, що долають мовний розрив у цифровому світі. Контент із додатків та порталів може надаватися кількома мовами в режимі реального часу завдяки їхній платформі «Мова як послуга». Мовна платформа надає статичний та динамічний контент із додатків та порталів кількома мовами в режимі реального часу.
Вони забезпечують локалізацію мов для кількох клієнтів, таких як мобільні бренди, виробники чипсетів, споживчий інтернет, банки та фінансові установи, освітні уряди, розважальні сфери тощо.
Ключові результати: 300 годин, зібраних трьома мовами
Зібрані, транскрибовані та анотовані аудіодані
300 год
№
мови
3 (100 годин x 3 мов)
Мови, транскрибовані та анотовані
Індійська англійська, хінді, телугу
Проекти
Хронологія
12 тижні
Завдання: пошук демографічно різноманітної розмовної мови
Відсутність доступу до кваліфікованих лінгвістів, експертів з анотування даних та жорсткі терміни стали перешкодою для розвитку та впровадження розмовного штучного інтелекту. Пошук лінгвістів, транскрибування та анотування великих обсягів наборів даних необхідної якості, достатньої для створення можливостей штучного інтелекту, є трудомістким та дорогим завданням, яке вимагає кваліфікованих ресурсів з різних галузей.
Критичними вимогами клієнта були:
- Доступ до кваліфікованих лінгвістів для колекції аудіо: Зберіть 300 годин аудіозаписів для таких мов, як індійська англійська, хінді та телугу, від досвідчених лінгвістів з демографічним різноманіттям.
- Складна аудіотранскрипція та анотація з мінімальною точністю 90%:
- Транскрибував усі аудіофайли, записуючи всі слова як сказані, включаючи вагання, слова-заповнювачі, фальстарти та інші вербальні тики
- Забезпечив безпомилковий вивід, незважаючи на суворі правила транскрипції, пов'язані з діалектною вимовою, неправильною вимовою слів, нестандартним використанням та пунктуацією.
- Доставка даних: Надання високоякісних та різноманітних аудіофайлів разом із відповідними транскриптами (формат JSON) для 3 мов протягом 12 тижнів.
Рішення: колекція аудіо, транскрипція та анотація для конкретної предметної області
Завдяки нашому глибокому розумінню розмовного штучного інтелекту, ми допомогли клієнту зібрати, транскрибувати та анотувати дані за допомогою команди досвідчених лінгвістів та анотаторів для навчання їхнього багатомовного голосового набору на базі штучного інтелекту.
Після оцінки багатьох постачальників, клієнт обрав Shaip через наш досвід у виконанні проектів розмовного штучного інтелекту у стислі терміни, економічно ефективно та з необхідною якістю. Їхня команда також була вражена надійними та комплексними можливостями Shaip щодо виконання проектів.
| Language | Кількість годин | Загальна розмова без сценарію (50%) | Розмова в кол-центрі без сценарію (30%) | Вилучений медіаконтент з Інтернету (20%) |
|---|---|---|---|---|
| Хінді | 100 | 50 | 30 | 20 |
| Англійська | 100 | 50 | 30 | 20 |
| Телегу | 100 | 50 | 30 | 20 |
| Усього: | 300 | 150 | 90 | 60 |
- Додаткова вимога до колекції аудіо
- Частота: Частота дискретизації – 16 кГц
- Формат: WAV
- Тривалість – Загальна тривалість (5-30 хв) – розмови
- Домен мовлення – BFSI, телекомунікації та роздрібна торгівля
- Демографічне різноманіття – стать: співвідношення 1:1, віковий діапазон: 18-60 років, ідентифікатор спікера для ідентифікації кожного унікального спікера
- Дотримано правил сегментації, транскрипції та анотації аудіо
2.1 Сегментація- Створюйте сегменти по 15 секунд кожен (з часовою міткою в мілісекундах) для окремих файлів, тривалістю понад 30 секунд
- Типи звуків сегментів – мовлення, балаканина, музика, шум, перекриття
- Маркування сегментів – час початку, час закінчення, ідентифікатор сегмента, рівень гучності, основний тип звуку,
код мови, ідентифікатор мовця
2.2 Транскрипція та анотація- Транскрибував усі аудіофайли, записуючи всі слова так, як вони були сказані, – включаючи вагання, слова-заповнювачі, фальстарти та інші вербальні тики, тобто символи, персонажі
- Забезпечив безпомилковий вивід, незважаючи на суворі правила транскрипції, пов'язані з діалектною вимовою, неправильною вимовою слів, нестандартним використанням, розділовими знаками, вживанням великих літер, абревіатурами, скороченнями, цифрами, акронімами, нечітким та незрозумілим мовленням, нецільовим текстом
мови та багато іншого.
- Доставка даних
Усі аудіофайли та транскрипти у форматі WAV були доставлені у форматі JSON відповідно до унікальної демографічної групи спікерів, включеної протягом 12 тижнів.
Результат: Готовий до виробництва багатомовний голосовий пакет
Високоякісні анотовані аудіодані від досвідчених лінгвістів дозволили клієнту точно навчити свій багатомовний голосовий пакет для обробки мовлення на базі штучного інтелекту трьом мовам, тобто індійській англійській, хінді та телугу, у встановлений час.
Завдяки наборам навчальних даних золотого стандарту, клієнт зміг запропонувати інтелектуальні та надійні послуги перетворення мовлення в текст, перекладу мов та багатомовних клавіатур для вирішення реальних проблем.
Ми були вражені потужними можливостями Shaip у виконанні проектів, їхньою експертизою у пошуку, транскрибуванні та анотуванні необхідних аудіоданих від досвідчених лінгвістів. Багаторазові перевірки якості, дотримання суворих термінів та лідерство у співвідношенні ціни та якості, які вони пропонують, не мають собі рівних.