Приклад: автоматичне розпізнавання мовлення
Зібрано понад 8 тисяч годин аудіо, 800 годин транскрибовано для технології багатомовного голосу
Вступ
Індії потрібна була платформа, яка зосереджена на створенні багатомовних наборів даних і мовних технологічних рішень на основі ШІ, щоб надавати цифрові послуги індійськими мовами. Щоб запустити цю ініціативу, The Client співпрацює з Shaip, щоб зібрати та транскрибувати індійську мову для створення багатомовних моделей мовлення.
Об'єм
Виклики
Щоб допомогти клієнту з його дорожньою картою розвитку мовленнєвих технологій для індійських мов, команді потрібно було отримати, сегментувати та транскрибувати великі обсяги навчальних даних для створення моделі штучного інтелекту. Критичними вимогами клієнта були:
Збір даних
- Отримайте 8000 годин тренувальних даних із віддалених місць Індії
- Постачальник для збору спонтанного мовлення від вікових груп 20-70 років
- Забезпечте різноманітне поєднання мовців за віком, статтю, освітою та діалектами
- Кожен аудіозапис має бути принаймні 16 кГц із 16 бітами/зразок.
Транскрипція даних
Дотримуйтеся вказівок щодо транскрипції деталей щодо символів і спеціальних символів, орфографії та граматики, великої літери, скорочень, скорочень, окремих промовистих літер, цифр, знаків пунктуації, акронімів та ініціалів, невиразної мови, нерозбірливої мови, нецільових мов, немовлення
Перевірка якості та відгук
Усі записи мають пройти оцінку якості та перевірку, надаватимуться лише перевірені записи мовлення
Рішення
Завдяки нашому глибокому розумінню розмовного штучного інтелекту ми допомогли клієнту зібрати, транскрибувати аудіодані з командою експертів-колекціонерів, лінгвістів і анотаторів, щоб створити великий корпус аудіоданих із віддалених куточків Індії.
Обсяг роботи для Шайпа включав, але не обмежувався, отримання великих обсягів аудіонавчальних даних, транскрипцію даних і доставку відповідних файлів JSON, що містять метадані [як для ораторів, так і для транскрипторів. Для кожного мовця метадані включають анонімний ідентифікатор мовця, деталі пристрою, демографічну інформацію, як-от стать, вік та освіта, а також його пін-код, соціально-економічний статус, мови, якими вони спілкуються, і дані про тривалість їхнього перебування. Для кожного транскриптора дані включають анонімний ідентифікатор транскриптора, демографічні дані, подібні до носіїв, тривалість їхнього досвіду транскрипції та детальну розбивку мов, якими вони можуть читати, писати та розмовляти.
Шайп зібрав 8000 годин аудіоданих / спонтанного мовлення у великому масштабі та транскрибував 800 годин, зберігаючи бажаний рівень якості, необхідний для навчання технології мовлення для складних проектів. Від кожного учасника було отримано форму явної згоди. Зібране / спонтанне мовлення базувалося на зображеннях, наданих університетом. З 3500 зображень 1000 є загальними, а 2500 стосуються культури конкретного району, фестивалів тощо. Зображення зображують різні сфери, такі як залізничні вокзали, ринки, погода тощо.
Збір даних
| стан | Райони | Години аудіо | Транскрипція (год.) |
|---|---|---|---|
| Біхар | Саран, Східний Чампаран, Гопалгандж, Сітамархі, Самастіпур, Дарбханга, Мадхепура, Бхагалпур, Гая, Кішангандж, Вайшалі, Лакхісараї, Сахарса, Супаул, Арарія, Бегусарай, Джаханабад, Пурнія, Музаффарпур, Джамуї | 2000 | 200 |
| Уттар-Прадеш | Деорія, Варанасі, Горахпур, Газіпур, Музаффарнагар, Етах, Хамірпур, Джйотіба Пхуле Нагар, Будаун, Джалаун | 1000 | 100 |
| Раджастхан | Нагаур, Чуру | 200 | 20 |
| Уттаракханд | Тері Гарвал, Уттаркаші | 200 | 20 |
| Чхаттісгарх | Біласпур, Райгарх, Кабірхем, Саргуджа, Корба, Джашпур, Раджнандгаон, Балрампур, Бастар, Сукма | 1000 | 100 |
| Західна Бенгалія | Пашим Медініпур, Мальда, Джалпайгурі, Пурулія, Калькутта, Джаграм, Північний 24 Парганас, Дакшин Дінаджпур | 800 | 80 |
| Джаркханд | Сахебгандж, Джамтара | 200 | 20 |
| Андхра-Прадеш | Гунтур, Чіттур, Вішакхапатнам, Крішна, Анантапур, Шрікакулам | 600 | 60 |
| Telangana | Карімнагар, Налгонда | 200 | 20 |
| Гоа | Північний та Південний Гоа | 100 | 10 |
| Карнатака | Дакшин каннада, Гулбарга, Дхарвад, Белларі, Майсур, Шимога, Біджапур, Белгаум, Райчур, Чамраджнагар | 1000 | 100 |
| Махараштра | Сіндхудург, Дуле, Нагпур, Пуна, Аурангабад, Чандрапур, Солапур | 700 | 70 |
| Усього: | 8000 | 800 | |
Загальні вказівки
сформований
- Аудіо на 16 кГц, 16 біт/зразок.
- Одноканальний.
- Необроблений аудіо без перекодування.
стиль
- Спонтанна мова.
- Речення на основі зображень, наданих університетом. З 3500 зображень 1000 є загальними, а 2500 пов’язані з місцевою культурою, фестивалями тощо. Зображення зображують різні сфери, наприклад вокзали, ринки, погоду тощо.
Фон запису
- Записано в тихому середовищі без відлуння.
- Жодних перешкод смартфону (вібрації чи сповіщень) під час запису.
- Жодних спотворень, як-от обрізки чи ефектів далекого поля.
- Вібрація від телефону неприпустима; зовнішня вібрація допустима, якщо звук чистий.
Специфікація динаміка
- Віковий діапазон від 20 до 70 років із збалансованим гендерним розподілом за районами.
- Мінімум 400 носіїв мови в кожному районі.
- Носії повинні використовувати рідну мову/діалект.
- Форми згоди обов'язкові для всіх учасників.
Перевірка якості та критична гарантія якості
Процес перевірки якості надає пріоритет гарантії якості аудіозаписів і транскрипцій. Аудіостандарти зосереджені на точних тишинах, тривалості сегменту, чіткості одного динаміка та детальних метаданих, зокрема про вік і соціально-економічний статус. Критерії транскрипції підкреслюють точність тегів, правдивість слів і правильні деталі сегмента. Тест прийнятності диктує, що якщо більше 20% партії аудіо не відповідає цим стандартам, вона відхиляється. Для менш ніж 20% розбіжностей потрібні замінні записи з подібними профілями.
Транскрипція даних
Правила транскрипції наголошують на точності та дослівній транскрипції лише тоді, коли слова чіткі та зрозумілі; незрозумілі слова позначаються як [нерозбірливо] або [нерозбірливо] залежно від проблеми. Межі речень у довгому аудіо позначено , і заборонено перефразувати чи виправляти граматичні помилки. Дослівна транскрипція охоплює помилки, сленг і повторення, але пропускає фальстарти, наповнювачі та заїкання. Фонові та передні шуми транскрибуються за допомогою описових тегів, тоді як власні імена, назви та числа дотримуються певних правил транскрипції. Мітки мовця використовуються для кожного речення, а незакінчені речення позначаються знаком.
Робочий процес проекту
Робочий процес описує процес транскрипції аудіо. Це починається з адаптації та навчання учасників. Вони записують аудіо за допомогою програми, яка завантажується на платформу контролю якості. Це аудіо проходить перевірку якості та автоматичну сегментацію. Потім технічна команда готує сегменти для транскрипції. Після ручної транскрипції є етап перевірки якості. Транскрипції доставляються клієнту, і якщо вони прийняті, доставка вважається завершеною. Якщо ні, зміни вносяться на основі відгуків клієнтів.
Результат
Високоякісні аудіодані від експертів-лінгвістів дозволять нашому клієнту точно навчити та створити багатомовні моделі розпізнавання мовлення різними індійськими мовами з різними діалектами в обумовлений час. Моделі розпізнавання мовлення можна використовувати для:
- Подолайте мовний бар’єр для цифрової інклюзії, підключивши громадян до ініціатив їхньою рідною мовою.
- Сприяє цифровому врядуванню
- Каталізатор для формування екосистеми послуг і продуктів індійськими мовами
- Більше локалізованого цифрового контенту в сферах суспільного інтересу, зокрема, управління та політики
Ми вражені досвідом Шайпа у сфері розмовного штучного інтелекту. Завдання обробки 8000 годин аудіоданих разом із 800 годинами транскрипції у 80 різних районах було, м’яко кажучи, монументальним. Саме глибоке розуміння Шайпом складних деталей та нюансів цієї галузі зробило можливим успішне виконання такого складного проєкту. Їхня здатність безперешкодно керувати та орієнтуватися в складнощах цього величезного обсягу даних, забезпечуючи при цьому найвищу якість, справді заслуговує на похвалу.