Транскрипція та анотація аудіо індійською мовою: тематичне дослідження розмовного штучного інтелекту

Пропонували високоякісні послуги з транскрипції та анотації аудіо для навчання їхнього механізму обробки мовлення на базі штучного інтелекту.

Багатомовний розмовний штучний інтелект

Огляд проекту: Створення багатомовного мовного двигуна для індійських мов 

Клієнт — це індійська лабораторія-піонер у розробці продуктів штучного інтелекту, яка присутня на ринках США, Індії, Канади та кількох інших країн. Їхнє бачення полягає в розширенні людського потенціалу за допомогою технологій. Вони мають понад десять років передового досвіду в галузі нейролінгвістики, наукових досліджень у сфері штучного інтелекту, машинного навчання, аналітики, візуалізації та супутніх технологій.

Вони розширюють межі взаємодії людини та машини за допомогою своїх продуктів на основі штучного інтелекту, таких як ICOG та Autovox. ICOG — це персоналізований інтелектуальний віртуальний помічник у навчанні на основі штучного інтелекту для цілей навчання та трансформації робочої сили, тоді як Autovox — це система мовлення на базі штучного інтелекту.
Механізм обробки індійських мов.

Розмовний ай

Ключові результати: 1,200 годин з анотаціями 6 мовами

Аудіо розшифровано та анотовано

1,200 год


мови

6 (200 годин x 6 мов)

Мови, транскрибовані та анотовані

Індійська англійська, хінді, тамільська, телугу, каннада, малаялам

Проекти
Хронологія

10 тижні

Завдання: пошук досвідчених лінгвістів для аудіоанотацій індійською мовою

Відсутність доступу до кваліфікованих лінгвістів, експертів з анотування даних та час виходу на ринок стали перешкодою у розвитку та впровадженні розмовного штучного інтелекту. Пошук лінгвістів, транскрибування та анотування великих обсягів наборів даних з необхідною якістю, достатньою для створення можливостей штучного інтелекту, завжди було трудомістким і дорогим завданням, яке вимагає кваліфікованих ресурсів з різних галузей. Незважаючи на наявність внутрішньої команди анотаторів, вони стикалися з проблемами зі своєчасним постачанням та якістю анотацій.

Критичними вимогами клієнта були:

  1. Доступ до кваліфікованих лінгвістів: Відсутність доступу до кваліфікованих лінгвістів для індійських мов, таких як індійська англійська, хінді, тамільська, телугу, каннада, малаялам
  2. Аудіотранскрипція та анотація: Складні правила аудіоанотації та транскрипції з мінімальною точністю 95%
  3. Доставка даних: Файли стенограм мають бути надані у форматі JSON протягом 10 тижнів.

Рішення: аудіотранскрипція та анотація від досвідчених лінгвістів

Маючи глибоке розуміння розмовного штучного інтелекту, ми допомогли клієнту транскрибувати та анотувати надані набори даних, залучивши команду досвідчених лінгвістів та анотаторів для навчання їхнього механізму обробки мовлення на базі штучного інтелекту для індійських мов.

Після оцінки багатьох постачальників (включаючи кількох важковаговиків у галузі), клієнт обрав Shaip завдяки нашому досвіду у виконанні великих проектів розмовного штучного інтелекту у стислі терміни, а також якості, яку ми пропонували за конкурентними цінами.

  1. Дотримано правил аудіотранскрипції та анотації
    • Тип анотованого аудіо: мовлення та немовлення
    • Якщо тип аудіо вибраного сегмента позначено як мова, тоді необхідно вибрати тип мови, тобто Чиста мова, Мова + Музика, Мова + Шум, Незрозуміла мова
    • Вибраний сегмент мовлення має бути позначений саме мовою, якою розмовляє оратор
    • Анотатор повинен позначити регіони тегами спікерів. Різні спікери повинні бути
      позначені різними тегами динаміків.
    • Анотатор повинен вибрати стать мовця, тобто чоловік чи жінка.
    • Текст має бути написаний так, як озвучено в аудіо, і має бути граматично правильним
    • Якщо вибраний тип аудіо не є мовленням, йому слід призначити одну з міток: без мовлення, музика, цмокання губами, дихання, кашель, сміх, дзвін, DTMF, лепет, шум транспортного засобу та періодичний шум переднього плану.
    • Усі сегменти аудіо мають бути позначені тегами, і лише після цього їх можна буде завантажити в систему.
  2. Доставка даних
    Усі файли транскриптів були доставлені у форматі JSON відповідно до заданих вимог до метаданих протягом 10 тижнів.

Результат: Готовий до виробництва багатомовний розмовний рушій штучного інтелекту

Високоякісні анотовані аудіодані від досвідчених лінгвістів дозволили клієнту точно навчити свій механізм обробки мовлення на базі штучного інтелекту 6 індійським мовам, тобто індійській англійській, хінді, тамільській, телугу, каннада, малаялам, у встановлений термін.

Завдяки наборам навчальних даних золотого стандарту, клієнт зможе запропонувати інтелектуальну та надійну систему мовлення з багатомовними можливостями, яка використовує наскрізні (E2E) та гібридні моделі для вирішення реальних проблем. Простіше кажучи, це створення розмовного штучного інтелекту (такого як Alexa, Siri), спеціально орієнтованого на індійських споживачів.

Цитата значок

Ми були приємно вражені надійним управлінням робочими процесами Shaip, швидким часом виконання замовлень, їхнім досвідом у розмовному штучному інтелекті та мережею досвідчених лінгвістів. Крім того, лідерство у співвідношенні ціни та якості, яке вони пропонують, не має собі рівних.

★ ★ ★ ★ ★
Цитата значок