Аналіз мовних емоцій і настроїв
Увімкнення інтелектуальних кол-центрів із статистикою на основі штучного інтелекту
Використання досвіду Shaip у зборі аудіоданих і анотаціях для покращення виявлення емоцій і настроїв у реальному часі для покращення обслуговування клієнтів.
Автоматизований аналіз емоцій і настроїв мови
Клієнт у партнерстві з Shaip розробив автоматизовану модель аналізу мовних емоцій і настроїв для кол-центрів. Проект передбачав збір і анотування 250 годин аудіоданих кол-центру на чотирьох англійських діалектах – США, Великобританії, Австралії та Індії. Це дозволило клієнту вдосконалити свої моделі штучного інтелекту для виявлення таких емоцій, як «Щасливий», «Нейтральний» і «Злий», а також настроїв, як-от «Незадоволений» і «Задоволений», у взаємодії з клієнтами в реальному часі.
Проект подолав такі проблеми, як виявлення сарказму, різна довжина аудіо та тонкі словесні сигнали невдоволення, забезпечуючи точні та масштабовані результати.
Основна статистика
Аудіодані кол-центру зібрані та анотовані на 4 англійських діалектах
250 год
Кількість мов
англійська США, британська, австралійська та індійська
Використовуйте випадки
Автоматизований аналіз емоцій і настроїв мови
Обсяг проекту
Зберіть і анотуйте 250 годин аудіоданих кол-центру на чотирьох діалектах англійської мови:
- англійська (30%)
- британська англійська (30%)
- Австралійська англійська (20%)
- індійська англійська (20%)
В межах
Проект складається з трьох частин:
- Аудіодані з певними сутностями, включаючи метадані.
- Відповідні транскрибовані файли з деталями сегментації та міток часу.
- Анотації про емоції та почуття:
- Звукові емоції: Щасливий, нейтральний, сердитий
- Почуття транскрипції: Надзвичайно незадоволений, Незадоволений, Нейтральний, Задоволений, Надзвичайно задоволений
Виклики
Різноманітність діалектів
Переконатися, що аудіодані точно представляють зазначені діалекти (США, Великобританія, Австралія та Індія) може бути складно. Різні регіони в цих категоріях можуть використовувати різноманітну лексику, акценти та вимову.
Вимога до експертизи
Анотування аудіо та транскрипцій на емоції та почуття потребує навчених анотаторів, знайомих із культурними нюансами та мовними тонкощами кожного діалекту.
Складність емоцій і настроїв
Емоції звуку та транскрипція не завжди збігаються. Наприклад, людина може здатися сердитою, але насправді висловити задоволення. Наприклад, обробка сарказмових розмов у саркастичних фразах на кшталт «О, чудово, ще одна людина, яка не може вирішити мою проблему», має бути правильно позначена емоціями та настроями.
Якість звуку
Якість аудіозаписів може змінюватися, що впливає на точність транскрипції та виявлення емоцій. Фоновий шум, розмови, що накладаються один на одного, і різне обладнання для запису можуть створити значні проблеми.
Точне захоплення
Невдоволення через словесні сигнали, такі як важкий видих або інші ознаки розчарування.
Рішення
Використовуючи передові методи обробки природної мови (NLP), було реалізовано такі рішення:
Збір даних
- 250 годин аудіоданих, розділених на квоти для діалекту.
- англійська (30% або 75 годин)
- британська англійська (30% або 75 годин)
- Австралійська англійська (20% або 50 годин)
- Індійська англійська (20% або 50 годин)
- Користувачі з рідним акцентом із США, Великобританії, Австралії та Індії.
- Зразки мовлення, що містять різні тони, з особливою увагою до тих випадків, коли голосова емоція – «Злий», а текст – «Незадоволений» або «Вкрай незадоволений».
Класифікація/анотація тексту

- Анотація емоцій і настроїв на основі конкретних категорій:
- Звукові емоції: Щасливий, нейтральний, сердитий.
- Почуття транскрипції: Надзвичайно незадоволений, Незадоволений, Нейтральний, Задоволений, Надзвичайно задоволений.
- Кожен аудіосегмент містив лише одну первинну емоцію.
- Різні сегменти затримки (від 2 до 30 секунд), що застосовуються в розмовах.
- Формат транскрипції слідував за виводом JSON, включаючи інформацію про лівого та правого динаміків, теги настроїв і настрої останнього сегмента.
Гарантія якості

Точність транскрипції:
- Переконався, що 250 годин аудіо було доставлено з мінімальними:
- 90% точність частоти помилок транскрипції (TER).
- 95% точність рівня розпізнавання слів (WER).
Процес контролю якості:
- Проводилися регулярні перевірки випадково відібраних зразків із набору даних.
- Використовував автоматизовані інструменти для вимірювання TER і WER у наборі даних.
- Перегляд позначених розділів вручну забезпечив дотримання порогових значень точності.
Результат
Навчальні дані сприятимуть розробці автоматизованої моделі виявлення емоцій і почуттів, забезпечуючи:
- Виявлення емоцій у режимі реального часу під час взаємодії з кол-центром.
- Більш ефективне вирішення складних випадків, таких як сарказм або невдоволення.
- Масштабованість для майбутніх проектів, легка адаптація до збільшених обсягів даних і більшої кількості мов.
Очікувані результати
- 250 годин аудіофайлів (у форматі PCM WAV 8 кГц, моно)
- Файли транскрипції (із сегментацією, тегами настрою та ідентифікаторами мовця)
- Метадані (тривалість аудіо, відомості про спікера тощо)
Партнерство з Shaip для нашого проекту обробки даних кол-центру стало ключовим моментом у розвитку наших рішень на основі штучного інтелекту. Їхня команда професійно зібрала та анотувала 250 годин аудіоданих у чотирьох ключових діалектах англійської мови – американському, британському, австралійському та індійському – забезпечуючи найвищу якість та точність. Увага до лінгвістичних нюансів у цих регіонах значно покращила точність наших моделей розпізнавання мовлення. Крім того, досвід Shaip у виконанні складних проектів анотації даних відіграв важливу роль у створенні надійних, сумісних моделей у великих масштабах.