Збір даних про висловлювання

Що таке «висловлювання» у штучному інтелекті?: приклади, набори даних та найкращі практики

Ви коли-небудь замислювалися, як чат-боти та віртуальні помічники прокидаються, коли ви говорите «Привіт, Siri» або «Alexa»? Саме завдяки збору текстових вимов або слів-ініціаторів, вбудованих у програмне забезпечення, система активується, щойно вона чує запрограмоване слово пробудження.

Однак загальний процес створення звуків і даних висловлювання не такий простий. Це процес, який потрібно виконувати з правильною технікою, щоб отримати бажані результати. Тому в цьому блозі буде описано шлях до створення хороших висловлювань/слів-ініціаторів, які бездоганно працюватимуть із вашим розмовним ШІ.

Що таке «висловлювання» у ШІ?

У розмовному штучному інтелекті (чат-боти, голосові помічники) висловлювання — це короткий фрагмент введеного користувачем тексту — точні слова, які людина вимовляє або вводить. Моделі використовують висловлювання, щоб визначити намір (мету) користувача та будь-які сутності (деталі, такі як дати, назви продуктів, суми).

Прості приклади

Бот для електронної комерції

Висловлювання: «Відстежити моє замовлення 123-456».

  • Намір: Відстеження замовлення
  • Сутність: order_id = 123-456

Телекомунікаційний бот

Висловлювання: «Оновіть мій тарифний план».

  • Намір: План змін
  • Сутність: тип_плану = дані

Голосовий помічник для банків

Висловлювання (усне): «W»Який мій поточний баланс сьогодні?"

  • Намір: Перевірити баланс
  • Сутності: account_type = розрахунковий, date = сьогодні

Чому вашому розмовному ШІ потрібні якісні дані про висловлювання

Якщо ви хочете, щоб ваш чат-бот або голосовий помічник був корисним, а не крихким, почніть з кращих даних про висловлювання. Дізнайтеся, як ми це зробили, у цій статті. тематичне дослідження колекції висловлювань — 22 тисячі годин 13 мовами. Висловлювання — це необроблені фрази, які люди вимовляють або друкують, щоб щось зробити («забронюйте мені кімнату на завтра», «змініть мій план», «який статус?»). Вони забезпечують класифікацію намірів, вилучення сутностей і, зрештою, взаємодію з клієнтами. Якщо ви бажаєте масштабувати це з партнером, Дані розмовного штучного інтелекту від Shaip Сервіси обробляють збір, транскрипцію та анотування від початку до кінця. Коли висловлювання різноманітні, репрезентативні та добре позначені, ваші моделі вивчають правильні межі між намірами та врівноважено обробляють безладні, реальні вхідні дані.

Створення власного репозиторію висловлювань: простий робочий процес

Створення репозиторію висловлювань

1. Почніть з мови реального користувача

Мій журнали чату, пошукові запити, транскрипти IVR, нотатки агентата електронні листи клієнтів. Згрупуйте їх за метою користувача, щоб визначити наміри. (Ви зможете вловити розмовні терміни та ментальні моделі, про які не подумаєте в кімнаті.)

2. Створюйте варіації навмисно

Для кожного наміру наведіть різні приклади:

  • Перефразуйте дієслова та іменники («скасувати», «зупинити», «закінчити»; «планувати», «підписка»).
  • Поєднуйте довжину речень та їх структуру (питання, директива, фрагмент).
  • Включайте друкарські помилки, скорочення, емодзі (для чату), перемикання кодів, де це доречно.
  • Додайте негативні випадки, які виглядають схожими, але повинні НЕ карту з цією метою.

3. Збалансуйте свої заняття

Надзвичайно однобічне навчання (наприклад, 500 прикладів для одного наміру та 10 для інших) шкодить якості прогнозування. Зберігайте розміри намірів відносно рівномірні і розвивайте їх разом, як вас навчає дорожній рух.

4. Перевірте якість перед навчанням

Блокуйте дані з низьким рівнем сигналу за допомогою валідатори під час створення/збірки:

  • Виявлення мови: переконайтеся, що приклади написані мовою перекладу.
  • Детектор абракадабру: ловити безглузді рядки.
  • Дублікати/майже дублікати чеків: підтримуйте високу різноманітність.
  • Регулярні вирази/орфографія та граматика: за потреби застосовувати правила стилю.
    Розумні валідатори (які використовуються Appen) можуть автоматизувати значну частину цього контролю доступу.

5. Послідовно позначайте об'єкти

Визначити типи слотів (дати, продукти, адреси) та показати анотатори як позначити межі. Візерунки як Візерунок будь-який у LUIS може усунути неоднозначність довгих, змінних проміжків (наприклад, імен документів), які плутають моделі.

6. Тестуйте, як у виробництві

Штовхати невидимий реальні висловлювання до кінцевої точки прогнозування або проміжного бота, неправильні класифікації рецензій та сприяти неоднозначні приклади в процесі навчання. Зробіть це циклом: збирати → навчати → переглядати → розширювати.

Що насправді означає «хаотична реальність» (і як з цим впоратися)

Справжні користувачі рідко говорять ідеальними реченнями. Очікуйте:

  • Фрагменти: «повернення коштів за доставку»
  • Складні цілі: «Скасувати замовлення та повторити замовлення синім»
  • Неявні сутності: «доставка до мого офісу» (ви повинні знати, в який саме офіс)
  • неоднозначність: «Змінити мій план» (який план? Коли набуває чинності?)

Практичні виправлення

  • Забезпечувати уточнюючі підказки лише за потреби; уникайте зайвих запитань.
  • захоплення перенесення контексту (займенники типу «той порядок», «останній»).
  • Скористайтеся кнопкою резервні наміри із цільовим відновленням: «Я можу допомогти зі скасуванням або зміною планів — що б ви хотіли?»
  • монітор здоров'я намірів (плутанина, колізія) та додайте дані там, де вони слабкі

Голосові помічники та слова для пробудження: різні дані, схожі правила

Голосові помічники та слова для пробудження Слова для пробудження («Привіт, Siri», «Alexa», власні фрази для пробудження) – це спеціалізована підмножина висловлювань із сильними акустичними обмеженнями, але освітній менталітет все ще застосовується: різноманітні динаміки, пристрої та середовища. Після пробудження, мовні висловлювання візьміть на себе фактичне завдання («увімкніть світло», «заграйте джаз»). будити та завдання набори даних різні та оцінювати їх окремо.

Коли (і як) використовувати готові дані, а коли користуватися спеціальними

Готові дані проти користувацьких даних

  • З полиці: розпочати охоплення в нових місцях, а потім виміряти, де залишається непорозуміння.
  • індивідуальні умови: фіксуйте мову вашої теми (терміни політики, назви продуктів) та «голос бренду».
  • Змішаний: почніть із загального, а потім додайте високоточні дані для намірів з найбільшим впливом на відхилення або дохід.

Якщо вам потрібен швидкий виїзд на територію, Shaip надає його колекція висловлювань та готові набори даних мовлення/чату багатьма мовами; див. тематичне дослідження щодо розгортання багатомовного помічника.

Контрольний список впровадження

Контрольний список впровадження

  • Визначте наміри та сутності на прикладах та негативний випадків
  • автор різноманітний, збалансований висловлювання для кожного наміру (почніть з малого, збільшуйте щотижня)
  • Додайте валідатори (мову, абракадабру, дублікати, регулярні вирази) перед навчанням
  • Створювати цикли перегляду від реального трафіку; просувати неоднозначні елементи до навчання 
  • Відслідковувати здоров'я намірів та зіткнення; виправити новими висловлюваннями
  • Переоцінити за каналом/локацією, щоб вчасно виявити дрейф

Як Шайп може допомогти

  • Колекція та маркування користувацьких висловлювань (чат + голосовий зв'язок) з валідаторами для підтримки високої якості.
  • Готові до використання набори даних на понад 150 мовах/варіантах для швидкого завантаження.
  • Поточні програми огляду які безпечно перетворюють живий трафік на високосигнальні навчальні дані (засоби контролю PII).

Ознайомтеся з нашими багатомовними тематичне дослідження колекції висловлювань.

Сподобалася ця стаття? Слідкуйте за Shaip у LinkedIn, щоб отримувати більше оновлень.

Соціальна Поділитися