Автоматичне розпізнавання мовлення

Що таке технологія перетворення мовлення в текст і як вона працює в автоматичному розпізнаванні мовлення

Автоматичне розпізнавання мовлення (ASR) пройшло довгий шлях. Незважаючи на те, що він був винайдений давно, ним майже ніхто не користувався. Однак час і технології зараз істотно змінилися. Транскрипція аудіо зазнала значного розвитку.

Завдяки таким технологіям, як AI (штучний інтелект), процес перекладу звуку в текст забезпечує швидкі й точні результати. У результаті кількість його застосувань у реальному світі також зросла: деякі популярні програми, такі як Tik Tok, Spotify і Zoom, вбудовують цей процес у свої мобільні програми.

Тож давайте дослідимо ASR і дізнаємося, чому це одна з найпопулярніших технологій у 2022 році.

Що таке мовлення в текст?

Перетворення мовлення на текст (STT), яке також називають автоматичним розпізнаванням мовлення (ASR), перетворює розмовний звук на письмовий текст. Сучасні системи – це програмні сервіси, які аналізують аудіосигнали та виводять слова з позначками часу та показниками достовірності.

Для команд, що створюють UX для контакт-центрів, охорони здоров'я та голосового зв'язку, STT є шлюзом до розмов з можливістю пошуку та аналізу, допоміжних субтитрів та подальшого використання штучного інтелекту, такого як підсумовування або контроль якості.

Загальні назви мовлення в текст

Ця вдосконалена технологія розпізнавання мовлення також популярна та називається такою назвою:

  • Автоматичне розпізнавання мови (ASR)
  • Розпізнавання мови
  • Комп'ютерне розпізнавання мови
  • Аудіо транскрипція
  • Читання з екрана

Застосування технології перетворення мовлення в текст

Контактні центри

Стенограми в режимі реального часу допомагають операторам у реальному часі; пакетні стенограми допомагають контролювати якість, проводити аудити відповідності та створювати архіви викликів з можливістю пошуку.

Приклад : Використовуйте потокову ASR для відображення підказок у режимі реального часу під час суперечки щодо виставлення рахунків, а потім запустіть пакетну транскрипцію після дзвінка для оцінки контролю якості та автоматичного створення підсумку.

Охорона здоров'я

Клініцисти диктують нотатки та отримують звіти про візити; стенограми підтримують кодування (CPT/ICD) та клінічну документацію — завжди з дотриманням заходів захисту захищеної медичної інформації (PHI).

Приклад : Постачальник медичних послуг записує консультацію, запускає ASR для складання чернетки нотатки SOAP та автоматично виділяє назви препаратів і життєво важливі показники для перевірки кодувальником із застосуванням редагування PHI.

Медіа та освіта

Створюйте субтитри/титри для лекцій, вебінарів та трансляцій; додавайте легке редагування людиною, коли вам потрібна майже ідеальна точність.

Приклад : Університет пакетно транскрибує відеолекції, потім рецензент виправляє імена та жаргон перед публікацією доступних субтитрів.

Голосові продукти та IVR

Розпізнавання слів та команд пробудження забезпечує UX-інтерфейс без використання рук у додатках, кіосках, транспортних засобах та смарт-пристроях; IVR використовує транскрипти для маршрутизації та вирішення.

Приклад : Банківський IVR розпізнає команду «заморозити мою картку», підтверджує дані та запускає робочий процес — навігація за допомогою клавіатури не потрібна.

Операції та знання

Зустрічі та виїзні дзвінки стають текстом з можливістю пошуку, включаючи позначки часу, доповідачів та пункти дій для коучингу та аналітики.

Приклад : Розмови про продажі транскрибуються, позначаються тегами за темами (ціноутворення, заперечення) та узагальнюються; менеджери фільтрують за «ризиком поновлення», щоб планувати подальші дії.

Чому варто використовувати мовлення для перетворення тексту?

  • Зробіть розмови видимимиПеретворюйте години аудіо на текст із можливістю пошуку для аудитів, навчання та аналізу даних клієнтів. 
  • Автоматизація ручної транскрипціїСкоротіть час виконання та витрати порівняно з робочими процесами, що виконуються лише людиною, зберігаючи при цьому людський допуск, коли якість має бути ідеальною. 
  • ШІ нижче за течією живленняПідсумок транскриптів, вилучення намірів/тем, позначки відповідності та коучинг. 
  • Покращте доступністьСубтитри та транскрипти допомагають користувачам із втратою слуху та покращують UX у галасливому середовищі. 
  • Підтримка рішень у режимі реального часуПотокове передавання ASR дозволяє отримувати консультації під час виклику, форми в режимі реального часу та моніторинг у реальному часі. 

Переваги технології перетворення мовлення в текст

Гнучкість швидкості та режиму

Потокове передавання забезпечує часткові фрагменти з точністю до секунди для використання в прямому ефірі; пакетна передача обробляє відкладені фрагменти завдяки багатшій постобробці.

Приклад : Потокові транскрипти для допомоги агента; пакетне повторне транскрибування пізніше для архівів якості контролю якості.

Вбудовані якісні функції

Отримайте ведення щоденника, пунктуацію/регістр, позначки часу та підказки фраз/спеціальний словник для роботи з жаргоном.

Приклад : Позначте чергування лікаря/пацієнта та підкресліть назви ліків, щоб вони правильно транскрибувалися.

Вибір розгортання

Використовуйте хмарні API для масштабування/оновлень або локальні/периферійні контейнери для зберігання даних та низької затримки.

Приклад : Лікарня використовує ASR у своєму центрі обробки даних, щоб забезпечити локальний доступ до захищеної медичної інформації.

Налаштування та багатомовність

Усунення прогалин у точності за допомогою списків фраз та адаптації до домену; підтримка кількох мов та перемикання кодів.

Приклад : Фінтех-додаток підвищує популярність назв брендів та тікерів англійською/хінглішом, а потім уточнює їх для нішевих термінів.

Розуміння роботи автоматичного розпізнавання мовлення

Робочий процес розпізнавання мовлення

Робота програмного забезпечення для перекладу аудіо в текст є складною та передбачає реалізацію кількох кроків. Як ми знаємо, перетворення мови в текст — це ексклюзивне програмне забезпечення, призначене для перетворення аудіофайлів у текстовий формат, який можна редагувати; це робиться за допомогою розпізнавання голосу.

Процес

  • Спочатку за допомогою аналого-цифрового перетворювача комп’ютерна програма застосовує лінгвістичні алгоритми до наданих даних, щоб відрізнити вібрацію від звукових сигналів.
  • Потім відповідні звуки фільтруються шляхом вимірювання звукових хвиль.
  • Крім того, звуки розподіляються/сегментуються на соті чи тисячні частки секунди та порівнюються з фонемами (вимірюваною одиницею звуку, щоб відрізнити одне слово від іншого).
  • Фонеми далі проходять через математичну модель для порівняння наявних даних із добре відомими словами, реченнями та фразами.
  • Результатом є текстовий або комп’ютерний аудіофайл.

[Читайте також: Повний огляд автоматичного розпізнавання мовлення ]

Яке використання мови в текст?

Існує багато програм для автоматичного розпізнавання мовлення, наприклад

  • Пошук вмісту: Більшість із нас перейшли від введення букв на телефоні до натискання кнопки, щоб програмне забезпечення розпізнало наш голос і дало бажані результати.
  • Обслуговування Клієнтів: Чат-боти та помічники зі штучним інтелектом, які можуть направляти клієнтів через кілька початкових кроків процесу, стали поширеними.
  • Субтитри в реальному часі: завдяки розширенню глобального доступу до вмісту субтитри в режимі реального часу стали помітним і значним ринком, що сприяє розвитку ASR для їх використання.
  • Електронна документація: Декілька адміністративних департаментів почали використовувати ASR для виконання завдань документації, сприяючи підвищенню швидкості та ефективності.

Які ключові проблеми для розпізнавання мовлення?

Акценти та діалекти . Одне й те саме слово може звучати дуже по-різному в різних регіонах, що заплутує моделі, навчені на «стандартному» мовленні. Виправлення просте: збирайте та тестуйте аудіозаписи з акцентами, а також додавайте підказки щодо фраз/вимов для імен брендів, місць та осіб.

Контекст та омофони. Вибір правильного слова («до/занадто/два») потребує навколишнього контексту та знань предметної області. Використовуйте сильніші мовні моделі, адаптуйте їх до власного тексту предметної області та перевіряйте критичні сутності, такі як назви ліків або артикули.

Шум та погані аудіоканали . Трафік, перехресні перешкоди, кодеки дзвінків та мікрофони дальньої дії приховують важливі звуки. Зменште шум та нормалізуйте аудіо, використовуйте виявлення голосової активності, імітуйте реальний шум/кодеки під час навчання та віддавайте перевагу кращим мікрофонам, де це можливо.

Перемикання кодів та багатомовне мовлення . Люди часто змішують мови або перемикаються посеред речення, що порушує одномовні моделі. Вибирайте багатомовні або моделі з урахуванням перемикання кодів, оцінюйте аудіо на різних мовах та ведіть списки фраз, специфічних для певної локалізації.

Кілька спікерів та їх перекриття . Коли голоси перекриваються, транскрипти розмивають «хто що сказав». Увімкніть ведення діаграми спікерів для позначення поворотів та використовуйте розділення/формування променя, якщо доступний аудіо з кількох мікрофонів.

Відеопідказки в записах . У відео рухи губ і текст на екрані додають значення, яке сам лише звук може пропустити. Там, де якість має значення, використовуйте аудіовізуальні моделі та поєднуйте ASR з OCR для захоплення назв, імен та термінів слайдів.

Якість анотацій та позначень . Непослідовні транскрипти, неправильні теги доповідачів або недбала пунктуація підривають як навчання, так і оцінювання. Встановіть чіткий стильовий посібник, регулярно перевіряйте зразки та створіть невеликий золотий набір для оцінки послідовності анотаторів.

Конфіденційність та відповідність . Дзвінки та клінічні записи можуть містити персональну/захищену медичну інформацію (PII/PHI), тому зберігання та доступ мають бути суворо контрольовані. Редагуйте або анонімізуйте вихідні дані, обмежте доступ та оберіть хмарне, а не локальне/периферійне розгортання, щоб відповідати вашій політиці.

Як вибрати найкращого постачальника послуг перетворення мовлення в текст

Оберіть постачальника, протестувавши аудіо (акценти, пристрої, шум) та зваживши точність з урахуванням конфіденційності, затримки та вартості. Почніть з малого, виміряйте, а потім масштабуйте.

Спочатку визначте потреби

  • Варіанти використання: потокове передавання, пакетне передавання або обидва
  • Мови/акценти (включно з перемиканням кодів)
  • Аудіоканали: телефон (8 кГц), додаток/робочий стіл, дальнє поле
  • Конфіденційність/місцезнаходження: PII/PHI, регіон, зберігання, аудит
  • Обмеження: цільова затримка, угода про рівень обслуговування, бюджет, хмара чи локальна/периферійна мережа

Оцініть свій аудіозапис

  • Точність: WER + точність сутностей (жаргон, назви, коди)
  • Багатомовний: якість ведення діалогу (хто коли говорив)
  • Форматування: пунктуація, регістр, цифри/дати
  • Потокове передавання: затримка + стабільність TTFT/TTF
  • Функції: списки фраз, користувацькі моделі, редагування, часові позначки

Запитайте в запиті пропозицій

  • Показати необроблені результати на нашому тестовому наборі (за акцентом/шумом)
  • Забезпечуємо затримку потокового передавання p50/p95 для наших кліпів
  • Точність діаризації для 2–3 мовців з перекриттям
  • Обробка даних: обробка в регіоні, зберігання, журнали доступу
  • Шлях від списків фраз → користувацька модель (дані, час, вартість)

Слідкуйте за червоними прапорцями

  • Чудова демонстрація, слабкі результати на вашому аудіо
  • «Ми виправимо це тонким налаштуванням», але плану/даних немає
  • Приховані платежі за ведення щоденника/редагування/зберігання

[Читайте також: Розуміння процесу збору аудіоданих для автоматичного розпізнавання мовлення ]

Майбутнє технології перетворення мовлення в текст

Більші багатомовні «базові» моделі. Очікуйте окремі моделі, які охоплюють понад 100 мов з кращою точністю при низьких ресурсах завдяки масовому попередньому навчанню та легкому налаштуванню.

Мовлення + переклад в одному стеку. Уніфіковані моделі оброблятимуть ASR, переклад мовлення в текст і навіть мовлення в мовлення, зменшуючи затримку та зчеплення коду.

Розумніше форматування та ведення щоденника за замовчуванням. Автоматична пунктуація, регістр, цифри та надійне маркування «хто говорив і коли» будуть дедалі частіше вбудовані як для пакетної, так і для потокової передачі.

Аудіовізуальне розпізнавання для складних умов. Підказки по губах та текст на екрані (OCR) покращать транскрипти, коли аудіо шумне — це вже динамічна галузь досліджень та ранніх прототипів продуктів.

Навчання з урахуванням конфіденційності та налаштування на пристроях/периферії. Федеративне навчання та контейнеризоване розгортання дозволять зберігати дані локально, водночас покращуючи моделі, що важливо для регульованих секторів.

Штучний інтелект, що враховує нормативні акти. Терміни виконання Закону ЄС про штучний інтелект означають більшу прозорість, контроль ризиків та документацію, вбудовану в продукти та закупівлі STT.

Багатша оцінка, що виходить за рамки WER. Команди стандартизуватимуть точність сутностей, якість ведення діаграми, затримку (TTFT/TTF) та справедливість для різних акцентів/пристроїв, а не лише для заголовків WER.

Як Shaip допомагає вам досягти цього

Хоча ці тенденції й розвиваються, успіх все ще залежить від ваших даних . Shaip надає багатомовні набори даних з акцентами, безпечну для PHI деідентифікацію та набори золотих тестів (WER, сутність, діаризація, затримка) для справедливого порівняння постачальників та налаштування моделей, щоб ви могли впевнено використовувати майбутнє STT. Зверніться до експертів Shaip з даних ASR, щоб спланувати швидкий пілотний проект.

Сподобалася ця стаття? Слідкуйте за Shaip у LinkedIn, щоб отримувати більше оновлень.

Соціальна Поділитися