Розпізнавання тексту OCR та анотації транскрипції

Як Shaip створив обмежувальну рамку на рівні слів + анотацію транскрипції на рівні символів для різних текстових джерел — друкованих документів, рукописного введення, вивісок, номерних знаків, квитанцій — створену як набір даних OCR та аналітики документів виробничого рівня з точністю 99%.

Розпізнавання тексту OCR та транскрипція анотацій

Огляд проекту

Оскільки оптичне розпізнавання символів (OCR) виходить за рамки чистих друкованих документів і переходить до текстової інформації з реальних сцен та аналітики документів, клієнту потрібен був конвеєр анотацій, здатний обробляти різноманітні типи тексту, шрифти, орієнтації, мови та стан поверхні з просторовою точністю та точністю на рівні символів.

Shaip створив комплексний конвеєр анотацій, що охоплює розміщення обмежувальних рамок на рівні слів, точну транскрипцію символів, багатоатрибутне тегування та подвійний просторовий + транскрипційний контроль якості, створюючи готові до моделі набори даних OCR для понад 10 типів джерел тексту.

Основна статистика

Анотація для кожного зображення

100 слів

Поріг точності

99%

Джерела тексту

10 +

Шари атрибутів

5

Виклики

  • Анотування кожен видимий екземпляр тексту на рівні слів — сотні на щільне зображення
  • Об'єднання точність просторової обмежувальної рамки з точна транскрипція на рівні символів паралельно
  • Обробка викривлений, спотворений перспективою та повернутий текст на вивісках та етикетках продуктів
  • Переписування бляклий, низькоконтрастний та частково закритий слова без вгадування нерозбірливих символів
  • управління текст змішаною мовою та кількома шрифтами в межах одного й того ж зображення

Рішення

Просторова анотація на рівні слів

Кожен видимий екземпляр тексту на кожному зображенні був окремо анотований щільно підігнаною обмежувальною рамкою на рівні слова, що фіксувало точне просторове розташування кожного текстового елемента. Для щільних зображень, таких як квитанції чи форми, це означало сотні окремих анотацій на зображення, кожна з яких підтримувала точність вирівнювання по базовій лінії.

Транскрипція на рівні символів

Поряд з обмежувальною рамкою анотатори транскрибували точний текстовий вміст кожного слова, включаючи цифри, спеціальні символи, розділові знаки та буквено-цифрові комбінації. Цей подвійний робочий процес — просторовий + транскрипція — виконувався паралельно з правилами узгодженості на обох шарах.

Багатоджерельне висвітлення

Висвітлення охоплювало дуже різноманітні джерела: друковані документи, рукописні нотатки, вуличні вивіски, етикетки на продуктах, номерні знаки, вітрини магазинів, рекламні щити, квитанції, рахунки-фактури, меню та поля форм. Кожен тип джерела мав власні правила анотації, адаптовані до його візуальних характеристик.

5-рівневе тегування атрибутів

Кожна область анотованого тексту була збагачена атрибутами, що охоплюють орієнтацію тексту (горизонтальну, вертикальну, діагональну), мову та тип письма, чіткість тексту (чітко читабельний, частково читабельний, повністю нечитабельний), стиль шрифту (друкований чи рукописний) та тип фону тексту (звичайний, візерунчастий, складний). Цей насичений шар атрибутів дозволяє навченій моделі обробляти різноманітні реальні текстові умови, що виходять далеко за рамки стандартного оптичного розпізнавання символів у документах.

Поріг видимості та подвійний контроль якості

Суворі правила регулювали мінімальні пороги видимості — нерозбірливий текст позначався прапорцем, а не вгадувався, що зберігало цілісність набору даних. Кожне анотоване зображення проходило дворівневий процес перевірки якості, що поєднував перевірку точності обмежувальної рамки та перевірку точності транскрипції, з порогом точності 99% для обох шарів.

Обсяг проекту

Тип набору даних Рівень анотації Джерела Attributes QA Точність
Розпізнавання тексту OCR + транскрипція Слова в блоках + транскрипція символів 10+ типів джерел 5 шарів атрибутів Подвійний просторовий + транскрипційний контроль якості 99%

Результати

  • Створений a подвійний конвеєр транскрипції на рівні слів у просторовому та символьному форматах для оптичного розпізнавання символів (OCR) зі штучним інтелектом
  • Стандартизований 10+ охоплень джерел тексту охоплюючи документи, текст сцени та рукописний текст
  • Доставлений 5 шарів атрибутів для орієнтації, мови, чіткості, шрифту та фону
  • Підтримується 99% точність воріт як на просторовому, так і на транскрипційному рівнях контролю якості
  • Увімкнув клієнта оцифрування документів, оптичне розпізнавання символів у роздрібній торгівлі, навігація, банківська справа та юридичні послуги AI-додатки

Загалом, Shaip допоміг перетворити вимогу до анотацій з кількох джерел тексту на структурований, готовий до виробництва конвеєр оптичного розпізнавання символів (OCR), здатний підтримувати оцифрування документів, розпізнавання тексту сцен, роздрібну аналітику, автоматизацію банківської справи та штучний інтелект для дотримання законодавчих вимог з подвійною просторовою та транскрипційною точністю.

Цитата значок

Shaip впорався з крайніми випадками OCR, з якими більшість постачальників послуг не можуть — викривлений текст на вивісках, змішані шрифти, вицвілі квитанції, рукописні нотатки. Їхній подвійний контроль якості як для обмежувальних рамок, так і для транскрипцій дав нам навчальні дані, які ми могли використовувати.

— Директор з документообігу, штучний інтелект

★ ★ ★ ★ ★
Цитата значок