Оптичний розпізнавання символів (OCR)

Оптичний розпізнавання символів (OCR)

Визначення

Оптичне розпізнавання символів (OCR) – це процес перетворення друкованого або рукописного тексту на зображеннях у машинозчитуваний цифровий текст.

Мета

Мета полягає в оцифруванні документів для пошуку, редагування та аналізу. OCR підтримує програми в оцифруванні, доступності та автоматизації введення даних.

Значення

  • Дозволяє конвертувати паперовий текст у текст з можливістю пошуку.
  • Підвищує ефективність у таких галузях, як банківська справа та охорона здоров'я.
  • Проблеми з низькою якістю сканування або незвичайними шрифтами.
  • Формує основу для текстового аналізу у сканованих архівах.

Як це працює

  1. Відскануйте або зробіть зображення тексту.
  2. Попередньо обробіть зображення для видалення шуму.
  3. Виявлення та сегментація символів або слів.
  4. Розпізнавання тексту за допомогою моделей машинного навчання.
  5. Виведення редагованого цифрового тексту.

Приклади (реальний світ)

  • Google Cloud Vision OCR: сервіс розпізнавання тексту.
  • ABBYY FineReader: комерційне програмне забезпечення для оптичного розпізнавання символів (OCR).
  • Оцифрування проєкту Гутенберг: OCR для книг.

Література / Додаткова література

  • Сміт, Р. «Огляд механізму оптичного розпізнавання символів Tesseract». ICDAR.
  • ISO/IEC 15938-4: Інтерфейс опису мультимедійного контенту.
  • Транзакції IEEE з аналізу шаблонів та машинного інтелекту.
  • Що таке OCR?

Розкажіть нам, як ми можемо допомогти з вашою наступною ініціативою щодо штучного інтелекту.