OCR з відкритим кодом

22 найкращих набори даних OCR з відкритим кодом для навчання ваших моделей машинного навчання у 2026 році

Оптичне розпізнавання символів тепер використовується для сканування чеків, перевірки посвідчень особи, автоматизації рахунків-фактур, оцифрування історичних архівів та додатків для нотаток на основі стилуса. Прогнозується, що ринок OCR досягне 32.90 мільярда доларів до 2030 року зі середньорічним темпом зростання 14.8% (Grand View Research, 2024), при цьому інтелектуальне розпізнавання символів — гілка OCR, що займається читанням рукописного тексту, — зростатиме найшвидше. Незалежно від того, чи створюєте ви синтаксичний аналіз документів, розпізнавання тексту сцени чи транскрипцію рукописного тексту, набір даних OCR, на якому ви навчаєтесь, встановлює вашу межу точності. Цей посібник охоплює 22 безкоштовні набори даних OCR з відкритим кодом, включаючи найкращі набори даних рукописного тексту, організовані за варіантами використання та оновлені найпотужнішими релізами до 2024 року.

Ключові винесення

  • OCR (оптичне розпізнавання символів): технологія, яка перетворює зображення друкованого, сценічного або рукописного тексту на дані, що зчитуються машиною.
  • Набори даних OCR поділяються на п'ять груп: документ/форма, текст сцени, цифра/символ, рукописний текст та багатомовність.
  • Набори даних OCR документів захоплювати структуровані сторінки, такі як форми та квитанції; набори даних про текст сцени захоплювати текст «у дикій природі».
  • IAM, MNIST, ICDAR та SROIE залишаються найчастіше цитованими орієнтирами OCR у дослідженнях.
  • Умови ліцензії дуже різняться — перевірте кожен набір даних OCR перед комерційним навчанням.

Що таке OCR (оптичне розпізнавання символів)?

OCR – це технологія, яка перетворює різні типи документів, як-от скановані паперові документи, PDF-файли чи зображення тексту, у дані, які можна редагувати та шукати. Він працює за допомогою:

  • Аналіз структури тексту на зображенні
  • Розбиття тексту на рядки та знаки
  • Перетворення цих візуальних символів у машиночитаний текст

Загальні способи використання включають:

  • Перетворення сканованих документів у редаговані текстові файли
  • Оцифрування друкованих книг
  • Вилучення тексту з фотографій
  • Перетворення рукописних рецептів у цифровий текст
  • Розпізнавання номерних знаків

Як вибрати правильний набір даних для OCR?

Вибір набору даних для оптичного розпізнавання символів (OCR) залежить від чотирьох факторів: типу тексту, середовища захоплення, ступеня деталізації анотацій та ліцензії. Для OCR друкованих документів потрібні інші навчальні дані, ніж для рукописного курсивного або вигнутого тексту сцени. Набори даних документів підходять для рахунків-фактур, форм та квитанцій; набори даних для тексту сцени підходять для вивісок та зчитування продуктів; набори даних від руки підходять для нотаток, рукописів та введення стилусом. Анотації на рівні слів та рядків підтримують повні конвеєри OCR, тоді як набори даних на рівні символів відповідають базовим рівням класифікації. Завжди перевіряйте умови ліцензії, оскільки деякі набори даних OCR призначені лише для досліджень або вимагають реєстрації.

Які найкращі набори даних для розпізнавання символів документів та форм?

Набори даних для оптичного розпізнавання символів (OCR) документів навчають моделі розбору структурованих сторінок, таких як рахунки-фактури, форми, квитанції та ідентифікатори. Це забезпечує автоматизацію бізнес-документації та вилучення ключів-значень.

  1. FUNSD — 199 анотованих відсканованих форм із шумом, що відображає реальний світ. Стандартний еталон для розуміння форм та вилучення пар «ключ-значення».
  2. СРІЄ — Набір даних сканованих чеків ICDAR 2019, що містить приблизно 1,000 чеків, що підтримує виявлення тексту, розпізнавання та вилучення інформації в одному наборі.
  3. КОРД — Консолідований набір даних про квитанції, створений для розбору після оптичного розпізнавання символів (OCR), з розширеними позначками на рівні полів для автоматизації рахунків-фактур та квитанцій.
  4. XFUND — Багатомовне розширення FUNSD, що охоплює сім мов (німецьку, іспанську, французьку, італійську, японську, португальську, китайську) по 199 сторінок кожна. Ідеально підходить для багатомовного документообігу зі штучним інтелектом.
  5. DDI-100 — Близько 100 000 спотворених зображень документів для виявлення та розпізнавання в умовах реальної деградації, такої як перекіс, розмиття та шум.

Які найкращі набори даних для розпізнавання тексту сцени?

Набори даних для розпізнавання тексту сцени навчають моделі зчитувати текст на природних зображеннях, таких як вивіски, продукти та вуличні сцени. Це важливо для розпізнавання тексту в реальних умовах, коли фон захаращений.

  1. Надійне зчитування ICDAR — Еталонна група досліджень текстів сцен, включаючи завдання «Сфокусований та випадковий текст сцени» з обмежувальними рамками на рівні слів та транскрипціями.
  2. COCO-Текст — Масштабні анотації тексту сцени, нашаровані на зображення MS-COCO. Потужні для виявлення тексту в масштабі в природних сценах.
  3. Total-Text — Спеціалізується на викривленому та довільно орієнтованому тексті, що є відомим слабким місцем для старіших моделей OCR.
  4. SVT (текст перегляду вулиць) — Зображення Word, отримані з Google Street View, часто з низькою роздільною здатністю та високою варіабельністю. Доступно через дзеркала Papers with Code.
  5. Ієрархічний текст — Ієрархічна анотація від абзацу до рядка та до слова, що охоплює як рукописний, так і друкований текст сцени. Корисно для OCR з урахуванням макетування.

Які найкращі набори даних для розпізнавання символів та цифр?

Набори даних для оптичного розпізнавання символів та цифр навчають моделі розпізнавати окремі символи в контрольованих умовах. Це стандартні відправні точки для базових ліній класифікації.

  1. МНІСТ — 70 000 зображень цифр у відтінках сірого, написаних від руки. Найшвидший базовий рівень для перевірки класифікатора цифр.
  2. ЕМНІСТ — Розширює MNIST 814 255 рукописними літерами та цифрами, отриманими зі Спеціальної бази даних NIST 19.
  3. SVHN (Номери будинків для перегляду вулиць) — Понад 600 000 реальних цифрових зображень номерів будинків. Практичний крок уперед порівняно з MNIST для шумних умов.
  4. Символів74 тис. — 74 107 зображень, що охоплюють англійські та каннадські символи з природних зображень та комп’ютерних шрифтів.
  5. Спеціальна база даних NIST 19 — Понад 810 000 зображень символів, надрукованих від руки, від 3,600 авторів. Джерело, з якого походять багато тестів OCR для англійської мови.

Які найкращі набори даних від рукописного введення для OCR?

Набори даних про рукописний текст навчають моделі оптичного розпізнавання символів (OCR) зчитувати курсивний, друкований та історичний рукописний текст. Найнадійніші відкриті набори даних про рукописний текст залишаються найчастіше цитованими орієнтирами для розпізнавання рукописного тексту (HTR).

  1. База даних почерку IAM — Золотий стандарт англійського почерку, що містить 13 353 рядки тексту від 657 авторів. Досі це найчастіше цитований набір даних про почерк у дослідженнях OCR 2024–2025 років.
  2. IAM-OnDB — Онлайн-версія IAM для розпізнавання рухів пера, що фіксує дані траєкторії. Канонічний набір даних для розпізнавання рукописного тексту стилусом та планшетом.
  3. Документи Бентама — Транскрибовані історичні англійські рукописи філософа Джеремі Бентама. Провідний еталон для розпізнавання історичних рукописів, доступний через Transkribus.
  4. GNHK (Колекція рукописних текстів GoodNotes) — Набір даних 2021 року, що містить необмежені нотатки англійською мовою з реального світу. Ближче до неохайних виробничих даних, ніж до лабораторно чистих IAM.

Які найкращі багатомовні набори даних для оптичного розпізнавання символів (OCR)?

 

Багатомовні набори даних OCR навчають моделі на шрифтах, відмінних від англійської, включаючи китайську, арабську та математичну нотацію. Це важливо для глобального розпізнавання документів та рукописного тексту.

  1. CASIA-HWDB — Стандартний китайський бенчмарк OCR, що містить 1.17 мільйона зразків рукописних символів від 1,020 авторів.
  2. ХАТТ — 1,000 рукописних форм арабською мовою від 1,000 різних авторів, відсканованих з різною роздільною здатністю. Найповніший відкритий набір даних для розпізнавання символів арабською мовою.
  3. КРОМЕ — Конкурс з розпізнавання рукописних математичних виразів онлайн: понад 10 000 виразів, що містять понад 101 математичний символ, як в онлайн-, так і в офлайн-варіантах. Необхідний для розпізнавання рівнянь від руки.

Які поширені помилки виникають під час використання безкоштовних наборів даних OCR?

Три пастки ловлять більшість команд.

Невідповідність доменів: навчання на чистому IAM або COCO-Text та розгортання на зім'ятих рахунках-фактурах гарантує низьку точність.

Ліцензійна сліпота: кілька наборів даних про текст сцени та історичні OCR призначені лише для досліджень або вимагають реєстрації перед комерційним використанням.

Прогалини в анотаціях: багатьом наборам даних OCR бракує метаданих макета, обмежувальних рамок на рівні рядків або міток полів, необхідних виробничим системам.

Уявіть собі середню логістичну фірму, яка автоматизує зчитування транспортних етикеток. Навчання роботі з текстами у публічних місцях дозволяє їм досягти 80% результатів у контрольних тестах, але реальні етикетки з відблисками та складками знижують їх до 58%. Щоб скоротити цей розрив, перед запуском потрібно було цілеспрямовано анотувати дані 6,000 зображень етикеток у межах домену.

Переваги та проблеми відкритих наборів даних

Переваги та проблеми наборів даних з відкритим кодом

Підприємствам потрібно порівняти переваги та проблеми, щоб зрозуміти, чи варто їм обирати безкоштовні дані для своїх програм ML.

Переваги

  • Дані легко доступні. Завдяки доступності даних вартість розробки програми значно знижується.
  • Час і зусилля, витрачені на збір даних для програми, значно скорочуються, оскільки набір даних є легкодоступним.
  • Існує велика кількість форумів спільноти або довідкових груп, які допомагають вивчати, адаптувати та оптимізувати набір даних.
  • Одна з головних переваг набору даних з відкритим кодом полягає в тому, що він не накладає жодних обмежень на налаштування.
  • Дані з відкритим кодом доступні для великої частини населення, що робить аналіз та інновації можливими без грошових бар’єрів.

Виклики

  • Дані, специфічні для проекту, важко отримати. Крім того, існує ймовірність відсутності інформації та некоректного використання наявних даних.
  • Отримання конфіденційних даних потребує часу, зусиль і є дорогим
  • Хоча отримати дані може бути простіше, витрати на знання та аналіз можуть переважити початкову перевагу.
  • Інші розробники також використовують ці дані для розробки програм.
  • Ці набори даних дуже вразливі до порушень безпеки, конфіденційності та згоди.

Як Shaip підтримує проекти з оптичного розпізнавання символів (OCR) та розпізнавання рукописного тексту?

Сервіси даних для навчання OCR від Shaip поєднують курування відкритих наборів даних із користувацьким збором даних більш ніж 60 мовами, охоплюючи друковані документи, рукописний текст, квитанції та посвідчення особи. Робочі процеси анотацій Shaip додають шари, яких бракує публічним наборам даних OCR: обмежувальні рамки на рівні рядків, мітки на рівні полів, контроль якості транскрипції та метадані автора.

Висновок

22 набори даних OCR, наведені вище, надають вам повну базу з відкритим кодом для розпізнавання документів, текстів сцен, цифр, рукописного введення та багатомовності на 2026 рік. Почніть з набору даних OCR, який відповідає вашому типу тексту та середовищу захоплення, перевірте його на наявність вибірки реальних даних та заплануйте бюджет на власні анотації, щоб заповнити прогалину в предметній області. Така комбінація постачається швидше, ніж створення з нуля.

Найкращий безкоштовний набір даних OCR залежить від завдання. ICDAR Robust Reading використовує текст сцени, FUNSD та SROIE — OCR документів та квитанцій, а IAM — рукописний розпізнавання. Для розпізнавання цифр стандартними є MNIST та SVHN. Більшість команд поєднують два або три набори даних OCR у різних категоріях, а не покладаються на один.

Не всі набори даних OCR з відкритим кодом безкоштовні для комерційного використання. MNIST, SVHN та COCO-Text використовують дозвільні ліцензії, тоді як набори IAM, ICDAR та набори даних історичного рукописного введення часто вимагають реєстрації або обмежують використання дослідженнями. Завжди перевіряйте ліцензію кожного набору даних перед навчанням комерційної моделі.

Набори даних OCR охоплюють усі види розпізнавання машинним способом тексту, включаючи друковані документи, текст сцени та цифри, тоді як набори даних для рукописного введення є підмножиною, зосередженою на рукописному контенті. Набори даних для рукописного введення, такі як IAM та Bentham, навчають моделі HTR, тоді як набори даних OCR для документів та текстів сцен обробляють друкований та «дикий» текст.

Багатомовні набори даних OCR включають XFUND для семи мов форм, CASIA-HWDB для китайської, KHATT для арабської та ICDAR MLT для багатомовного тексту сцен. Поєднання наборів даних OCR, специфічних для скриптів, із синтетичним доповненням зазвичай перевершує навчання на будь-якому окремому наборі даних.

Потреби в спеціальних анотаціях залежать від того, наскільки далеко ваші документи знаходяться від загальнодоступних даних. Для чистих друкованих форм може знадобитися від 1,000 до 5,000 зразків у межах домену, тоді як для неохайного почерку, квитанцій або рідкісних рукописних текстів часто потрібно від 10 000 до 50 000. Конвеєри анотацій Shaip зазвичай забезпечують підвищення точності на 15–30% порівняно з навчанням OCR лише для загальнодоступних даних.

Сподобалася ця стаття? Слідкуйте за Shaip у LinkedIn, щоб отримувати більше оновлень.

Соціальна Поділитися