Набір даних арабської, тайської, в'єтнамської, хінді, англійської та китайської мов
Різноманітні набори даних розпізнавання тексту для розширених додатків OCR: вивіски, меню тощо
Варіант використання: OCR
Формат: Зображення
Кількість: 150 тис.
Анотація: Так
Опис: Набір даних арабською, тайською, в'єтнамською, хінді, англійською та китайською мовами
Варіант використання: OCR
Формат: Зображення
Кількість: 1 тис.
Анотація: Так
Опис: Набір даних арабського тексту містить колекцію зразків текстів, написаних арабською мовою. Він включає різні форми контенту, такі як новини, публікації в соціальних мережах, літературу та діалоги, що охоплюють різні теми та стилі письма. Цей набір даних використовується для таких завдань, як обробка природної мови (NLP), класифікація тексту, аналіз настроїв та машинний переклад в арабомовних програмах.
Варіант використання: OCR
Формат: Зображення
Кількість: 38 тис.
Анотація: Так
Опис: Набір даних китайської, англійської, тибетської та уйгурської мов
Варіант використання: OCR
Формат: Зображення
Кількість: 60 тис.
Анотація: Так
Опис: Набір даних меню китайською та англійською мовами містить зображення або текстові зразки меню ресторанів, які представлені китайською та англійською мовами. Він включає різні шрифти, макети та структури меню, що представляють двомовні назви страв, описи та ціни. Цей набір даних корисний для таких завдань, як оптичне розпізнавання символів (OCR), машинний переклад та оцифрування меню в багатомовних середовищах.
Варіант використання: OCR
Формат: Зображення
Кількість: 3 тис.
Анотація: Так
Опис: Набір даних рукописних китайських текстів містить зразки рукописного китайського тексту, включаючи твори, есе та інші довгі тексти. Він містить різні стилі почерку та рівні складності та використовується для таких завдань, як розпізнавання почерку, аналіз тексту та навчання моделей машинного навчання.
Варіант використання: OCR
Формат: Зображення
Кількість: 1 тис.
Анотація: Так
Опис: Набір даних китайських запитів Wi-Fi складається з текстових зразків, що містяться в запитах Wi-Fi та екранах входу, написаних китайською мовою. Зазвичай він містить різні запити, інструкції та повідомлення про помилки, пов'язані з підключенням до мереж Wi-Fi або керуванням ними. Цей набір даних використовується для таких завдань, як розпізнавання тексту, обробка природної мови та покращення інтерфейсів користувача для підключення до мережі.
Варіант використання: OCR
Формат: Зображення
Кількість: 12 тис.
Анотація: Так
Опис: Набір даних англійського та китайського рукописного письма містить зразки рукописного письма англійською та китайською мовами, що демонструють різні стилі письма та складність символів. Зазвичай він використовується для навчання та оцінки моделей розпізнавання рукописного письма, підтримки багатомовного аналізу тексту та інших пов'язаних досліджень. Набір даних містить широкий спектр символів, цифр, слів та речень обома мовами.
Варіант використання: OCR
Формат: Зображення
Кількість: 30 тис.
Анотація: Так
Опис: Набір даних англійських та китайських вивісок магазинів містить зображення вивісок магазинів, на яких є текст як англійською, так і китайською мовами. Він фіксує різні елементи вивісок, такі як назви магазинів, реклама, акції та вказівки, що відображаються різними шрифтами, стилями та форматами. Цей набір даних використовується для таких завдань, як виявлення та розпізнавання тексту, розуміння багатомовних сцен та покращення моделей комп'ютерного зору для інтерпретації двомовних вивісок.
Варіант використання: OCR
Формат: Зображення
Кількість: 50 тис.
Анотація: Так
Опис: Набір даних англійської та китайської мов зі спеціальним кутом розпізнавання тексту містить зображення тексту, відображеного під різними кутами та орієнтаціями як англійською, так і китайською мовами. Він включає текст з таких джерел, як вивіски, реклама та документи, які не представлені у стандартних горизонтальних форматах. Цей набір даних використовується для навчання та оцінки моделей виявлення та розпізнавання тексту, зокрема тих, які здатні обробляти текст у нетрадиційних орієнтаціях та перспективах.
Варіант використання: OCR
Формат: Зображення
Кількість: 20 тис.
Анотація: Так
Опис: Набір даних англійського меню містить зображення або текстові зразки меню ресторанів, написані англійською мовою. Він містить різноманітні шрифти, макети та стилі форматування, з контентом від назв страв до описів і цін. Цей набір даних часто використовується для таких завдань, як оптичне розпізнавання символів (OCR), вилучення тексту та оцифрування меню в програмах, пов'язаних з харчовими продуктами.
Варіант використання: OCR
Формат: Зображення
Кількість: 33 тис.
Анотація: Так
Опис: Набір даних English Scenes Text Dataset складається з зображень природних сцен із вбудованим текстом англійською мовою. Текст представлений у різних формах, таких як вивіски, рекламні щити та плакати, часто з різними шрифтами, розмірами та орієнтаціями. Цей набір даних зазвичай використовується для навчання та тестування моделей у завданнях виявлення, розпізнавання та розуміння тексту.
Приклад використання: ШІ для документів
Формат: HEIC (зображення) та .mov (відео)
Кількість: 94053
Анотація: Ні
Опис: Живі фотографії з рукописним текстом японською, корейською та російською мовами
Пристрій запису: камера iPhone та iPad
Умови запису: - Агресивне освітлення/відблиски - Спалах камери увімкнено - Кольорове світло - Слабке освітлення, без спалаху камери - Звичайний
Варіант використання: OCR
Формат: Зображення
Кількість: 40 тис.
Анотація: Так
Опис: Набір даних японської та корейської мов містить зразки текстів як японською, так і корейською мовами. Він містить різноманітний контент, такий як речення, фрази та слова, що охоплюють різні контексти та стилі. Цей набір даних використовується для таких завдань, як обробка природної мови (NLP), машинний переклад та аналіз тексту в багатомовних програмах.
Приклад використання: ШІ для документів
Формат: HEIC (зображення) та .mov (відео)
Кількість: 23930
Анотація: Ні
Опис: Живі фотографії з рукописним текстом японською, корейською та російською мовами
Пристрій запису: камера iPhone та iPad
Умови запису: - Агресивне освітлення/відблиски - Спалах камери увімкнено - Кольорове світло - Слабке освітлення, без спалаху камери - Звичайний
Варіант використання: Текст + Аудіо-візуальне (багатомовний / OCR / NLP)
Формат: Відео
Кількість: понад 100 тис. відеолекцій + відео PPT довгого формату
Анотація: Ні
Опис: Китайські книги, англійські книги, журнали, державна політика, романи, дитячі книги, кантонська аудіо+текст, відеолекції+PPT, відео довгого формату. Півмільярда книг, пари питань та відповідей, статті.
Ми використовуємо файли cookie, щоб покращити ваш досвід роботи на нашому сайті. Використовуючи наш сайт, ви погоджуєтеся на використання файлів cookie.
Керуйте налаштуваннями файлів cookie нижче:
Основні файли cookie включають основні функції та необхідні для належної роботи веб-сайту.
Менеджер тегів Google спрощує керування маркетинговими тегами на вашому веб-сайті без зміни коду.
Статистичні файли cookie збирають інформацію анонімно. Ця інформація допомагає нам зрозуміти, як відвідувачі використовують наш веб-сайт.
Google Analytics – це потужний інструмент, який відстежує та аналізує трафік веб-сайту для прийняття обґрунтованих маркетингових рішень.
URL-адреса сервісу: policies.google.com (відкриється в новому вікні)
Маркетингові файли cookie використовуються для відстеження відвідувачів веб-сайтів. Мета полягає в тому, щоб показувати оголошення, які є релевантними та привабливими для окремого користувача.
Google Ads — це платформа онлайн-реклами, яка дозволяє компаніям створювати цільові оголошення, що відображаються в результатах пошуку Google та на сайтах партнерів.
URL-адреса сервісу: policies.google.com (відкриється в новому вікні)
Більше інформації ви можете знайти в наших Політиці щодо файлів cookie та Політиці конфіденційності.