Випадкове дослідження моделі розпізнавання обличчя

Набір відеоданих проти спуфінгу для моделей AI для виявлення шахрайства

Дізнайтеся, як Shaip надав 25,000 XNUMX високоякісних наборів відеоданих проти спуфінгу, що містять реальні та відтворені сценарії атак, щоб навчити моделі ШІ для виявлення шахрайства.

Збір відеоданих проти спуфінгу

Огляд проекту

Шайп співпрацював із провідною компанією з безпеки штучного інтелекту, щоб надати високоякісний готовий набір відеоданих проти спуфінгу, призначений для покращення навчання моделі штучного інтелекту для виявлення шахрайства. Набір даних включав 25,000 XNUMX відео, які фіксували як реальні, так і повторні сценарії атак, забезпечуючи надійні навчальні дані для моделей проти спуфінгу.

Кожен із 12 500 учасників надав два відео — одне реальне та одне повторне відео атаки — записані з роздільною здатністю 720p або вище та частотою кадрів 26 FPS і вище.

Метою проєкту було створення автентичних та різноманітних наборів даних , які дозволили б моделям штучного інтелекту ефективно розрізняти справжні та підроблені біометричні відео, тим самим знижуючи ризики шахрайства в системах біометричної автентифікації.

Збір відеоданих проти спуфінгу

Основна статистика

25 000 відео загалом ( 12 500 реальних відео, 12 500 відео атак у повторі)

12,500 створеного
Учасники

5 етнічних груп
представлені в наборі даних

Поетапна доставка: 4 партії по 6,250 відео кожна

Атрибути метаданих: 12 ключових параметрів для покращення зручності використання набору даних

Обсяг набору біометричних даних проти підробки

Курування набору даних: Проєкт зосереджений на наданні високоякісних наборів відеоданих для захисту від спуфінгу, що складаються з реальних відео атак та відеозаписів . Ключові аспекти включали:

  • 12,500 Учасники внесок по два відео (1 справжній, 1 підроблений).
  • Різноманітність записуючих пристроїв для підвищення адаптивності моделі.
  • Збалансоване етнічне представництво щоб забезпечити доступність набору даних.

Збір метаданих: кожне відео супроводжувалося 12 атрибутами метаданих для покращення зручності використання набору даних.

Проблеми зі збором відеоданих

Рівне представництво

Підтримуючи збалансований розподіл даних за етнічною приналежністю, водночас вибираючи високоякісні відео.

Контроль якості

Забезпечення того, щоб кожен учасник додав одне реальне та одне повторне відео атаки для підтримки цілісності набору даних.

Технічна узгодженість

Дотримання строгих вказівок щодо FPS (≥ 26), роздільної здатності (≥ 720p) і точності позначок часу (+/- 0.5 мс).

Як ми це вирішили

Шайп надав структурований і високоякісний набір даних відповідно до вимог проекту. Рішення включало:

Курування набору даних і контроль якості

  • 25,000 відео зібрані поперек Фази 4 щоб забезпечити стабільний і структурований потік даних, уникаючи вузьких місць.
  • Суворий процес перевірки щоб забезпечити дотримання FPS, роздільна здатність і точність метаданих. Кожне відео пройшло кілька перевірок якості перед остаточним прийняттям.
  • Комплексне тегування метаданих з 12 атрибутів:
  • Ідентифікатор/назва файлу
  • Тип атаки (реальна/повторна)
  • ID особи
  • Дозвіл відео
  • Тривалість відео
  • Етнічна приналежність суб'єкта
  • Стать суб'єкта
  • Незалежно від того, чи є відео оригінальним чи підробленим
  • Назва/модель пристрою
  • Людина говорить чи ні
  • Мітка часу. Час початку
  • Позначка часу Кінцевий час
  • Збалансований розподіл етнічних груп: Набір даних був ретельно підібраний для підтримки збалансованого етнічного представництва. Розподіл включає латиноамериканське (33%), південноазіатське (21%), кавказьке (20%), африканське (15%), а також населення Східної Азії та Близького Сходу (кожне населення становить до 6%).
  • Немає повторюваних записів підтримувати унікальність набору даних і запобігати упередженням у навчанні ШІ.
  • Етнічно різноманітний відбір учасників щоб створити набір даних, який відображає варіації користувачів у реальному світі, покращуючи адаптивність і справедливість моделі ШІ.
  • Варіація записуючого пристрою включав кілька моделей смартфонів, камер і умов освітлення для підвищення надійності моделі в різних умовах навколишнього середовища.

Результат

Високоякісний, різноманітний набір відеоданих проти спуфінгу, наданий Shaip, дозволив клієнту навчити моделі ШІ точно розрізняти реальні та спуфінгові відео в різних сценаріях біометричної автентифікації. Набір даних сприяв:

Виявлення шахрайства

Покращена продуктивність AI у виявленні шахрайських біометричних атак.

Різноманітні навчальні дані

Покращено здатність моделі розпізнавати атаки повтору для різних етнічних груп, пристроїв і умов навколишнього середовища.

масштабованість

Набір даних служить основою для майбутніх вдосконалень і розширень моделі захисту від спуфінгу.

Цитата значок

Набір даних Шайпа зіграв важливу роль у вдосконаленні наших моделей захисту від спуфінгу на основі ШІ. Різноманітність, якість і структуровані метадані забезпечили міцну основу для покращення виявлення шахрайства в біометричних системах автентифікації.

★ ★ ★ ★ ★
Цитата значок