Попередня підготовка

Попередня підготовка

Визначення

Попереднє навчання — це початкове навчання моделі машинного навчання на великих наборах даних загального призначення перед її тонким налаштуванням на конкретних завданнях.

Мета

Мета полягає в тому, щоб надати моделі з широкими представленнями, які можна перенести на кілька завдань, зменшуючи вимоги до даних та обчислень для подальшої адаптації.

Значення

  • Основа для сучасних програм магістратури з ліцензування (LLM) та моделей бачення.
  • Покращує продуктивність у виконанні різноманітних завдань.
  • Дорогий з точки зору даних та обчислень.
  • Потрібно ретельне курування набору даних, щоб уникнути упередженості.

Як це працює

  1. Збирайте величезні загальні набори даних (текст, зображення).
  2. Визначте навчальні завдання, що виконуються без нагляду або самостійно.
  3. Навчайте моделі, щоб вивчити загальні особливості.
  4. Збережіть попередньо навчені ваги для повторного використання.
  5. Точне налаштування для менших наборів даних, специфічних для конкретних завдань.

Приклади (реальний світ)

  • BERT попередньо навчений працювати з Вікіпедією та BooksCorpus.
  • CLIP навчався на парах зображення–текст.
  • Моделі GPT, попередньо навчені на великомасштабному інтернет-тексті.

Література / Додаткова література

  • Девлін та ін. «BERT: Попереднє навчання глибоких двонаправлених трансформаторів». NAACL 2019.
  • Редфорд та ін. «Мовні моделі – це люди, які навчаються з невеликою кількістю спроб». NeurIPS 2020.
  • Технічний звіт OpenAI GPT-4.

Розкажіть нам, як ми можемо допомогти з вашою наступною ініціативою щодо штучного інтелекту.