Почему LLM всё-таки обобщают: вопреки скепсису Ильи и Яна Лекуна

Долгое время считалось, что большие языковые модели (LLM) лишь запоминают обучающие данные и не способны к настоящему обобщению. Эту позицию в разное время озвучивали Илья Суцкевер и Ян Лекун — два исследователя, чьи слова много значат для индустрии.

Почему LLM всё-таки обобщают: вопреки скепсису Ильи и Яна Лекуна
Почему LLM всё-таки обобщают: вопреки скепсису Ильи и Яна Лекуна

Главное

  • Суцкевер и Лекун сомневались в способности LLM обобщать
  • Модели решают задачи с новыми комбинациями без дообучения
  • Обобщение отличается от запоминания шаблонов
  • Ошибки LLM не отменяют факта переноса знаний

Долгое время считалось, что большие языковые модели (LLM) лишь запоминают обучающие данные и не способны к настоящему обобщению. Эту позицию в разное время озвучивали Илья Суцкевер и Ян Лекун — два исследователя, чьи слова много значат для индустрии. Однако свежие результаты экспериментов ставят их скепсис под сомнение.

В ходе тестов модели ставили задачи, которые не встречались в обучающей выборке: новые комбинации синтаксических конструкций, незнакомые логические цепочки и перенос правил из одной предметной области в другую. LLM справлялись с ними без дополнительного обучения, используя только контекст запроса. Это не похоже на простое воспроизведение заученных фраз — модели выстраивали промежуточные представления, которые позволяют применять усвоенные закономерности к новым ситуациям.

Ключевой момент — различие между запоминанием и обобщением. Запоминание даёт точный ответ только на знакомый стимул. Обобщение позволяет решить задачу, структура которой аналогична известной, но конкретное наполнение изменилось. Именно такое поведение фиксируют исследователи: модель не повторяет шаблон, а адаптирует его, меняя порядок аргументов, подставляя новые сущности и комбинируя правила.

Это не значит, что скептики были неправы во всём. LLM по-прежнему ошибаются на простых задачах, путаются в счёте и могут выдавать уверенные неверные ответы. Но утверждение, что они в принципе не обобщают, выглядит всё менее состоятельным. Спор смещается от вопроса «могут ли» к вопросу «в каких условиях и с какими ограничениями».