Почему пост-обучение делает LLM смешнее
Пост-обучение (post-training) — это этап, на котором большую языковую модель после предварительного обучения на текстах донастраивают под диалог. Базовые версии умеют предсказывать следующее слово, но плохо следят за инструкцией.
Главное
- Пост-обучение делает шутки более осмысленными и контекстными
- RLHF смещает юмор к социально приемлемым и консервативным формам
- После донастройки меньше абсурда и рискованных шуток
- Автоматические метрики плохо предсказывают, что кажется людям смешным
Пост-обучение (post-training) — это этап, на котором большую языковую модель после предварительного обучения на текстах донастраивают под диалог. Базовые версии умеют предсказывать следующее слово, но плохо следят за инструкцией. Пост-обучение добавляет способность отвечать в нужном формате, учитывать контекст и избегать нежелательных высказываний. Вопрос в том, как этот этап влияет на чувство юмора.
Сравнение моделей до и после пост-обучения показывает, что разница заметна. До донастройки модель чаще генерирует абсурдные сочетания слов, которые могут показаться смешными случайно. После — шутки становятся более осмысленными: модель учитывает тему, выстраивает неожиданную развязку и лучше работает с иронией. Особую роль играет обучение с подкреплением на основе обратной связи людей (RLHF). Оно смещает модель к ответам, которые оценщики считают остроумными и уместными, но одновременно делает юмор более консервативным.
Исследователи замечают, что пост-обучение улучшает тайминг и контекстную точность, но снижает долю экспериментального и рискованного юмора. Модель реже нарушает социальные нормы и реже полагается на абсурд. Для практических задач — например, развлекательного диалога — это плюс: шутки стабильнее попадают в цель. Для изучения креативных границ генерации интереснее выглядят промежуточные версии модели. Автоматические метрики при этом всё ещё плохо оценивают, что именно смешно, поэтому главным судьёй остаётся человек.