Основные направления RL для нейросети

Пост-обучение нейросети.

15 мин
По колено
20.12.2025

И так, в прошлой статье мы увидели как усиленное обучение уже давно применяется в соревновательных играх.
Поняли общий принцип его работы для достижения цели — случайно иду куда-то, если стало лучше, то запоминаю и начинаю с этого пути в следующий раз.

Теперь давайте разберём, как метод RL работает на подкорке в классических применениях для больших языковых моделей.

Улучшающий нейросети RL.

Классических и самых распространённых применений RL для больших языковых моделей всего два:

  • 1. Вычисления.

    Аналитические задачи с измеримым правильным результатом.

  • 2. Проза.

    Лингвистические задачи с неизмеримым субъективным правильным результатом.

— Ну хз, мне вот такой стих больше нравится!

RL для вычислений.

Во время обучения, просим модель решить математическую задачку и наблюдаем за её ответами и количеством потраченных токенов для его достижения. Помним, у нас есть правильный ответ задачки. Из 1000 попыток, модель пришла к нему 50 раз. Мы берём эти 50 правильных размышлений (последовательностей токенов) и смотрим где было потрачено меньше токенов.

Эту попытку обозначаем лучшей, выдавая модели награду 🏆. На подкорке тут может быть огромная-огромная формула, но её предназначение именно такое — найти правильные ответы, найти минимальные затраты (оптимальный путь), сказать модели что она молодец, повторить это упражнение для всех нужных кейсов.

Определение лучшего решения аналитической задачи.
Определение лучшего решения аналитической задачи.

На самом деле это и всё. В классическом виде RL для LLM выглядит так.

На практике же применяются более сложные алгоритмы, сложность которых обусловлена оптимизацией использования вычислительных мощностей и увеличением качества и скорости получения результата. А целью усиленного обучения может быть не просто приход к правильному результату, а приход к правильному результату через определённые шаги 🦶🏼.

Эти шаги потом могут выглядеть как «размышления», которые мы наблюдаем при активации соответствующего режима работы большой языковой модели.

RL -> RLHF для прозы и лингвистики.

Сейчас мы рассмотрели случай, когда правильный ответ есть. А что делать если его нет и быть не может? Как тогда оценивать модель, показывать ей что результат верный? Тут выходит на пляж RLHF (Reinforcement Learning with Human Feedback) — усиленное обучение на мнении человека.

Такой подход используется, когда нет однозначно верного ответа, с которым можно было бы сравнить результаты размышления модели.
И как быть?

Может попросить человека смотреть и оценивать результаты экспертно?
Типо, модель подумала, подумала ещё раз, ещё много-много раз. А потом сажаем человека и просим его оценить все результаты её размышлений, так чтоль?

Ну давай посчитаем.
Чтобы от этапа RLHF был толк, нужно обновить нашу модель по 1000 разным типам задач: напиши стих, запланируй туристический маршрут, посчитай сколько стоит снимать квартиру в Майкопе и т.д.

По каждому из этих 1000 типов задач, мы формируем 1000 примеров: напиши стих романтический, напиши стих в стиле Пушкина, напиши стих про альпаку.
Чтобы модель добралась до лучшего ответа, нужно дать ей возможность к нему по-приходить. По этому просим сделать 1000 стихов про альпаку, 1000 стихов в стиле Пушкина и тд.

Итого. Сколько всего различных сущностей для оценки у нас получается?

1000 (типы задач) * 1000 (виды задач) * 1000 (варианты задачи) = 1 000 000 000 оценок человека.

Не будем садистами или бестолковыми руководителями. Подход не масштабируемый, людей не хватит.

— Идея!💡Есть более щадящий подход — обучить ещё одну нейросеть выступать в роли оценщика.

Делаем как-то так.
Вместо оценивания 1000 вариантов задачи, просим человека оценить типо 5. А потом, через похожий на SFT подход, обучаем модель на этих 5 лейблах и просим её оценить остальные 995. Вместо миллиарда оценок, человек должен сделать 5 000 000. Нанимаешь по договору ГПХ 100 таких оценщиков, которые в течении месяца делают по 5000 оценок каждый.

И готово!
У тебя есть до-обученная модель через механизм Усиленного обучение на мнении человека — RLHF.

Итого. Сколько всего различных сущностей для оценки у нас получается?

Критический момент.

Погоди. Важно кое что отметить. У данного подхода есть существенный недостаток — нейро-оценщик только симулирует оценку человеком и может заблуждаться.

Чем дольше идёт процесс RLHF, тем с больше вероятность в голову обучаемой (основной) нейросети будут проскакивать бессмысленные варианты, ведь она следует рекомендациям другой нейросети.

Например, на запрос написать шутку про лесоруба, нейросеть генерирует вариант «Лесоруб работает со стволом гы гы гы», а нейро-оценщик поставит ему максимальный балл, как очень смешной шутке. Глюки есть у любой нейро-симуляции.
Возможное решение тут, смотреть на график. После начала деградации, заканчивать обучение.

График деградации обучения через RLHF.
График деградации обучения через RLHF.

Итог цикла статей «Формирование модели»

— А ты не плох! Это была последняя статья цикла про формирование большой языковой модели. Покрыли разные темы, но вот что хорошо бы запомнить наверняка.

Пре-обучение.
Модель как ученик, который прочитал и запомнил весь учебник. Вроде материала видел много, а по факту имеет смутное представление о прочитанном.

Пост-обучение SFT.
Модель как ученик, который смотрит примеры решения задач, где применяются усвоенные знания из учебника. Запоминает алгоритм действий.

Пост-обучение RL.
Модель как ученик, который пытается сам решить задачу, используя усвоенные знания и помня последовательность действий для решения задачи из примера.

На данный момент, существует множество новых видов обучения, которые отличаются скоростью, стоимостью или качеством результата. Все они привносят что-то новое, но фундаментально, не всегда разнятся сильно от описанных классических инструментов.