SFT vs RLHF
Ключевой элемент пайплайна.
Давай вспомним, RLHF - это обучение модели приходить к правильному результату, выбранному человеком. SFT - по сути, тоже обучение модели давать правильный результат, сформированный человеком. В чём же разница между этими подходами и какой может быть эффективнее?
Какие задачи.
Конечно, они применяются для достижения разного рода задач. Насаждение модели определенного паттерна ответов и формирование нужной цепочки для прихода к результату — это разные вещи. Но давайте представим что у нас есть задача, которую можно решить этими обоими способами.
— Ну например. Когда пользователь задаёт вопрос про политику. Мы хотим чтоб она отвечала как Трамп. Ого!
То есть мы хотим увидеть свойственные ему размышления, вокруг да около, потом бахвальство, потом шутки про демократов и в самом конце ответ на вопрос. Мы можем обучить модель такому общению через паттерн, используя SFT. Для этого формируем множество пар вопрос-ответ. Разные вопросы о политике - разные ответы, но в его уникальном стиле. 500 таких пар, любимый фреймворк для до-обучения, немного времени и готово.
Также, мы можем научить модель размышлять в его стиле органически. Запуская множество цепочек рассуждения, выбирая правильные из них, используя RLHF. Тогда модель будет на все вопросы отвечать в стиле Трампа, что, на самом деле, выполнит и нашу задачу.
Общим в этих подходах будет момент, когда человек определяет ориентир, к достижению которого модель будет стремиться.
Конечно, можно говорить про механику работы подходов, эффективность использования GPU, стоимости и это всё будет правильно. Давай поговорим про ещё один элемент, участвующий в обоих случаях. Про человека.
Что человек делает в пост-обучении SFT? Он пишет правильные варианты ответа. Массив его правильных ответов будет определять паттерн общения модели.
Что человек делает в пост-обучении RLHF? Он выбирает правильные варианты ответа. Модель делает множество попыток верно ответить, человек определяет лучшие.
— То есть, в первом случае человеку надо сформировать правильный ответ, а во втором — выбрать правильный ответ из представленных.
Нейроны в голове.
Разносторонне развитому специалисту с прокаченными софтами, наверно, будут комфортны оба подхода. Но в большинстве ситуаций, человеку проще делать то, на что мозг тратит меньше энергии. Это вытекает из эволюции и механизмов выживания, заложенных в головном мозге. Путь выполнения задачи, где затрачивается наименьшее количество энергии считается самым эффективным. Поэтому быть ленивым и умным круто - находишь решение и делаешь дела с минимальными энергозатратами.
Остается энергия на Стимчик.
Какую задачу энергетически проще выполнять - задачу генерации лучшего ответа, или задачу маркировки лучшего ответа из представленных?
Правильно, человеку проще делать второе.
Мало того, что проще, этот подход и с точки зрения применения критического мышление работает лучше: когда сравниваешь разные варианты друг с другом, которые вот, перед глазами, проще понять где лучший.
То есть, на выборке из 1000 случаев, вероятность что человек корректно формирует 1000 правильных вариантов сильно ниже, чем вероятность, что человек корректно выберет лучший вариант из 4 и сделает это 1000 раз.
Ключевой элемент.
Таким образом, хоть такой кейс на проде в корпорации маловероятен, но при прочих равных, RLHF будет эффективнее SFT, поскольку в нём эффективнее проявляет себя ключевой элемент пайплайна — человек.
Читать далее
Нейрон
Штука которой думать.