Как делается GPT-5

Процесс формирования и обучения модели.

4 мин
Берег
23.09.2025

Слышали выражения – «обучить нейросеть», «до-обученная нейросеть» и подобные? Все они означают или способ (метод обучения) или датасет, за счёт которого нейросеть типа GPT улучшила свои навыки прогноза. Давайте разберёмся, что эти выражения означают на практике.

Этапы обучения.

Под обучением нейронных сетей, в большинстве случаев, подразумеваются 3 этапа:

  • 1. Формирование базовой модели нейросети, пре-обучение.

    На данном этапе нейросети даётся эрудиция, очень много знаний, которыми далее она будет оперировать при генерации ответа.

  • 2. Настройка модели под присмотром, пост-обучение.

    Называется Supervised Fine Tuning (SFT). На данном этапе нейросети задаётся паттерн общения, соответствующий и удобный для восприятия человеком. Если нужно чтоб корпоративный чат-бот отвечал с применением ценностей и корп. культуры, это закладывается именно на этом этапе.

  • 3. Усиленное обучение, пост-обучение.

    Называется Reinforcement Learning (RL, RLHF, ...) В зависимости от подхода, тут нейросети задаётся навык приходить к правильному решению, исключая неэффективные пути. Известные модели типа GPT и Deepseek были обучены ровно через эти этапы, с небольшими отличиями в методике и математике, которые мы осознанно опустим.

Давай конкретнее.

GPT 4o — это модель, прошедшая пре-обучение и два этапа пост-обучения: SFT и RLHF. Она лучше подходит для работы с фактической информацией. Важно отметить, RLHF (Reinforcement Learning with Human Feedback) это вообще не тоже самое как RL и сильно менее круто.

GPT o1 — это модель, также прошедшая пре-обучение и два этапа пост-обучения SFT и RL. Но отличия именно в последнем этапе. RL это сложно, мало кто раскрывает процедуру. Такое обучение позволяет модели называться Reasoning Model или “Размышляющая модель”. Она лучше справляется с аналитическими задачами, там, где надо расписывать ход мыслей и постепенно приходить к ответу. Она обходится сильно дороже в поддержке поэтому количество бесплатных итераций у неё сильно меньше.

Каждый из трёх этапов мы будем раскрывать детальнее в этой секции, а пока...

2 вопроса, один со звёздочкой.

1. Как думаешь, почему GPT o1 обходится разработчикам дороже в работе с запросами пользователей?

2. Почему постепенный приход к ответу повышает качество, по сравнению с ответом модели в лоб одной строкой?

— Эй! Возможно сейчас ответить и не получится, но может, после прочтения всех статей?