Перцептрон

Формирование значение слоя на основе слоя.

7 мин
По колено
08.08.2025

В прошлой статье мы поняли, как формируется значение нейрона, если он получает информацию из нескольких источников. Теперь осталось расширить масштаб и посмотреть, как рассчитать значения не одного, а нескольких нейронов, каждый из которых получает информацию из нескольких источников.

Иными словами, попробуем посчитать значения для всего нового нейронного слоя, с учётом значений предыдущего слоя нейронов и весов.

Перцептрон в 2 слоя.
Перцептрон в 2 слоя.

Так выглядит простейшая нейронная сеть — перцептрон.
Он состоит из трёх типов слоёв.

  • 1. Первый слой начинается со значений признаков и называется входящий. Как мы помним, признаками могут быть критерии квартиры — площадь, количество комнат, или другие признаки, которые мы хотим учесть при прогнозе стоимости новой квартиры на основе данных по текущей квартире.
  • 2. Следующие два слоя называются скрытыми слоями. Они нужны для обновления значений нейронов, чтобы повышать качество прогноза.
  • 3. Третий слой, он же финальный, содержит сам прогноз, который рассчитал нам перцептрон.

— В данном случае у нас двухслойный (по количеству скрытых слоёв) перцептрон. Так, а зачем нужны слои? Чтобы повышать точность прогноза. Чем больше слоёв, тем точнее результат работы нейросети.

Недавно мы познакомились с векторами, а если взять несколько векторов и поместить в одно пространство, то получится что? Матрица.

Вот для решения текущей задачи она-то нам и понадобятся. Ок?

Перемножение матрицы и вектора.
Перемножение матрицы и вектора.

Ок. Перемножаем матрицу весов для второго слоя на вектор значений нейронов первого слоя, прибавляем баес и получаем значения нейронов второго слоя.

Вообще, матричное перемножение это основа функционирования любой модели нейронной сети архитектуры «Трансформер».

На досуге.

Домашнее задание, чтоб потом рассказать друзьям: «Я вчера перемножал матрицы в перцептроне».
Посчитай значение нейрона последнего слоя, чтобы узнать прогноз нашей модели. Это же упражнение мы делали в предыдущей статье.

3 статьи мы изучали каким образом нейроны получают своё значение.
Возможно, ты спросишь:
— а откуда берутся значения для самого первого слоя нейронов? Он ведь не получает информацию из других источников. Там просто неоткуда.

Верно.

В примере выше использовались известные признаки квартиры, но в нейронках архитектуры «Трансформер» признаков нет, вместо них просто какие-то цифры. ♨️
Фишка в том, что на этапе пре-обучения, значения нейронов в нейронной сети инициализируются случайным образом, желательно в рамках нормального распределения. А потом настраиваются через градиентный спуск и обратную пропагинацию таким образом, чтобы повышалась вероятность прогноза целевого токена (лейбла) через минимизацию функции ошибки.

А на что влияют все эти значения нейронов вообще и зачем они нужны нейронной сети?

Влияние на практике.

Вспомни название первой статьи этого цикла — «Нейрон, штука которой думать». Значения нейронов буквально определяют, какой следующий токен (слово, слог, буква) будет сгенерирован моделью.
Например, во фразе «Поздравляю с _____ » мы хотим видеть скорее слова «Новым Годом» и «днём Рождения», чем «кофе» или «новой пилой». По итогу пре-обучения, модель поймёт взаимосвязь, настроит значения нейронов так, что нужные слова будут иметь высокую вероятность прогноза, а «стул» или «новой пилой» низкую вероятность.

— Много непонятно было в последних абзацах. Понимаю. Будем потихоньку раскрывать и объяснять все эти темы. А возможно, станет понятнее после цикла "Формирование модели"?