Читать книгу - "Рождение разума: Как интеллект зарождается в людях и нейросетях - Джей Макклелланд"
Теперь подумаем об активациях скрытых элементов. Какие из них стоит увеличить? Максимальную отдачу дадут те, что связаны с выходными элементами через наибольшие веса. Например, если W8 больше, чем W7 и W9, нам следует увеличить активацию среднего скрытого элемента. Интересно, что теперь уже веса подсказывают нам, какие активации скрытых элементов следует увеличивать. В этом и заключается суть обратного распространения: мы получаем ошибку на выходном элементе, как и раньше, затем умножаем ее на вес от каждого скрытого элемента к выходному. Это произведение становится тем, что Румельхарт назвал обратно распространенной ошибкой от выходного элемента к скрытому. Если выходных элементов несколько, полная обратно распространенная ошибка для скрытого элемента равна сумме ошибок, распространенных от всех выходных элементов.
Разумеется, напрямую изменить активации скрытых элементов невозможно. Но понимание того, какими мы хотели бы их видеть для максимальной эффективности корректировок, позволяет рекурсивно применить тот же процесс к предыдущему слою. В нашем примере мы используем активации входных элементов I1 и I2, чтобы вычислить, какие изменения строчных w приблизят нас к желаемым уровням активации скрытых элементов.
Вот и вся суть обратного распространения! Конечно, есть и другие детали, которые следует учитывать (например, множественные выходные элементы, веса смещения и функции активации, преобразующие суммарный вход нейрона в его активацию), но они не меняют принципа работы алгоритма. Важно также помнить: как и при обсуждении дельта-правила, описанный процесс относится к одному обучающему примеру. Его придется повторить множество раз на множестве примеров, прежде чем нейронная сеть научится обобщать и работать с ранее не встречавшимися входными данными.
Обобщим, как нейронные сети обучаются методом обратного распространения. Сначала подаются входные данные, которые задают активацию входных элементов. Затем активация распространяется вперед по сети. Далее мы сравниваем выход сети с целевым значением и вычисляем ошибку. После этого используем веса связей для определения обратно распространенной ошибки каждого скрытого элемента. Теперь у нас есть величины ошибок для всех элементов и их активации, полученные при прямом распространении. Наконец, мы корректируем каждый вес на величину, равную произведению скорости обучения, ошибки принимающего элемента и активации передающего элемента. Здесь кроется интересная тонкость: изменения весов связей от скрытых элементов к выходным (заглавные W на рисунке 9.4) зависят от весов связей от входных элементов к скрытым (строчные w). Дело в том, что строчные w определяют активацию скрытых элементов, которая, в свою очередь, влияет на то, как должны изменяться заглавные W. И наоборот: изменения строчных w зависят от значений заглавных W, поскольку заглавные W определяют величины обратно распространенных ошибок, указывающие, какие активации скрытых элементов следует изменить для максимального воздействия на ошибку выходного слоя. А это, в свою очередь, определяет, как нужно менять строчные w для минимизации ошибки.
Отсюда следует важный вывод: эффективность корректировки одного веса связи зависит от текущих значений других весов. Это существенно, поскольку означает: то, что система с обратным распространением извлекает из обработки конкретного примера, зависит от того, чему она научилась ранее.
Сильные стороны и ограничения обратного распространения
Обратное распространение эффективно находит веса связей, которые обеспечивают успешное обучение во многих сферах. Метод успешно применяется в моделях человеческих когнитивных способностей, включая модели усвоения и утраты понятий (глава 7). Этот алгоритм также лежит в основе обучения современных языковых моделей (глава 8) и других сложных систем искусственного интеллекта. Особенности современных моделей ИИ усложняют вычисления, но в основе их работы лежат те самые принципы, которые мы здесь описали.
Однако у обратного распространения есть существенные ограничения. Во-первых, настоящие нейронные сети в мозге не могут передавать сигналы ошибки назад по тем же связям, по которым идет прямое распространение активации, а именно это требуется, чтобы получить правильные величины ошибок скрытых элементов. Исследователи предложили более биологически правдоподобные алгоритмы, которые с некоторым успехом распространяют сигналы ошибки без использования одинаковых весов связей в обоих направлениях, но в системах ИИ они не применяются, поскольку работают хуже обратного распространения.
Во-вторых, обратное распространение и родственные алгоритмы коррекции ошибок требуют огромного объема обучающих данных, чтобы хорошо работать на новых примерах. Самые мощные языковые модели, как мы отметили в главе 8, используют в 100 000 раз больше обучающих данных, чем человек может встретить за всю жизнь. Иными словами, обратное распространение может быть мощным инструментом и способно воспроизводить многие аспекты наших когнитивных способностей, но учится оно намного менее эффективно, чем наш биологический мозг.
Почему же обратное распространение настолько неэффективно? Ключевая проблема в том, что оно не фокусируется на тех весах связей, изменение которых принесло бы максимальную пользу. Рассмотрим пример применения обратного распространения в языковой модели, где мы предсказываем каждое слово в предложении на основе всех предыдущих слов. Допустим, вы слышите предложение: «Джон пьет кофе со сливками и медом». Вы ожидали услышать сахар, но получили другое слово, что создает большую ошибку. При обратном распространении произойдет следующее: будут скорректированы связи во всех путях прямого распространения через сеть от всех слов входной последовательности. В результате мы станем реже предсказывать сахар и чаще предсказывать мед всякий раз, когда встретим любое предложение о продукте, который кто-то добавляет в кофе. Более совершенная процедура смогла бы определить, что, возможно, стоит запомнить: именно Джон пьет кофе с медом, и тогда можно было бы целенаправленно корректировать веса, связанные с влиянием персоны Джона на предсказание. Но обратное распространение научится приписывать «заслугу» предсказания меда в предложениях про Джона только после постепенного обучения, когда такие предложения будут чередоваться с предложениями о других людях, которые предпочитают сахар.
Обучение с подкреплением: приносит результат, но не поддается контролю
До сих пор во всех рассмотренных ситуациях обучения мы учились, связывая входные данные с выходными. Но что делать, когда выходных данных нет? Мы постоянно сталкиваемся с такими ситуациями – например, подходим к перекрестку, и никто не подсказывает нам, куда свернуть. Наш последний подход к обучению, который называется обучение с подкреплением, решает эту проблему, опираясь на положительные или отрицательные результаты – вознаграждения – для обновления силы связей.
Обучение с подкреплением тесно связано
Прочитали книгу? Предлагаем вам поделится своим впечатлением! Ваш отзыв будет полезен читателям, которые еще только собираются познакомиться с произведением.
Оставить комментарий
- Тамара01 август 20:50Танец желаний. Дракон в подарок - Ирина АлексееваВолнующая история о девушке-студентке, изучающей боевую магию, и ее декане-драконе. Но слишком красивый и крутой ее однокурсник своим вмешательством чуть не испортил
- Тамара31 июль 20:352:5030/Эльф. Нежданный коннект - Станислав МиковЗавораживающая история любви принца из магического мира и питерской девушки, постоянно работающей за компьютером. Принцу просто стало скучно, ведь его мир тысячу лет
- Яна29 май 16:31Двойное отцовство - Таня ВолодинаКлассная история! Не похожа ни на одну про отношения МЖМ, которые я читала до этого. Очень приятные харизматичные герои, мастерски написанные характеры главных
- Аида06 май 10:49Дикарь королевских кровей. Книга 2. Леди-фаворитка - Анна Сергеевна ГавриловаЧитала легко, местами хоть занудно. Но, это лучше, чем 70% подобной тематики произведений.







