Books-Lib.com » Читать книги » Разная литература » Рождение разума: Как интеллект зарождается в людях и нейросетях - Джей Макклелланд

Читать книгу - "Рождение разума: Как интеллект зарождается в людях и нейросетях - Джей Макклелланд"

1 ... 56 57 58 59 60 61 62 63 64 ... 78
Перейти на страницу:
с законом эффекта, который сформулировал психолог Эдвард Торндайк в начале 1900-х годов. Основная идея Торндайка состояла в том, что поведение, приводящее к «удовлетворяющим» (термин Торндайка) последствиям, с большей вероятностью повторится, а поведение с неудовлетворяющими или неприятными последствиями – с меньшей.

Чтобы продемонстрировать закон эффекта, Торндайк сконструировал деревянные ящики с различными механизмами: защелками, рычагами и веревками. При правильном воздействии эти механизмы открывали дверцу, позволяя животному выбраться наружу. В типичном эксперименте Торндайк помещал голодную кошку внутрь такого ящика. Снаружи, в пределах видимости, но вне досягаемости, он клал аппетитное лакомство. Задача кошки заключалась в том, чтобы понять, как выбраться из ящика и добраться до угощения. В начале эксперимента кошка совершала множество бесполезных движений, царапала и трогала лапами разные части ящика. В конце концов, методом «проб и ошибок», как называл это Торндайк, кошка – на первый взгляд случайно – приводила в действие механизм, открывающий дверцу. Торндайк тщательно фиксировал время, которое требовалось каждой кошке для побега при повторных попытках. Результаты оказались поразительными. С каждой новой попыткой кошкам требовалось все меньше времени на то, чтобы выбраться.

В основе алгоритма обучения с подкреплением (RL – reinforcement learning) лежит логика закона эффекта. Подобно кошке Торндайка, которая пробует разные способы выбраться из ящика, система с RL экспериментирует со множеством последовательностей действий. Она фиксирует вознаграждение, которое получает (или не получает) в конце каждой последовательности. Действия в успешных последовательностях подкрепляются, а в неуспешных – ослабляются. В отличие от обучения с коррекцией ошибок, здесь нет обучающего набора «правильных» действий, с которым система должна сверяться. Единственная обратная связь – это величина полученного вознаграждения. Важно понимать: принципиальное различие между RL и обучением с коррекцией ошибок заключается не в алгоритме обучения, а в обучающем сигнале. В RL мы настраиваем связи для максимизации вознаграждения, а не для уменьшения ошибки.

Чтобы понять принцип работы обучения с подкреплением, представим робота в сложном лабиринте со множеством путей и тупиков. В одной точке лабиринта робот получает сигнал вознаграждения – положительный или отрицательный. Попадание в тупик приносит небольшое отрицательное вознаграждение. Робот может начинать из любой точки лабиринта – это его состояние. Из каждого состояния он может выполнить одно из четырех действий: двигаться вперед, назад, влево или вправо. Выполняя действие, он меняет свое состояние. Роботу нужно научиться выбирать действие из любого состояния так, чтобы максимизировать вознаграждение. Такое соответствие между состояниями и действиями называется политикой. Робот с хорошей политикой быстро находит доступные вознаграждения, в отличие от робота с менее оптимальной политикой.

Существует множество вариантов обучения с подкреплением, применимых к задаче робота в лабиринте, но мы рассмотрим подход под названием оптимизация политики. Он использует информацию о результатах в полном соответствии с основной идеей закона эффекта. В простейшем варианте оптимизация политики применяет обратное распространение для обучения сети: она усиливает склонность выполнять все действия из последовательности, которая привела к успеху, и ослабляет склонность выполнять действия из неудачной последовательности. Применительно к нашему роботу: мы помещаем его в случайную точку лабиринта и позволяем случайно выбирать действия, пока он не достигнет награды или тупика. Если робот добрался до награды, мы рассматриваем каждое его действие в каждом состоянии как целевое и обучаем сеть методом обратного распространения, усиливая склонность выполнять эти действия из соответствующих состояний. Если же робот попал в тупик, мы рассматриваем каждый его шаг как ошибочный и используем обратное распространение, чтобы уменьшить склонность сети выполнять эти действия.

Одним из самых впечатляющих достижений обучения с подкреплением стала победа AlphaGo от DeepMind над прославленным чемпионом мира по го, которая потрясла весь мир. Го считается игрой, которая требует глубокой интуиции, а число возможных позиций в игре настолько огромно, что их невозможно перебрать полностью. Поэтому долгое время считалось, что компьютер никогда не сможет освоить эту игру. И все же AlphaGo справился. Причем без обучения набору стратегий или принципов – он учился методом обучения с подкреплением, играя бесчисленное количество партий сам с собой. AlphaGo использовал сети с оптимизированной политикой в сочетании с сетью, обученной оценивать ценность различных позиций на доске (где ценность – это вероятность того, что дальнейшие ходы из данной позиции приведут к победе). Во время игры сети политики генерировали варианты последовательностей ходов, а сети ценности оценивали получавшиеся позиции, определяя лучший вариант. Следующим ходом становилось просто первое действие из последовательности с наивысшей оценкой.

Другой интересный пример использования обучения с подкреплением – тонкая настройка ответов LLM (глава 8). Предсказывая следующее слово, LLM иногда может выдать нежелательное ругательство (поскольку ненормативная лексика присутствует в обучающих данных). Чтобы этого избежать, LLM дополнительно настраивают алгоритмом обучения с подкреплением, который штрафует за генерацию ненормативной лексики или другого нежелательного контента. LLM генерирует несколько вариантов ответов, которые затем оценивает отдельная нейронная сеть, обученная распознавать неподобающие выражения. Ответы LLM с нежелательными словами получают меньшее вознаграждение, что побуждает модель избегать такой лексики в будущем. После множества итераций модель учится создавать ответы, максимизирующие вознаграждение за счет исключения ненормативной лексики и других нежелательных элементов.

Несмотря на эти успехи, обучение с подкреплением на основе обратного распространения имеет серьезные ограничения. Дело в том, что такие системы вынуждены усреднять свой опыт по огромному количеству последовательностей действий, чтобы определить, какие именно действия в последовательности оказались решающими для результата. Если робот добрался до награды после 1000 действий, какие из них заслуживают большего доверия? Или наоборот: если робот постоянно попадал в тупики после 1000 действий, какие из них в первую очередь были тому причиной? Распределение заслуг или вины между всеми действиями требует огромных вычислительных ресурсов и, скорее всего, невыполнимо для биологической системы обучения – ей потребовалось бы множество жизней для накопления достаточного опыта в различных ситуациях. Пионер искусственного интеллекта Джеффри Хинтон метко сказал по этому поводу: «Это как если бы каждый житель Соединенных Штатов пытался определить, продуктивно ли он провел рабочий день, наблюдая за ежедневными изменениями валового национального продукта». Опираясь на схожие аргументы, многие специалисты по когнитивным наукам и нейробиологи признают, что люди учатся намного эффективнее, – но, как и в случае с обучением через коррекцию ошибок, механизм этой эффективности остается загадкой.

К чему мы пришли?

Алгоритм обучения – это механистический процесс, в ходе которого нейронная сеть изменяет силу связей (веса) между своими элементами. Эволюция дает нам полезную отправную точку, но обучение на протяжении жизни системы также играет важную роль. В рамках нейросетевого подхода процесс изменения силы связей направляется входными данными и обратной связью от окружающей среды в сочетании с распространением сигналов, которые несут информацию о том, как именно следует изменять связи.

Как мы увидели в этой главе, у разных алгоритмов обучения есть свои

1 ... 56 57 58 59 60 61 62 63 64 ... 78
Перейти на страницу:
Похожие на "Рождение разума: Как интеллект зарождается в людях и нейросетях - Джей Макклелланд" книги читать бесплатно полные версии
Отзывы - 0

Прочитали книгу? Предлагаем вам поделится своим впечатлением! Ваш отзыв будет полезен читателям, которые еще только собираются познакомиться с произведением.


Новые отзывы

  1. Тамара01 август 20:50Танец желаний. Дракон в подарок - Ирина АлексееваВолнующая история о девушке-студентке, изучающей боевую магию, и ее декане-драконе. Но слишком красивый и крутой ее однокурсник своим вмешательством чуть не испортил
  2. Тамара31 июль 20:352:5030/Эльф. Нежданный коннект - Станислав МиковЗавораживающая история любви принца из магического мира и питерской девушки, постоянно работающей за компьютером. Принцу просто стало скучно, ведь его мир тысячу лет
  3. Яна29 май 16:31Двойное отцовство - Таня ВолодинаКлассная история! Не похожа ни на одну про отношения МЖМ, которые я читала до этого. Очень приятные харизматичные герои, мастерски написанные характеры главных
  4. Аида06 май 10:49Дикарь королевских кровей. Книга 2. Леди-фаворитка - Анна Сергеевна ГавриловаЧитала легко, местами хоть занудно. Но, это лучше, чем 70% подобной тематики произведений.