Читать книгу - "Рождение разума: Как интеллект зарождается в людях и нейросетях - Джей Макклелланд"
В связи с этим было бы замечательно, если бы распределенные представления способствовали формированию категорий. Поскольку они улавливают общие свойства различных экземпляров, они создают идеальные условия для возникновения категорий взаимосвязанных объектов. В идеале принадлежность к категории должна быть градуированной – как в реальной жизни: одни члены являются более типичными представителями категории, чем другие (например, малиновка – типичная птица, а курица – менее типичная). Более того, принадлежность к категории не должна быть жесткой и основываться на принципе «все или ничего». Да, у деревьев обычно широкие плоские листья, но у сосны – иголки. И все же она, безусловно, должна быть отнесена к категории деревьев.
Наконец, распределенные представления должны также отражать иерархические связи между категориями. Категория немецких овчарок – это подмножество категории собак; следовательно, немецкая овчарка должна наследовать многие из наиболее общих свойств собак. Как и другие собаки, немецкие овчарки должны классифицироваться как живые существа и иметь хвост, четыре лапы и подвижные уши. Нам не нужно заново узнавать эти свойства немецких овчарок, если мы уже знаем, что они присущи всем собакам.
Сети с распределенными представлениями справляются со всеми этим задачами. И даже способны на большее. Но как нейронные сети учатся создавать распределенные представления?
Создание распределенных представлений через обучение с коррекцией ошибок
Встретив знакомого на улице, мы вспоминаем его имя и профессию. Это пример отображения «вход-выход». Одна из ключевых целей как нашего разума, так и искусственной нейронной сети – научиться строить точные отображения «вход-выход». Здесь мы опишем, как это происходит согласно принципу, который мы называем обучением с коррекцией ошибок.
Нам предстоит изучить два ключевых вопроса. Первый: как нейронная сеть учится строить более точные отображения «вход-выход» с помощью обучения с коррекцией ошибок? Второй: как обучение с коррекцией ошибок позволяет получить полезные распределенные представления для объектов окружающего мира? Начнем с первого вопроса.
Основная идея обучения с коррекцией ошибок заключается в изменении силы связей (разработчики моделей называют их весами) таким образом, чтобы эти изменения уменьшали ошибку в отображении «вход-выход». Чтобы наглядно понять, о чем идет речь, представим, что мы хотим создать нейронную сеть, которая принимает на вход рукописную цифру (порой трудноразличимую) и выдает свою оценку того, что это за цифра.
Рисунок 7.3. Эта нейронная сеть принимает на вход рукописные цифры и определяет, что это за цифра. В данном случае входная семерка ошибочно распознана как тройка (на выходных элементах). При обучении с коррекцией ошибок сеть изменила бы свои веса так, чтобы уменьшить вероятность выдачи тройки и увеличить вероятность выдачи семерки
Рукописный текст бывает неоднозначным. Одна и та же цифра может быть написана по-разному, и иногда написанное может походить сразу на несколько цифр. Изображение на рисунке 7.3 напоминает семерку (перечеркнутую горизонтальной линией), но отчасти похоже и на тройку. Предположим, что это действительно семерка. Как создать нейронную сеть и научить ее правильно распознавать эту цифру?
Начнем с того, что обозначим некоторые элементы – крайний левый столбец нейронной сети на рисунке 7.3 – как входные элементы. Они принимают входные данные – в нашем случае изображение рукописной цифры. Обычно изображение разбивают на пиксели и каждому пикселю назначают отдельный элемент. Каждый элемент получает сигнал, пропорциональный степени закрашенности соответствующего пикселя. Многие элементы получат нулевой сигнал, поскольку их пиксели не закрашены, а некоторые могут получить максимальный сигнал – скажем, 1, если их пиксели полностью черные. В изображении 784 пикселя, поэтому нам потребовалось бы 784 входных элемента, но мы показали только 18, чтобы не перегружать рисунок. На рисунке 7.3 элементы, получающие ненулевой сигнал, выделены ореолом.
Входные элементы соединены с промежуточным слоем элементов, называемых скрытыми элементами, которые, в свою очередь, соединены со слоем выходных элементов. Выходных элементов 10 – по одному для каждой цифры. Скрытые элементы не получают сигналы извне сети и не передают их наружу – в этом смысле они и являются скрытыми. В некоторых сетях может быть несколько слоев скрытых элементов. Их назначение – дать сети возможность выявлять сложные взаимосвязи между входными паттернами и требуемым результатом. Подробнее мы обсудим это в главе 9.
В нашей сети каждый входной элемент связан с каждым скрытым, а каждый скрытый – с каждым выходным. Хотя в мозге существуют двусторонние связи, рассматриваемая нами сеть, как и многие искусственные сети, имеет только однонаправленные связи. Иначе говоря, входные элементы влияют на активацию скрытых, но скрытые не могут влиять на активацию входных. Точно так же скрытые элементы влияют на активацию выходных, но выходные не могут влиять на активацию скрытых. Такие сети часто называют сетями прямого распространения.
Когда мы подаем сигнал на входные элементы (соответствующий закрашенности пикселей входного изображения), можно представить, как активация распространяется на скрытые элементы. Чтобы вычислить активацию отдельного скрытого элемента, нужно умножить каждый входной сигнал на вес соответствующей связи с этим скрытым элементом и сложить все произведения. Множество скрытых элементов активируется в разной степени, и эта активация, в свою очередь, вызывает активацию в выходном слое. И вновь многие выходные элементы получают некоторую активацию. Допустим, выбор сети определяется элементом с наивысшей активацией. В нашем примере сеть активирует элемент «3» сильнее, чем элемент «7». Следовательно, тройка – это текущий результат обработки входного изображения.
Хотя тройка – вполне разумное предположение, правильный ответ все же семерка. Мы хотим научить сеть работать лучше. Как это сделать? Что в сети можно изменить?
Входные данные есть входные данные, они остаются прежними. Мы также не можем напрямую изменить активацию произвольного элемента, поскольку активация на каждом слое определяется активацией элементов предыдущих слоев. Зато мы можем изменять силу связей между элементами. Сила связей определяет степень влияния одних элементов на активацию других. Изменение этих сил, если мы сделаем это правильно, приведет к тому, что нужный элемент в выходном слое будет активироваться сильнее при следующей подаче того же входного сигнала. Дополнительный плюс: эти изменения
Прочитали книгу? Предлагаем вам поделится своим впечатлением! Ваш отзыв будет полезен читателям, которые еще только собираются познакомиться с произведением.
Оставить комментарий
- Тамара01 август 20:50Танец желаний. Дракон в подарок - Ирина АлексееваВолнующая история о девушке-студентке, изучающей боевую магию, и ее декане-драконе. Но слишком красивый и крутой ее однокурсник своим вмешательством чуть не испортил
- Тамара31 июль 20:352:5030/Эльф. Нежданный коннект - Станислав МиковЗавораживающая история любви принца из магического мира и питерской девушки, постоянно работающей за компьютером. Принцу просто стало скучно, ведь его мир тысячу лет
- Яна29 май 16:31Двойное отцовство - Таня ВолодинаКлассная история! Не похожа ни на одну про отношения МЖМ, которые я читала до этого. Очень приятные харизматичные герои, мастерски написанные характеры главных
- Аида06 май 10:49Дикарь королевских кровей. Книга 2. Леди-фаворитка - Анна Сергеевна ГавриловаЧитала легко, местами хоть занудно. Но, это лучше, чем 70% подобной тематики произведений.







