Books-Lib.com » Читать книги » Разная литература » Рождение разума: Как интеллект зарождается в людях и нейросетях - Джей Макклелланд

Читать книгу - "Рождение разума: Как интеллект зарождается в людях и нейросетях - Джей Макклелланд"

1 ... 47 48 49 50 51 52 53 54 55 ... 78
Перейти на страницу:
них любые релевантные подсказки, которые помогут правильно интерпретировать ключ и предсказать слово холодный. Непосредственно предшествующее слово увидел подсказывает, что ключ – это существительное, но не указывает на то, что он будет холодным. Слова по лесу дают потенциально важную подсказку: в лесу обычно прохладно, и источник, скорее всего, будет холодным. Из земли – еще одна значимая деталь. А вот некоторые другие слова предложения не несут полезной контекстной информации. Нам бы хотелось, чтобы система уделяла больше внимания словам по лесу и из земли, чем, скажем, слову шел. Но это далеко не тривиальная задача. Да, нам кажется, что мы без усилий понимаем: после слова очень в этом предложении естественно следует холодным. Вопрос в том: как наши машины достигают такого результата на механистическом уровне? Хотя наш мозг устроен иначе, чем эти машины, понимание их работы может пролить свет и на работу человеческого мозга.

Решение этой проблемы было предложено в 2014 г. Дмитрием Богдановым, Кёнхёном Чо и Йошуа Бенджио из Монреальского университета. Они представили новый механизм для нейронных сетей под названием внимание, призванный улучшить качество машинного перевода. Бенджио, удостоенный премии Тьюринга в области искусственного интеллекта в 2018 г. вместе с Джеффри Хинтоном и Яном Лекуном, много лет изучал модели типа элмановской, и его группа хорошо понимала их ограничения. В 2017 г. исследователи из Google Brain взяли механизм внимания на вооружение и создали мощную модель машинного перевода, описанную в статье с говорящим названием «Внимание – это все, что нужно» (Attention Is All You Need). По их мнению, модуль внимания дал языковым моделям возможность использовать информацию из любой точки длинного предшествующего контекста – и это было «все, что нужно» для улучшения машинного перевода. Последующие работы OpenAI показали, что внимание (в сочетании с обучением через исправление ошибок при предсказании следующего слова) может быть если не всем, что нужно, то по крайней мере важнейшим компонентом для появления новых возможностей, о которых раньше не догадывались.

Модели GPT от OpenAI, как и многие другие LLM, содержат многоуровневый стек модулей нейронной сети, называемых блоками трансформеров. В крупных моделях таких блоков может быть до 100, и каждый включает в себя копию механизма внимания и трехслойную сеть прямого распространения. Когда модель обрабатывает очередное слово последовательности, его контекстно независимое векторное представление поступает на вход первого блока трансформера в основании стека. Это тот самый паттерн активации, о котором шла речь выше, – он формируется в процессе обучения с исправлением ошибок и помогает модели предсказывать последующие слова в тексте. Возьмем слово ключ в нашем предложении о путнике у родника. Его начальный паттерн можно представить как компромисс между двумя вариантами: одним – для металлического предмета и другим – для водного источника. По мере прохождения через стек блоков трансформеров этот паттерн постепенно трансформируется, приобретая контекстуально уместное значение, а затем, ближе к вершине стека, преобразуется в паттерн, подходящий для предсказания слова холодный.

Рассмотрим работу механизма внимания в первом блоке трансформера, где модель начинает корректировать контекстно независимый паттерн слова ключ, приближая его к контекстуально обусловленному значению. Для этого создается набор специальных паттернов – запросов. Запросы можно представить как паттерны, которые задают вопросы, адресованные словам контекста. При обработке каждого слова модель также генерирует паттерны, называемые ключами и значениями. Ключи и значения от предыдущих слов используются для ответа на запросы текущего слова. Хотя запросы, ключи и значения – это выученные паттерны, которые невозможно полностью описать словами, мы можем представить, что в нашем предложении один из запросов от слова ключ ищет слова, обозначающие объекты, которые могут быть либо металлическими предметами, либо источниками воды. Соответствующий ключ от слова замок или вода может совпасть с этим запросом, а соответствующее значение может быть паттерном, передающим информацию вроде «я запираюсь металлическим предметом под названием ключ» или «я вытекаю из-под земли, и это называется ключ». Поскольку в контексте присутствует слово вода, а слова замок нет, ответ на запрос поможет определить, что в данном случае ключ означает источник, из которого можно набрать воды.

В основе механизма внимания – процесса, который мы назовем вниманием на основе запросов, – лежит идея о том, что сопоставление запроса и ключа носит градуированный характер. Благодаря этому несколько слов из контекста могут участвовать в формировании ответа на запрос. Эти ответы комбинируются, причем вклад каждого определяется степенью соответствия между запросом и ключом. Мы проиллюстрируем эти принципы на рисунке 8.2. Слева показаны запрос от одного слова (допустим, ключ) и ключи от нескольких слов, которые могут встречаться в контексте, – например, шел, лес и по. Запрос от слова ключ в разной степени соответствует ключам каждого из этих слов. Модуль внимания присваивает каждому слову оценку внимания в зависимости от степени соответствия запросу. Затем модуль формирует паттерн составной оценки, суммируя отдельные паттерны значений, где вклад каждого определяется его оценкой внимания. В нашем случае слово лес получило намного более высокую оценку внимания и внесло наибольший вклад; шел добавил совсем немного; а по не добавило практически ничего. Наконец, этот составной паттерн значений используется для корректировки паттерна, поступившего на вход модуля внимания, смещая его в сторону контекстуально уместного представления водного источника. После дополнительной обработки сетью прямого распространения в блоке трансформера контекстно скорректированный паттерн становится входом для следующего блока. Такая же процедура внимания на основе запросов и последующая обработка выполняются в следующем блоке трансформера, затем в следующем – и так по всему стеку, пока выход последнего блока не будет использован для предсказания следующего слова.

Рисунок 8.2. Паттерны и оценки внимания в механизме внимания на основе запросов. Запрос от слова (здесь: ключ) сравнивается с ключами слов из контекста, порождая оценки внимания, которые зависят от степени соответствия запроса каждому ключу. Оценки внимания определяют вклад вектора значений каждого слова в составной паттерн внимания. Этот паттерн используется для корректировки контекстно независимого представления слова ключ, чтобы оно отражало значение, соответствующее предшествующему контексту

Важное преимущество внимания на основе запросов заключается в способности работать с очень длинными фрагментами предшествующего контекста. Модели сохраняют ключи и значения предыдущих слов в так называемом контекстном окне, которое может охватывать тысячи и даже миллионы слов. Это позволяет им использовать несравнимо больше контекстной информации, чем могли ранние модели, что дает им решающее преимущество перед предшественниками.

У вас может возникнуть вопрос: откуда берутся все эти паттерны? Мы говорили о запросах, ключах и значениях – неужели их спроектировали инженеры, создавшие трансформер? Вовсе нет – ни один паттерн в модели не был создан намеренно. Контекстно независимое векторное представление (эмбеддинг) каждого слова формируется через выученные веса связей,

1 ... 47 48 49 50 51 52 53 54 55 ... 78
Перейти на страницу:
Похожие на "Рождение разума: Как интеллект зарождается в людях и нейросетях - Джей Макклелланд" книги читать бесплатно полные версии
Отзывы - 0

Прочитали книгу? Предлагаем вам поделится своим впечатлением! Ваш отзыв будет полезен читателям, которые еще только собираются познакомиться с произведением.


Новые отзывы

  1. Тамара01 август 20:50Танец желаний. Дракон в подарок - Ирина АлексееваВолнующая история о девушке-студентке, изучающей боевую магию, и ее декане-драконе. Но слишком красивый и крутой ее однокурсник своим вмешательством чуть не испортил
  2. Тамара31 июль 20:352:5030/Эльф. Нежданный коннект - Станислав МиковЗавораживающая история любви принца из магического мира и питерской девушки, постоянно работающей за компьютером. Принцу просто стало скучно, ведь его мир тысячу лет
  3. Яна29 май 16:31Двойное отцовство - Таня ВолодинаКлассная история! Не похожа ни на одну про отношения МЖМ, которые я читала до этого. Очень приятные харизматичные герои, мастерски написанные характеры главных
  4. Аида06 май 10:49Дикарь королевских кровей. Книга 2. Леди-фаворитка - Анна Сергеевна ГавриловаЧитала легко, местами хоть занудно. Но, это лучше, чем 70% подобной тематики произведений.