Books-Lib.com » Читать книги » Разная литература » Рождение разума: Как интеллект зарождается в людях и нейросетях - Джей Макклелланд

Читать книгу - "Рождение разума: Как интеллект зарождается в людях и нейросетях - Джей Макклелланд"

1 ... 48 49 50 51 52 53 54 55 56 ... 78
Перейти на страницу:
идущие от единственного входного элемента, назначенного для этого слова, к слою нейроноподобных элементов, который служит входом для первого блока трансформера. Эти веса связей настраиваются в процессе обучения для минимизации ошибок предсказания следующего слова. Веса связей, выученные путем коррекции ошибок предсказания следующего слова, также используются для генерации паттернов запросов, ключей и значений на каждом уровне стека трансформеров. Обработка в модулях прямого распространения также опирается на веса связей, выученные через исправление ошибок предсказания. Таким образом, модель использует выученные веса связей для представления контекстно независимых значений слов, их контекстуализации и формирования полезных предсказаний, опираясь на выученные паттерны запросов, ключей и значений.

От предсказания слов к мастерству в сложных задачах

Надеемся, наш рассказ о контекстуализации значений слов и предсказании следующего слова приоткрыл завесу над работой механизма внимания в LLM и прояснил, как они используют информацию из предшествующего контекста для улучшения предсказаний. Однако остается вопрос: что наделяет их способностью вести осмысленный диалог, порой поразительно похожий на разговор между людьми, демонстрировать человеческий уровень выполнения задач, которым их специально не обучали, и становиться все более искусными в таких сложных областях, как решение математических задач и логические рассуждения? Хотя точного ответа не знает никто, полезно рассмотреть следующую идею: чтобы научиться (через исправление ошибок) превосходно предсказывать следующее слово на огромном корпусе текстов, модель вынуждена освоить невероятно широкий спектр задач. Эта простая идея стала ключевым ориентиром для Ильи Суцкевера, которого по праву считают визионером ИИ, стоящим за появлением ChatGPT.

Суцкевер выдвинул гипотезу: если просто обучить модель хорошо предсказывать следующее слово, она неизбежно обретет тот тип универсального интеллекта, который мы приписываем выдающимся мыслителям. Он был убежден, что обучение через исправление ошибок само найдет решение. И действительно, при наличии достаточного объема обучающих данных и достаточно большой нейронной сети эта стратегия в целом оправдала себя.

Научившись качественно предсказывать следующее слово, языковые модели обретают способность опираться на знания о мире и конкретную контекстную информацию для формирования обоснованных выводов. Эти выводы выражаются словами, но несут в себе релевантную фактическую информацию. Рассмотрим пример:

Джону 17 лет, а Биллу 23. Тот, кто по закону пока не может покупать алкоголь, – это _____.

Чтобы дать правильный ответ, нужно знать минимальный возраст для покупки алкоголя и помнить, какое число относится к возрасту Джона, а какое – к возрасту Билла. Раньше считалось, что для отслеживания таких связей требуется специальный механизм и нейронные сети никогда не смогут этому научиться. LLM во многом справились с этой задачей, хотя при слишком большом количестве элементов для запоминания они могут (как и люди!) их путать.

Как же LLM отслеживает соответствие между именами и возрастом, а затем правильно отвечает на вопрос? Полной ясности нет, но исследователи ИИ изучили детали процесса в схожих ситуациях и пришли к выводу, что механизм выглядит примерно так. При обработке фразы «Джону 17» модель помещает паттерн, соответствующий имени Джон, в вектор значения, связанный с числом 17, а паттерн, представляющий само число (возраст человека), – в соответствующий ключ. Этот процесс называют связыванием, поскольку он объединяет атрибуты одного объекта. Такая операция может играть ключевую роль в успехе языковых моделей. Когнитивисты и исследователи из Anthropic – компании, создавшей чат-бота Claude, – полагают, что способность выполнять операции связывания и затем использовать их результаты для извлечения отдаленной информации критически важна для работы больших языковых моделей.

В нашем примере процесс связывания повторяется при чтении «Биллу 23»: паттерн для Билл становится значением, связанным с ключом-паттерном числа 23. Когда модель обрабатывает фразу «Тот, кто слишком молод, чтобы покупать алкоголь, это», она может выдать правильный ответ, сформировав запрос на поиск человека младше 21 года. Этот запрос совпадает с ключом для 17, и в результате возвращается значение Джон.

Если задуматься, становится очевидно, что каждый из описанных шагов в процессе вывода имени Джон, вероятно, опирается на механизм внимания на основе запросов. Например, запрос от 17 для поиска соответствующего имени был бы одним из этапов копирования паттерна Джон в вектор значения, связанный с возрастом 17. Поистине удивительно, что все эти операции внимания, включая возникновение связывания, и все паттерны, которые они переносят из одного места в другое, формируются исключительно через настройку весов связей для минимизации ошибок предсказания следующего слова.

Похож ли наш мозг на большие языковые модели?

LLM построены как нейронные сети, но насколько они похожи на нейросетевые модели человеческого мозга? В частности, схоже ли их «мышление» с процессами, которые происходят в нашем мозге? На наш взгляд, мыслительные процессы в LLM в чем-то напоминают человеческие, а в чем-то отличаются.

Начнем с ключевых сходств. Как мы показывали на протяжении всей книги, мышление человека возникает из опыта и опирается на активацию простых вычислительных элементов, связи между этими элементами (сила которых меняется в процессе обучения) и распределенные представления. LLM используют те же базовые принципы. Подобно тому как человеческая мысль возникает как эмерджентное свойство распределенного интерактивного процесса активации в биологической нейронной сети, возможности LLM являются эмерджентным следствием аналогичного процесса в искусственной нейронной сети.

Способности этих моделей выполнять широкий спектр задач эмерджентны в том смысле, что возникают исключительно в результате настройки связей для повышения точности единственной задачи – предсказания следующего слова. При всей простоте и механистичности этого процесса он позволяет моделям реагировать на языковые запросы поразительно человечным образом. Они справляются с множеством задач без специального программирования для каждой из них, часто достигают уровня человеческих когнитивных способностей или превосходят его и демонстрируют характерные для людей успехи и промахи (подробнее об этом в главе 10).

Так что да, «мышление» LLM действительно имеет важные общие черты с человеческим мышлением.

Это наблюдение влечет за собой важные выводы. Оно ставит под сомнение устоявшееся представление о том, что человеческий мозг нуждается в особом, специализированном механизме – некоторые называли его механизмом символьной обработки – для обеспечения наших высших когнитивных способностей. Вместо этого стоит рассмотреть возможность того, что для возникновения продвинутых когнитивных способностей решающее значение имеет сочетание обширного опыта и масштаба – при наличии правильной универсальной архитектуры.

И действительно, по мере увеличения масштаба языковых моделей – с ростом числа блоков трансформеров, количества весов связей в каждом блоке и размера контекстных окон для сохранения предшествующего контекста – они все эффективнее используют растущие объемы обучающих данных и становятся все более искусными. При этом начинают проявляться способности, которых не было при меньших масштабах.

На рисунке 8.3 представлена типичная закономерность, которую демонстрируют модели ИИ при решении различных задач. В таких областях, как арифметика, восстановление слов из перемешанных букв, правильные ответы

1 ... 48 49 50 51 52 53 54 55 56 ... 78
Перейти на страницу:
Похожие на "Рождение разума: Как интеллект зарождается в людях и нейросетях - Джей Макклелланд" книги читать бесплатно полные версии
Отзывы - 0

Прочитали книгу? Предлагаем вам поделится своим впечатлением! Ваш отзыв будет полезен читателям, которые еще только собираются познакомиться с произведением.


Новые отзывы

  1. Тамара01 август 20:50Танец желаний. Дракон в подарок - Ирина АлексееваВолнующая история о девушке-студентке, изучающей боевую магию, и ее декане-драконе. Но слишком красивый и крутой ее однокурсник своим вмешательством чуть не испортил
  2. Тамара31 июль 20:352:5030/Эльф. Нежданный коннект - Станислав МиковЗавораживающая история любви принца из магического мира и питерской девушки, постоянно работающей за компьютером. Принцу просто стало скучно, ведь его мир тысячу лет
  3. Яна29 май 16:31Двойное отцовство - Таня ВолодинаКлассная история! Не похожа ни на одну про отношения МЖМ, которые я читала до этого. Очень приятные харизматичные герои, мастерски написанные характеры главных
  4. Аида06 май 10:49Дикарь королевских кровей. Книга 2. Леди-фаворитка - Анна Сергеевна ГавриловаЧитала легко, местами хоть занудно. Но, это лучше, чем 70% подобной тематики произведений.