Читать книгу - "Рождение разума: Как интеллект зарождается в людях и нейросетях - Джей Макклелланд"
В целом LLM достигают уровня человеческих способностей или даже превосходят его во многих областях, демонстрируя при этом типично человеческие модели успехов и неудач. Эти данные позволяют нам обоснованно заключить: по крайней мере в некоторых отношениях эти машины проявляют мыслительные способности, схожие с человеческими.
Как им это удается? Сейчас, в конце 2024 г., когда мы пишем эти строки, исчерпывающего ответа пока нет. Этот вопрос захватил многих исследователей искусственного интеллекта и специалистов по когнитивным наукам, и далее мы поделимся некоторыми открытиями. Мы обращаемся к этой теме по двум причинам: во-первых, LLM часто напоминают людей своими успехами и провалами, а во-вторых, их работа может принести существенную пользу. Изучая принципы работы этих систем, мы можем узнать больше не только о самих машинах, но и, возможно, о механизмах собственного мышления. Начнем исследование с рассмотрения задачи, на которой обучаются эти системы.
Предсказание следующего слова – основа больших языковых моделей
В основе современных LLM лежит задача, которую часто называют предсказанием следующего слова. Модель использует предшествующие слова в заданном контексте – инструкции пользователя и собственные предыдущие ответы, – чтобы определить, какое слово генерировать дальше. Рассмотрим гипотетический пример: что происходит, когда ChatGPT предсказывает следующее слово после ввода «Мальчик прыгнул в ______».
Языковая модель оценивает вероятности всех возможных слов, которые могут следовать дальше, опираясь на предшествующий контекст. Соотношение нескольких наиболее вероятных вариантов может выглядеть так: воду – 40%; воздух – 20%; бассейн – 12%; озеро – 9%; океан – 5%. В данном примере слово вода имеет наивысшую вероятность – модель считает его наиболее подходящим продолжением в данном контексте. Это выглядит разумно: фрагмент предложения довольно общий, а «вода» – универсальный вариант, подходящий для множества более конкретных ситуаций. И действительно, при более детальном контексте оценки меняются. Для фразы «Приехав в пляжный домик дедушки с бабушкой на побережье, мальчик радостно прыгнул в ______» вероятности могут выглядеть так: океан – 40%; море – 23%; воду – 15%; бассейн – 5%; волны – 5%. Теперь как наиболее вероятное оценивается слово океан.
Затем модель выбирает одно слово для вывода. Ее можно настроить так, чтобы она всегда выбирала слово с наивысшей вероятностью. Но можно также добавить элемент случайности, сохраняя при этом предпочтение словам с более высокими вероятностями. Это обеспечивает разнообразие ответов. Выбрав слово, модель добавляет его к контексту и генерирует вероятности для следующего слова. Затем снова делает выбор на основе этих вероятностей. Процесс продолжается до тех пор, пока модель не выберет специальный маркер конец предложения, не поставит точку и, возможно, не завершит свою реплику.
Хотя на ответы LLM влияют и другие факторы (включая механизм завершения ответа), предсказание следующего слова остается ключевым принципом их работы и основной задачей, для решения которой они обучаются. Специалисты по искусственному интеллекту часто называют модели, обученные предсказывать следующее слово на огромных массивах текстов, фундаментальными. Предсказание следующего слова создает фундамент, на котором модели затем дорабатываются для применения в конкретных случаях.
Посмотрим, что происходит, когда вы просите языковую модель рассказать сказку. Получив вашу инструкцию как контекст, она часто начинает ответ со слова «жили» (за которым следует «–были», а дальше… вы знаете эту формулу). Но не всегда. Иногда история начинается с «В некотором царстве…». Такое разнообразие возникает благодаря элементу случайности в процессе выбора. Важно то, что вы можете направлять модель, задавая контекст и указывая желаемый тип истории. Когда мы попросили ChatGPT сочинить научно-фантастический рассказ, ответ начался с «В недалеком будущем…». Первые несколько сгенерированных слов определили следующее слово, оно, в свою очередь, следующее и т. д. Слово за словом рождалась история.
По сути, LLM можно представить как устройство ввода-вывода: на вход поступают предыдущие слова контекста, на выходе – вероятности следующих слов, из которых выбираются наиболее подходящие варианты.
Принципиально важно: языковая модель – это не хранилище явных фактов. Информация в ней не лежит в таблицах или базах данных, хотя модели можно дополнить такими таблицами или функцией поиска в интернете. Когда вы просите рассказать историю, модель не извлекает готовый рассказ из базы данных. Она создает его на ходу, словно «решая» создать связное повествование определенного жанра, – и делает это, просто генерируя слова на основе предшествующего контекста.
Так же происходит, когда вы просите закончить предложение «Цвет канарейки – …»; модель отвечает «желтый» не потому, что нашла этот факт в базе данных, а потому, что это слово с высочайшей вероятностью следует дальше согласно обучающим данным. Поразительно, насколько универсальными оказались языковые модели и как много они усвоили, всего лишь учась предсказывать следующее слово по контексту. Несмотря на обучение на колоссальных объемах текстов, включая материалы по темам будущих тестов, модели не просто запоминают информацию – они способны создавать оригинальные истории и отвечать на новые вопросы, отсутствовавшие в обучающих данных.
Рассмотрим такой факт: языковая модель способна написать полезную (пусть и не всегда безупречную) компьютерную программу по запросу. Причем запрос может быть совершенно уникальным, не встречавшимся ранее. И все же, обучившись предсказывать следующие слова во множестве программных кодов, модель каким-то образом освоила искусство создания собственных работающих программ. Эти способности можно назвать эмерджентными сразу в нескольких смыслах. Создатели нейросетевых технологий их не предвидели; модели успешно справляются с задачами, которым их никто специально не учил; и эти способности проявляются только при достаточном масштабировании систем (отсюда и определение большие).
Как мы не до конца понимаем механизмы творчества поэта или математического гения, так и принципы работы языковых моделей остаются для нас загадкой. Есть общие представления, но точные механизмы, обеспечивающие способности этих систем, – предмет активных исследований. И сам по себе этот факт примечателен: мы создали машины, внутреннюю работу которых сами до конца не понимаем.
Вероятно, и мы, люди, часто учимся на структурных закономерностях в информации, которую получаем. Наблюдая за речью и письмом других людей – и подсознательно предугадывая их слова и действия – или читая книги, просматривая видео и интуитивно предвосхищая развитие событий, мы тоже развиваем свои когнитивные способности и перенимаем мыслительные паттерны окружающих. Встает вопрос: что за процесс позволяет нам и нашим машинам учиться таким предсказаниям? Как именно это делают люди – сказать трудно, но мы можем изучить подходы, использованные для создания этой способности у машин.
Вычисление вероятностей следующего слова: два гипотетических подхода
Представим, что вы хотите создать программу, предсказывающую окончание слова по уже введенным буквам.
Прочитали книгу? Предлагаем вам поделится своим впечатлением! Ваш отзыв будет полезен читателям, которые еще только собираются познакомиться с произведением.
Оставить комментарий
- Тамара01 август 20:50Танец желаний. Дракон в подарок - Ирина АлексееваВолнующая история о девушке-студентке, изучающей боевую магию, и ее декане-драконе. Но слишком красивый и крутой ее однокурсник своим вмешательством чуть не испортил
- Тамара31 июль 20:352:5030/Эльф. Нежданный коннект - Станислав МиковЗавораживающая история любви принца из магического мира и питерской девушки, постоянно работающей за компьютером. Принцу просто стало скучно, ведь его мир тысячу лет
- Яна29 май 16:31Двойное отцовство - Таня ВолодинаКлассная история! Не похожа ни на одну про отношения МЖМ, которые я читала до этого. Очень приятные харизматичные герои, мастерски написанные характеры главных
- Аида06 май 10:49Дикарь королевских кровей. Книга 2. Леди-фаворитка - Анна Сергеевна ГавриловаЧитала легко, местами хоть занудно. Но, это лучше, чем 70% подобной тематики произведений.







