Читать книгу - "Рождение разума: Как интеллект зарождается в людях и нейросетях - Джей Макклелланд"
Для эффективной генерации качественных ответов LLM должна обладать двумя ключевыми способностями. Во-первых, она должна улавливать сходства и различия в предсказаниях для слов с близкими значениями. Рассмотрим входные последовательности «Канарейка увидела приближающегося кота и…» и «Малиновка увидела приближающегося кота и…». Хотелось бы, чтобы наша модель использовала тот факт, что слова «канарейка» и «малиновка» обозначают похожих существ, и генерировала схожее предсказание – в обоих случаях вероятно «улетела». И наоборот, если заменить «канарейку» на слово, обозначающее менее схожее существо – скажем, «мышь» или «орел», – модель должна скорректировать предсказания: для мыши более вероятно «убежала», а для орла – «напал на кота».
Во-вторых, для получения наилучших предсказаний необходима информация, выходящая далеко за рамки нескольких предшествующих слов. Рассмотрим следующий текст:
[ПРОБЕЛ] стремительно [ПРОБЕЛ] по [ПРОБЕЛ], [ПРОБЕЛ] сверкали на свету. Точными [ПРОБЕЛ] [ПРОБЕЛ] [ПРОБЕЛ] цель, оставляя за собой след из [ПРОБЕЛ]. Зрители [ПРОБЕЛ] от изумления, поскольку никогда прежде не видели подобного проявления [ПРОБЕЛ].
Если первый пробел заполнить словом «фигуристка», остальной текст может выглядеть так:
Фигуристка стремительно скользила по льду, лезвия сверкали на свету. Точными пируэтами она обогнула цель, оставляя за собой след изморози. Зрители ахнули от изумления, поскольку никогда прежде не видели подобного проявления грации.
Если же вставить слово «акула», пробелы заполнятся совершенно иначе:
Акула стремительно неслась по воде, зубы сверкали на свету. Точными движениями она атаковала цель, оставляя за собой след из крови. Зрители закричали от изумления, поскольку никогда прежде не видели подобного проявления свирепости.
Способность использовать паттерны для передачи смысла и способность учитывать расширенный контекст – важнейшие характеристики LLM. В следующих двух разделах мы опишем, как модели приобретают эти способности.
Паттерны активации передают значение слов в больших языковых моделях
Как мы видели в главе 7, паттерны активации нейроноподобных элементов способны отражать отношения сходства между значениями слов. LLM используют именно такие паттерны – исследователи ИИ называют их эмбеддингами, или векторными представлениями, – подобные тем, которые мы рассматривали для цветов, деревьев, птиц и рыб в главе 7. Стоит отметить, что в языковых моделях паттерны распределены по сотням и даже тысячам элементов, а не по восьми, как в моделях из главы 7. Как мы уже знаем, паттерны слов со схожими значениями должны быть похожи, но не идентичны. Это позволяет отражать как сходства, так и различия в значениях. Например, на рисунке 7.6 мы видели, что паттерны для малиновки и канарейки очень похожи в целом, тогда как паттерны для канарейки и сосны сильно различаются. В эмбеддингах языковых моделей информация о таких явно именуемых признаках распределена по множеству элементов представления – точно так же, как информация о различии в окраске малиновки и канарейки была распределена по всем скрытым элементам модели Румельхарта в главе 7. Возможно, вы спросите: что же заставляет паттерны слов со схожими значениями быть похожими в языковой модели? Никто специально эти паттерны не проектирует. Паттерн, представляющий значение конкретного слова, формируется в процессе обучения, когда сеть корректирует веса связей для предсказания окружающих слов в контексте. Некоторые лингвисты утверждают, что значение слова по своей природе зависит от контекста. Как сказал знаменитый английский лингвист Джон Руперт Ферс: «Слово познается по его окружению».
По этой логике нейросетевая модель совершенствует свои предсказания, исправляя ошибки при предсказании слов в окружающем контексте. В ходе этого процесса формируются представления, основанные на сходстве: слова с близкими значениями порождают схожие предсказания и сами появляются в схожих контекстах. Возьмем, к примеру, слово малиновка – после него могут идти фразы имеет крылья, покрыта перьями и умеет летать. То же самое справедливо для канареек и множества других птиц.
Вот что важно: близость значений проявляется через сходство контекстов употребления слов, а представления в языковых моделях, которые улавливают эту смысловую близость, формируются именно благодаря сходству предсказаний. Такой подход эффективен, поскольку слова со схожими представлениями порождают схожие предсказания в новых контекстах. Это позволяет переносить знания о предсказаниях одного слова на другие слова с близкими значениями.
Мы снова наблюдаем процесс, аналогичный описанному в главе 7. Там мы обучали сеть формировать распределенные представления различных объектов, напрямую предсказывая их явно именуемые свойства – наличие перьев или способность плавать. В результате объекты, имевшие много общих именуемых свойств, получали схожие распределенные представления. В LLM происходит нечто подобное. Формируемые в процессе обучения распределенные представления отражают сходство предсказаний для разных слов, а значит, и сходство их значений.
Подведем итог: представления в LLM оказываются схожими для объектов, которые встречаются в схожих контекстах и порождают схожие предсказания. Эти контексты и предсказания указывают, помимо прочего, на объекты с общими именуемыми свойствами – что и составляет важную часть того, что мы называем сходством значений.
Как мы учитываем контекст: внимание – это все, что нужно
Итак, мы выяснили, что LLM присваивают схожие представления словам с близкими значениями, что помогает делать более точные предсказания. Однако остается вопрос: как модели эффективно используют контекст? Ведь у слов нет жестко закрепленных значений – многие из них обладают двумя и более совершенно различными смыслами. Вспомним слово ключ – это может быть и ключ от замка, и источник воды. Совершенно разные вещи, которые требуют принципиально разных предсказаний следующего слова. Как же использовать контекст предшествующих слов, чтобы определить нужное значение, а затем на основе этого сделать точное предсказание?
Приведем пример. Мы попросили ChatGPT предсказать следующее слово в предложении «Путник шел по лесу и увидел ключ, бьющий из земли. Он был очень ________». Модель ответила: холодным – именно так ответили бы и многие люди. Чтобы прийти к слову холодный, ChatGPT должен был понять, что в данном контексте ключ означает источник, а также определить, что в описанной ситуации он, скорее всего, будет холодным. Как построить систему, способную на такое? Модель Элмана и ее многочисленные последователи опробовали один подход: сохранять копию паттерна активации, возникающего при обработке предыдущих слов, и обучать модель использовать информацию из этого паттерна через настройку весов соединений. Подход принес определенные успехи, но натолкнулся на ограничение: один паттерн может вместить лишь ограниченный объем контекстной информации. Механизм внимания, о котором пойдет речь ниже, позволяет современным моделям преодолеть это препятствие.
Вернемся к слову ключ в нашей фразе. Было бы полезно сохранить информацию обо всех предшествующих словах, чтобы найти среди
Прочитали книгу? Предлагаем вам поделится своим впечатлением! Ваш отзыв будет полезен читателям, которые еще только собираются познакомиться с произведением.
Оставить комментарий
- Тамара01 август 20:50Танец желаний. Дракон в подарок - Ирина АлексееваВолнующая история о девушке-студентке, изучающей боевую магию, и ее декане-драконе. Но слишком красивый и крутой ее однокурсник своим вмешательством чуть не испортил
- Тамара31 июль 20:352:5030/Эльф. Нежданный коннект - Станислав МиковЗавораживающая история любви принца из магического мира и питерской девушки, постоянно работающей за компьютером. Принцу просто стало скучно, ведь его мир тысячу лет
- Яна29 май 16:31Двойное отцовство - Таня ВолодинаКлассная история! Не похожа ни на одну про отношения МЖМ, которые я читала до этого. Очень приятные харизматичные герои, мастерски написанные характеры главных
- Аида06 май 10:49Дикарь королевских кровей. Книга 2. Леди-фаворитка - Анна Сергеевна ГавриловаЧитала легко, местами хоть занудно. Но, это лучше, чем 70% подобной тематики произведений.







