Читать книгу - "Рождение разума: Как интеллект зарождается в людях и нейросетях - Джей Макклелланд"
Итак, базовую систему автодополнения можно построить так: взять введенные буквы (например, TS), найти слова с таким началом (tsunami, tsar, tsarina) и выбрать самое частотное как основной вариант (в данном случае tsunami). Это вычислительно посильная задача, поскольку в английском языке всего около 100 000 употребительных слов, и современным компьютерам несложно отслеживать их частотность.
Можно ли применить частотный подход для предсказания следующего слова в предложении, опираясь только на предыдущие слова? Ведь в языке существуют устойчивые частотные паттерны. Если кто-то набрал «Я люблю», то по частотности следующим словом, скорее всего, будет «тебя». Возможно ли построить языковую модель, которая поддерживала бы диалог, основываясь на частотности предложений с определенным началом?
Нет, это невозможно. Ноам Хомский, крупнейший лингвист XX века, указал на суть проблемы: большинство фраз, которые мы встречаем, никогда прежде не были написаны. Нужен подход, выходящий за рамки простого воспроизведения увиденных ранее словесных последовательностей.
Второй подход мог бы опираться на свод правил, управляющих языком. Хомский отстаивал именно такой, основанный на правилах метод. Он утверждал, что все человеческие языки строятся на системах правил, которые базируются на простом наборе фундаментальных принципов. Эти правила, по Хомскому, определяют ключевые компоненты предложений и ограничивают способы их организации. Например, базовое правило английской грамматики гласит, что повествовательное предложение должно состоять из именной группы (скажем, «кошка») и следующей за ней глагольной группы (например, «охотится на мышь»). Другие правила уточняют, что именная группа включает необязательный артикль (слова вроде «a» или «the»), при необходимости одно или несколько прилагательных и существительное. В совокупности такие грамматические правила позволили бы предсказать, что после последовательности «Мальчик прыгнул в…» должно следовать прилагательное или существительное.
Однако здесь возникает проблема: грамматические правила не дают возможности делать точные предсказания. Предпринимались попытки создать более детальные и специфичные системы правил, но все они потерпели неудачу. Такие правила плохо работают, потому что почти у каждого правила есть исключения. Закономерности, которые мы пытаемся зафиксировать правилами, носят скорее вероятностный, чем абсолютный характер, и крайне сложно определить, что делать в ситуациях, когда правила противоречат друг другу. Дэйв Румельхарт стал заниматься моделированием нейронных сетей именно потому, что в начале 1970-х годов не смог заставить работать системы, основанные на правилах.
Итак, ни таблицы поиска с вероятностями последовательностей, ни программы на основе правил не позволили программистам и инженерам создать системы, эффективно предсказывающие следующее слово в контексте. Так что же наделяет этой способностью LLM?
Большая языковая модель – это нейронная сеть, которая обучается методом коррекции ошибок
Современные LLM основаны не на таблицах поиска и не на системах правил, а на нейронных сетях, которые обучаются методом коррекции ошибок. На наш взгляд, такой результат вполне закономерен. В главе 7 мы задавали фиксированные входы (например, «канарейка» или «сосна») и выходы (например, «желтая» или «имеет иголки»), а затем использовали коррекцию ошибок для обучения сети подбирать веса, которые позволяют правильно предсказывать свойства обучающих примеров.
Однако наша текущая задача несколько иная. Мы хотим предсказывать наиболее вероятное следующее слово, а не определять все свойства, которые соответствуют входным данным. Как же нам действовать? Метод коррекции ошибок кажется подходящим, но что использовать в качестве входов и выходов в обучающей выборке?
Джеффри Элман, лингвист и когнитивист из Калифорнийского университета в Сан-Диего, указал путь в своей знаковой статье 1990 г. В одном из экспериментов Элман назначил по одному элементу для представления каждого слова в созданной им базе простых фраз с небольшим словарем из 29 слов. Например, одним из предложений было «Собаки преследуют кошек». И входной, и выходной слои его сети содержали по одному элементу для каждого возможного слова; между ними он поместил один скрытый слой, как показано на рисунке 8.1. Он добавил обучаемые связи от нейронов текущего слова к скрытым нейронам и от скрытых нейронов к выходным, как в сети Румельхарта. При наличии только этих связей сеть могла бы научиться использовать текущее слово для предсказания следующего. Но Элман понял, что этого недостаточно: собаки преследуют кошек, а детективы преследуют преступников – чтобы предсказать слово после «преследуют», необходима информация о предшествующих словах. Для решения этой проблемы он предложил гениальное новшество. После обработки каждого слова он копировал паттерн активации скрытых нейронов в другой набор нейронов, обозначенный на рисунке 8.1 как «Предыдущие скрытые». Затем он добавил обучаемые связи от этих нейронов к скрытым нейронам. Благодаря этому при обработке слова «преследуют» в предложении «Собаки преследуют кошек» текущим словом было бы «преследуют», а паттерн, созданный словом «собаки» на скрытых нейронах, был бы доступен для передачи информации о предшествующем контексте. Это позволило бы сети предсказать «кошек» как следующее слово после «преследуют».
Рисунок 8.1. В сети Элмана для предсказания следующего слова использовались текущее слово и копия предыдущего паттерна активации скрытых элементов. Предсказывая слово после «преследуют» в контексте «собаки», сеть научилась (методом коррекции ошибок) выдавать «кошек»
Чтобы обучить свою сеть, Элман составил набор осмысленных фраз из своего словаря в 29 слов – всего около 70 предложений. Затем он создал длинную последовательность, многократно соединяя эти предложения в случайном порядке. Начав со случайных весов связей, Элман подавал слова по одному. Каждое слово становилось входом, паттерн активации скрытого слоя от предыдущего слова поступал на «Предыдущие скрытые» нейроны, а выходом было предсказание следующего слова.
Пока веса были случайными, модель поначалу не знала, чтó предсказывать. На выходе получался слабый паттерн активации по всем словам – ни одно не выделялось сильной активацией. Но после каждого предсказания модель получала правильное следующее слово как целевое значение, и веса связей корректировались для уменьшения ошибки – разницы между предсказанием и фактическим следующим словом. Например, после слов «Собаки преследуют» в предложении «Собаки преследуют кошек» сеть могла предсказать «кошек» с вероятностью 0,3, а «лошадей» – с вероятностью 0,5. Применяя метод коррекции ошибок, как в главе 7, Элман настраивал все веса так, чтобы сеть сильнее предсказывала правильное слово «кошек» и слабее – все остальные, включая «лошадей». По мере обучения на длинной последовательности случайно упорядоченных фраз сеть училась делать предсказания, которые все точнее отражали закономерности связей между словами в его базе данных.
Статья Элмана вдохновила многих читателей – возможно, благодаря простоте и элегантности его модели.
По сути, тот же процесс используется
Прочитали книгу? Предлагаем вам поделится своим впечатлением! Ваш отзыв будет полезен читателям, которые еще только собираются познакомиться с произведением.
Оставить комментарий
- Тамара01 август 20:50Танец желаний. Дракон в подарок - Ирина АлексееваВолнующая история о девушке-студентке, изучающей боевую магию, и ее декане-драконе. Но слишком красивый и крутой ее однокурсник своим вмешательством чуть не испортил
- Тамара31 июль 20:352:5030/Эльф. Нежданный коннект - Станислав МиковЗавораживающая история любви принца из магического мира и питерской девушки, постоянно работающей за компьютером. Принцу просто стало скучно, ведь его мир тысячу лет
- Яна29 май 16:31Двойное отцовство - Таня ВолодинаКлассная история! Не похожа ни на одну про отношения МЖМ, которые я читала до этого. Очень приятные харизматичные герои, мастерски написанные характеры главных
- Аида06 май 10:49Дикарь королевских кровей. Книга 2. Леди-фаворитка - Анна Сергеевна ГавриловаЧитала легко, местами хоть занудно. Но, это лучше, чем 70% подобной тематики произведений.







