Введение
Когнитивный научный подход
Коннективизм (введённый в обиход Эдвардом Торндайком в 1930-х годах) – это подход к изучению психических процессов человека и познания, использующий математические модели, известные как коннективистские сети или искусственные нейронные сети. С момента своего возникновения коннективизм пережил несколько «волн». Первая волна появилась в 1943 году с работами Уоррена Стерджиса Маккаллоха и Уолтера Питтса, сосредоточенных на понимании нейронных схем посредством формального и математического подхода, а также с публикацией Фрэнком Розенблатом в 1958 году книги «Перцептрон: вероятностная модель хранения и организации информации в мозге» в журнале Psychological Review, когда он работал в Аэронавтической лаборатории Корнелла. Первая волна завершилась выходом в 1969 году книги Марвина Мински и Паперта, описывающей ограничения первоначальной идеи перцептрона, что привело к снижению финансирования коннективистских исследований крупными агентствами в США. С некоторыми заметными исключениями, большинство коннективистских исследований зашли в период застоя до середины 1980-х годов. Термин «коннективистская модель» был вновь введён в начале 1980-х годов в статье по когнитивной науке Джеромом Фельдманом и Даной Баллард. Вторая волна расцвела в конце 1980-х годов после публикации в 1987 году книги «Параллельная распределённая обработка» Джеймса Л. Макклелланда, Дэвида Э. Румелхарта и др., которая внесла несколько улучшений в простую идею перцептрона, таких как промежуточные процессоры (ныне известные как «скрытые слои») наряду с входными и выходными блоками, а также использование сигмоидной функции активации вместо старой функции «всё или ничего». Их работа, в свою очередь, опиралась на работы Джона Хопфилда, ключевой фигуры, исследовавшей математические характеристики сигмоидных функций активации. Теренс Хорган и Тиенсон задались вопросом, представляет ли коннективизм фундаментальный сдвиг в психологии и GOFAI. К недостаткам подхода второй волны относились трудности в понимании того, как АНН обрабатывают информацию и учитывают композиционность ментальных представлений, что затрудняло объяснение явлений на более высоком уровне. Современная (третья) волна характеризуется достижениями в области глубокого обучения, позволившими создать большие языковые модели.
Биологический реализм
Работа в области коннекционизма в целом не требует биологической реалистичности. Одна из областей, где коннекционистские модели считаются биологически несостоятельными, связана с сетями обратного распространения ошибки, необходимыми для обучения, однако обратное распространение ошибки может объяснить некоторые биологически генерируемые электрические активности, регистрируемые на коже головы в связанных с событиями потенциалах, таких как N400 и P600, что предоставляет некоторую биологическую поддержку одному из ключевых предположений коннекционистских процедур обучения. Многие рекуррентные коннекционистские модели также включают теорию динамических систем. Многие исследователи, такие как коннекционист Пол Смоленский, утверждают, что коннекционистские модели будут развиваться в сторону полностью непрерывных, многомерных, нелинейных динамических систем.
Прекурсоры
Предшественники принципов коннекционизма можно проследить в ранних работах по психологии, таких как работы Уильяма Джеймса. Психологические теории, основанные на знаниях о человеческом мозге, были популярны в конце XIX века. Уже в 1869 году невролог Джон Хьюглингс Джексон утверждал о существовании многоуровневых, распределенных систем. Развивая эту идею, «Принципы психологии» Герберта Спенсера, 3-е издание (1872), и «Проект научной психологии» Зигмунда Фрейда (написанный в 1895 году) выдвигали коннекционистские или прото-коннекционистские теории. Эти теории носили преимущественно спекулятивный характер. Однако к началу XX века Эдвард Торндайк проводил эксперименты по обучению, которые постулировали сеть, подобную коннекционистской. Сети Хопфилда имели предшественников в модели Изинга, разработанной Вильгельмом Ленцем (1920) и Эрнстом Изингом (1925), хотя модель Изинга, предложенная ими, не учитывала временной фактор. Для моделирования методом Монте-Карло модели Изинга потребовалось появление компьютеров в 1950-х годах.
Первая волна
Первая волна началась в 1943 году с Уоррена Стерджиса Маккалока и Уолтера Питтса, которые сосредоточились на понимании нейронных цепей с помощью формального и математического подхода, а затем в 1952 году это было расширено в книгу. Машины перцептрона были предложены и построены Фрэнком Розенблатом, который опубликовал в 1958 году статью «Перцептрон: вероятностная модель хранения и организации информации в мозге» в журнале Psychological Review, работая в Корнелльской аэронавтической лаборатории. Он назвал Хебба, Хайека, Уттли и Эшби основными источниками влияния. Другой формой коннекционистской модели была структура реляционных сетей, разработанная лингвистом Сидни Лэмбом в 1960-х годах. Исследовательская группа под руководством Видроу эмпирически искала методы обучения двухслойных сетей ADALINE, но добилась лишь ограниченного успеха. Метод обучения многослойных перцептронов с произвольным количеством обучаемых весов был опубликован Алексеем Григорьевичем Ивахненко и Валентином Лапой в 1965 году и получил название Групповой метод обработки данных. Этот метод использует инкрементное послойное обучение на основе регрессионного анализа, при котором бесполезные нейроны в скрытых слоях удаляются с помощью валидационного набора данных. В 1972 году Шуничи Амари сделал эту архитектуру адаптивной. Работа Шуничи Амари была опубликована в 1967 году. Как они и должны быть способны, если они объясняют человеческую способность выполнять задачи манипулирования символами. Было предложено несколько когнитивных моделей, сочетающих в себе как символическое манипулирование, так и коннекционистские архитектуры. Среди них — Интегрированная коннекционистская/символическая когнитивная архитектура (ICS) Пола Смоленского и CLARION (когнитивная архитектура) Рона Суна. Однако спор сводится к тому, является ли манипулирование символами основой познания в целом, поэтому это не является потенциальным оправданием вычислительного подхода. Тем не менее, вычислительные описания могут быть полезными высокоуровневыми описаниями познания, например, логики. Дебаты в основном касались логических аргументов о том, могут ли коннекционистские сети воспроизводить синтаксическую структуру, наблюдаемую в этом типе рассуждений. Это было достигнуто позднее, хотя и с использованием быстрых возможностей связывания переменных, отличных от тех, которые обычно предполагаются в коннекционистских моделях. Часть привлекательности вычислительных описаний заключается в том, что они относительно легко интерпретируются и, следовательно, могут рассматриваться как способствующие нашему пониманию конкретных психических процессов, в то время как коннекционистские модели в целом более непрозрачны, поскольку их можно описать только в очень общих терминах (например, указание алгоритма обучения, количество нейронов и т. д.) или в неинформативных низкоуровневых терминах. В этом смысле коннекционистские модели могут воплощать и, таким образом, предоставлять доказательства широкой теории познания (т. е. коннекционизма), не представляя собой полезной теории конкретного моделируемого процесса. В этом смысле дискуссию можно рассматривать как отражение, в некоторой степени, простого различия в уровне анализа, на котором сформулированы конкретные теории. Некоторые исследователи предполагают, что разрыв в анализе является следствием того, что коннекционистские механизмы порождают эмерджентные явления, которые могут быть описаны в вычислительных терминах. В 2000-х годах популярность динамических систем в философии сознания добавила новую перспективу в дискуссию; некоторые авторы теперь утверждают, что любое разделение между коннекционизмом и вычислительным подходом более убедительно характеризуется как разделение между вычислительным подходом и динамическими системами. В 2014 году Алекс Грейвс и другие сотрудники DeepMind опубликовали серию статей, описывающих новую структуру глубокой нейронной сети под названием Нейронная машина Тьюринга, способную читать символы на ленте и хранить символы в памяти. Реляционные сети, еще один модуль Deep Network, опубликованный DeepMind, способны создавать объектно-подобные представления и манипулировать ими для ответа на сложные вопросы. Реляционные сети и Нейронные машины Тьюринга являются дополнительным доказательством того, что коннекционизм и вычислительный подход не обязательно должны противоречить друг другу.
Дебаты о символизме и коннексионизме
Субсимволическая парадигма Смоленского должна ответить на вызов Фодора и Пылышина, сформулированный классической теорией символов, для создания убедительной теории познания в современном коннексионизме. Чтобы стать адекватной альтернативной теорией познания, субсимволическая парадигма Смоленского должна объяснить существование систематичности или систематических отношений в когнитивных процессах, связанных с языком, без предположения о том, что когнитивные процессы причинно-следственно зависят от классической конституентной структуры ментальных представлений. Таким образом, субсимволическая парадигма, или коннексионизм в целом, должна объяснить существование систематичности и композиционности, не опираясь на простую реализацию классической когнитивной архитектуры. Этот вызов подразумевает дилемму: если субсимволическая парадигма не вносит никакого вклада в систематичность и композиционность ментальных представлений, она будет недостаточной в качестве основы для альтернативной теории познания. Однако, если вклад субсимволической парадигмы в систематичность требует когнитивных процессов, основанных на классической конституентной структуре ментальных представлений, то разработанная ею теория познания будет, в лучшем случае, архитектурой реализации классической модели теории символов и, следовательно, не являться подлинной альтернативной (коннективистской) теорией познания. Классическая модель символизма характеризуется (1) комбинаторным синтаксисом и семантикой ментальных представлений и (2) ментальными операциями как процессами, чувствительными к структуре, основанными на фундаментальном принципе синтаксической и семантической конституентной структуры ментальных представлений, используемом в "Языке мысли" (LOT) Фодора. Это позволяет объяснить следующие тесно связанные свойства человеческого познания, а именно его (1) продуктивность, (2) систематичность, (3) композиционность и (4) инференциальную согласованность. В современном коннексионизме этот вызов был принят, например, не только в "Интегрированной коннексионистской/символической (ICS) когнитивной архитектуре" Смоленского, но и в "Осцилляторных сетях" Вернинга и Майя. Обзор этого представлен, например, в работах Bechtel & Abrahamsen, Marcus и Maurer.