Введение

Выбор действий - это способ характеристики самой основной проблемы интеллектуальных систем: что делать дальше. В искусственном интеллекте и вычислительной когнитивной науке "проблема выбора действия" обычно связана с интеллектуальными агентами и анимами - искусственными системами, которые проявляют сложное поведение в среде агентов. Термин также иногда используется в этиологии или поведении животных. Одна из проблем понимания выбора действия - определение уровня абстракции, используемого для определения "акта". На самом базовом уровне абстракции, атомный акт может быть чем угодно от сокращения мышечной клетки до провоцирования войны. Обычно для любого механизма выбора действия набор возможных действий предопределен и фиксирован. Большинство исследователей, работающих в этой области, предъявляют высокие требования к своим агентам: действующий агент обычно должен выбирать свое действие в динамичных и непредсказуемых средах. Агенты обычно действуют в режиме реального времени; поэтому они должны принимать решения своевременно. Агент обычно создается для выполнения нескольких различных задач. Эти задачи могут противоречить друг другу в отношении распределения ресурсов (например, может ли сотрудник тушить пожар и одновременно доставить чашку кофе?) Окружающая среда, в которой действуют агенты, может включать людей, которые могут усложнять работу агента (либо намеренно, либо пытаясь помочь). Сами агенты часто предназначены для моделирования животных или людей, а поведение животных/людей довольно сложное. По этим причинам выбор действий не является тривиальным и привлекает много исследований.

Особенности задачи выбора действия

Основная проблема выбора действий - сложность. Поскольку все вычисления требуют как времени, так и пространства (в памяти), агенты не могут рассматривать каждый доступный им вариант в каждый момент времени. Следовательно, они должны быть предвзятыми и ограничивать свой поиск каким-то образом. Для ИИ вопрос выбора действий заключается в том, какой лучший способ ограничить этот поиск? Для биологии и этиологии вопрос в том, как различные типы животных ограничивают их поиски? Все ли животные используют одинаковые подходы? Почему они используют те, которые они делают? Один из основных вопросов о выборе действия заключается в том, действительно ли это проблема для агента, или это просто описание возникающего свойства поведения интеллектуального агента. Однако, если мы рассмотрим, как мы собираемся построить интеллектуального агента, то становится очевидным, что должен быть какой-то механизм выбора действий. Этот механизм может быть широко распространенным (как в случае распространенных организмов, таких как социальные колонии насекомых или слизистые плесень) или это может быть модуль специального назначения. Механизм выбора действий (ASM) определяет не только действия агента с точки зрения воздействия на мир, но также направляет его восприятие внимания и обновляет его память. Эти эгоцентрические виды действий могут в свою очередь привести к изменению основных поведенческих способностей агента, особенно в том, что обновление памяти предполагает возможность некоторой формы машинного обучения. В идеале сам выбор действий также должен уметь учиться и адаптироваться, но существует много проблем комбинаторной сложности и вычислительной обратимости, которые могут потребовать ограничения пространства поиска для обучения. В ИИ ASM также иногда называют архитектурой агента или рассматривают как существенную часть одной из них.

Механизмы ИИ

В целом, механизмы искусственного выбора действий можно разделить на несколько категорий: системы на основе символов, иногда известные как классическое планирование, распределенные решения и реактивное или динамическое планирование. Некоторые подходы не подходят ни к одной из этих категорий. Другие, на самом деле, больше связаны с предоставлением научных моделей, чем с практическим управлением ИИ; последние из них описаны далее в следующем разделе.

Символические подходы

В начале истории искусственного интеллекта предполагалось, что лучший способ для агента выбрать, что делать дальше, - это вычислить, вероятно, оптимальный план, а затем выполнить этот план. Это привело к гипотезе физической системы символов, что физический агент, который может манипулировать символами, необходим и достаточен для интеллекта. Многие программные агенты до сих пор используют этот подход для выбора действий. Обычно требуется описать все показания датчиков, мир, все действия и все цели в некоторой форме предикатной логики. Критики этого подхода жалуются, что он слишком медленный для планирования в реальном времени и что, несмотря на доказательства, он все еще вряд ли даст оптимальные планы, потому что сведение описаний реальности к логике является процессом, склонным к ошибкам. Удовлетворительность - это стратегия принятия решений, которая пытается соответствовать критериям адекватности, а не определять оптимальное решение. Удовлетворительная стратегия часто может быть (почти) оптимальной, если затраты самого процесса принятия решений, такие как затраты на получение полной информации, учитываются в исходном расчете. Архитектура, основанная на цели В этих символических архитектурах поведение агента обычно описывается набором целей. Каждая цель может быть достигнута путем процесса или деятельности, которые описаны в предписанном плане. Агент должен просто решить, какой процесс следует использовать для достижения данной цели. План может быть расширен до подцелей, что делает процесс немного рекурсивным. Технически, более или менее, планы используют правила состояния. Эти архитектуры реактивны или гибридны. Классические примеры целеустремленной архитектуры - это реализуемые усовершенствования архитектуры намерений желания убеждений, такие как JAM или IVE.

Теории выбора действий в природе

Многие динамические модели искусственного отбора действий были первоначально вдохновлены исследованиями в области этиологии. В частности, Конрад Лоренц и Николас Тинберген представили идею врожденного механизма высвобождения для объяснения инстинктивного поведения (фиксированных моделей действий). Под влиянием идей Уильяма Макдугала Лоренц разработал "психогидравлическую" модель мотивации поведения. В этиологии эти идеи были влиятельными в 1960-х годах, но теперь они считаются устаревшими из-за использования ими метафоры потока энергии; нервная система и контроль поведения теперь обычно рассматриваются как связаны с передачей информации, а не с потоком энергии. Динамические планы и нейронные сети больше похожи на передачу информации, в то время как распространение активации больше похоже на диффузный контроль эмоциональных / гормональных систем. Стэн Франклин предложил, что выбор действий - это правильная перспектива для понимания роли и эволюции ума. Смотрите его страницу о парадигме выбора действий.

Модели искусственного интеллекта отбора нейронных действий

Некоторые исследователи создают сложные модели нейронного отбора действий. См. например: Лаборатория вычислительной когнитивной нейробиологии (CU Boulder). Исследовательская группа по адаптивному поведению (Шеффилд).

Катехоламинергический нейрон электронный транспорт (CNET)

Локус-коэрулеус (LC) является одним из основных источников норадреналина в мозге и связан с выбором когнитивных процессов, таких как внимание и поведенческие задачи. Substantia nigra pars compacta (SNc) является одним из основных источников дофамина в мозге и связан с селекцией действий, в основном как часть базальных ганглий. CNET - это гипотетический механизм нейронной сигнализации в SNc и LC (которые являются катехоламинергическими нейронами), который может помочь в выборе действия путем маршрутизации энергии между нейронами в каждой группе в рамках выбора действия, чтобы помочь одному или нескольким нейронам в каждой группе достичь потенциала действия. Впервые он был предложен в 2018 году и основан на ряде физических параметров этих нейронов, которые можно разбить на три основных компонента: 1) Ферритин и нейромеланин присутствуют в высоких концентрациях в этих нейронах, но в 2018 году было неизвестно, образуют ли они структуры, способные передавать электроны на относительно длинные расстояния в масштабе микрон между крупнейшими из этих нейронов, что ранее не было предложено или наблюдаемо. Эти структуры также должны были бы обеспечивать функцию маршрутизации или коммутации, которая также не была предложенной или наблюдаемой ранее. Впоследствии были получены доказательства наличия структур ферритина и нейромеланина в этих нейронах и их способности как проводить электроны последовательным туннелированием, так и маршрутизировать / переключать путь нейронов. 2)) Известно, что аксоны больших нейронов SNc имеют обширные арборы, но неизвестно, повысит ли постсинаптическая активность в синапсах этих аксонов мембранный потенциал этих нейронов достаточно, чтобы электроны были направлены к нейрону или нейронам с наибольшей постсинаптической активностью для целей отбора действия. В то время преобладающее объяснение цели этих нейронов заключалось в том, что они не посредничают в выборе действий и являются только модуляторными и неспецифическими. Паскаль Казер из Гарвардской медицинской школы впоследствии получил доказательства того, что большие нейроны SNc могут быть временно и пространственно специфичными и опосредовывать выбор действий. Другие данные указывают на то, что большие аксоны ЛК имеют схожее поведение. 3) Несколько источников электронов или экситонов для обеспечения энергии для механизма были выдвинуты в 2018 году, но в то время не были обнаружены. Диокситановый расщепление (которое может происходить во время соматического метаболизма дофамина путем деградации меланина хиноном) было одновременно предложено для генерации высокоэнергетических электронов тройного состояния профессором Дагом Брэшем в Йельском университете, что могло бы обеспечить источник электронов для механизма CNET. Хотя таким образом были получены доказательства ряда физических предсказаний гипотезы CNET, доказательств правильности самой гипотезы не искали. Один из способов попытаться определить, присутствует ли механизм CNET в этих нейронах, - использовать квантовые точечные флюорофоры и оптические зонды для определения того, происходит ли туннелирование электронов, связанное с ферритином в нейронах, в связи с конкретными действиями.