Введение
Выбор действий - это способ характеристики самой основной проблемы интеллектуальных систем: что делать дальше. В искусственном интеллекте и вычислительной когнитивной науке "проблема выбора действия" обычно связана с интеллектуальными агентами и анимами - искусственными системами, которые проявляют сложное поведение в среде агентов. Термин также иногда используется в этиологии или поведении животных. Одна из проблем понимания выбора действия - определение уровня абстракции, используемого для определения "акта". На самом базовом уровне абстракции, атомный акт может быть чем угодно от сокращения мышечной клетки до провоцирования войны. Обычно для любого механизма выбора действия набор возможных действий предопределен и фиксирован. Большинство исследователей, работающих в этой области, предъявляют высокие требования к своим агентам: действующий агент обычно должен выбирать свое действие в динамичных и непредсказуемых средах. Агенты обычно действуют в режиме реального времени; поэтому они должны принимать решения своевременно. Агент обычно создается для выполнения нескольких различных задач. Эти задачи могут противоречить друг другу в отношении распределения ресурсов (например, может ли сотрудник тушить пожар и одновременно доставить чашку кофе?) Окружающая среда, в которой действуют агенты, может включать людей, которые могут усложнять работу агента (либо намеренно, либо пытаясь помочь). Сами агенты часто предназначены для моделирования животных или людей, а поведение животных/людей довольно сложное. По этим причинам выбор действий не является тривиальным и привлекает много исследований.
The acting agent typically must select its action in dynamic and unpredictable environments. The agents typically act in real time; therefore they must make decisions in a timely fashion. The agents are normally created to perform several different tasks. These tasks may conflict for resource allocation (e. g. can the agent put out a fire and deliver a cup of coffee at the same time?) The environment the agents operate in may include humans, who may make things more difficult for the agent (either intentionally or by attempting to assist.) The agents themselves are often intended to model animals or humans, and animal/human behaviour is quite complicated. For these reasons action selection is not trivial and attracts a good deal of research.
Особенности задачи выбора действия
Основная проблема выбора действий - сложность. Поскольку все вычисления требуют как времени, так и пространства (в памяти), агенты не могут рассматривать каждый доступный им вариант в каждый момент времени. Следовательно, они должны быть предвзятыми и ограничивать свой поиск каким-то образом. Для ИИ вопрос выбора действий заключается в том, какой лучший способ ограничить этот поиск? Для биологии и этиологии вопрос в том, как различные типы животных ограничивают их поиски? Все ли животные используют одинаковые подходы? Почему они используют те, которые они делают? Один из основных вопросов о выборе действия заключается в том, действительно ли это проблема для агента, или это просто описание возникающего свойства поведения интеллектуального агента. Однако, если мы рассмотрим, как мы собираемся построить интеллектуального агента, то становится очевидным, что должен быть какой-то механизм выбора действий. Этот механизм может быть широко распространенным (как в случае распространенных организмов, таких как социальные колонии насекомых или слизистые плесень) или это может быть модуль специального назначения. Механизм выбора действий (ASM) определяет не только действия агента с точки зрения воздействия на мир, но также направляет его восприятие внимания и обновляет его память. Эти эгоцентрические виды действий могут в свою очередь привести к изменению основных поведенческих способностей агента, особенно в том, что обновление памяти предполагает возможность некоторой формы машинного обучения. В идеале сам выбор действий также должен уметь учиться и адаптироваться, но существует много проблем комбинаторной сложности и вычислительной обратимости, которые могут потребовать ограничения пространства поиска для обучения. В ИИ ASM также иногда называют архитектурой агента или рассматривают как существенную часть одной из них.
Механизмы ИИ
В целом, механизмы искусственного выбора действий можно разделить на несколько категорий: системы на основе символов, иногда известные как классическое планирование, распределенные решения и реактивное или динамическое планирование. Некоторые подходы не подходят ни к одной из этих категорий. Другие, на самом деле, больше связаны с предоставлением научных моделей, чем с практическим управлением ИИ; последние из них описаны далее в следующем разделе.
Символические подходы
В начале истории искусственного интеллекта предполагалось, что лучший способ для агента выбрать, что делать дальше, - это вычислить, вероятно, оптимальный план, а затем выполнить этот план. Это привело к гипотезе физической системы символов, что физический агент, который может манипулировать символами, необходим и достаточен для интеллекта. Многие программные агенты до сих пор используют этот подход для выбора действий. Обычно требуется описать все показания датчиков, мир, все действия и все цели в некоторой форме предикатной логики. Критики этого подхода жалуются, что он слишком медленный для планирования в реальном времени и что, несмотря на доказательства, он все еще вряд ли даст оптимальные планы, потому что сведение описаний реальности к логике является процессом, склонным к ошибкам. Удовлетворительность - это стратегия принятия решений, которая пытается соответствовать критериям адекватности, а не определять оптимальное решение. Удовлетворительная стратегия часто может быть (почти) оптимальной, если затраты самого процесса принятия решений, такие как затраты на получение полной информации, учитываются в исходном расчете. Архитектура, основанная на цели В этих символических архитектурах поведение агента обычно описывается набором целей. Каждая цель может быть достигнута путем процесса или деятельности, которые описаны в предписанном плане. Агент должен просто решить, какой процесс следует использовать для достижения данной цели. План может быть расширен до подцелей, что делает процесс немного рекурсивным. Технически, более или менее, планы используют правила состояния. Эти архитектуры реактивны или гибридны. Классические примеры целеустремленной архитектуры - это реализуемые усовершенствования архитектуры намерений желания убеждений, такие как JAM или IVE.
Теории выбора действий в природе
Многие динамические модели искусственного отбора действий были первоначально вдохновлены исследованиями в области этиологии. В частности, Конрад Лоренц и Николас Тинберген представили идею врожденного механизма высвобождения для объяснения инстинктивного поведения (фиксированных моделей действий). Под влиянием идей Уильяма Макдугала Лоренц разработал "психогидравлическую" модель мотивации поведения. В этиологии эти идеи были влиятельными в 1960-х годах, но теперь они считаются устаревшими из-за использования ими метафоры потока энергии; нервная система и контроль поведения теперь обычно рассматриваются как связаны с передачей информации, а не с потоком энергии. Динамические планы и нейронные сети больше похожи на передачу информации, в то время как распространение активации больше похоже на диффузный контроль эмоциональных / гормональных систем. Стэн Франклин предложил, что выбор действий - это правильная перспектива для понимания роли и эволюции ума. Смотрите его страницу о парадигме выбора действий.
Модели искусственного интеллекта отбора нейронных действий
Некоторые исследователи создают сложные модели нейронного отбора действий. См. например: Лаборатория вычислительной когнитивной нейробиологии (CU Boulder). Исследовательская группа по адаптивному поведению (Шеффилд).
The Computational Cognitive Neuroscience Lab (CU Boulder). The Adaptive Behaviour Research Group (Sheffield).
Катехоламинергический нейрон электронный транспорт (CNET)
Локус-коэрулеус (LC) является одним из основных источников норадреналина в мозге и связан с выбором когнитивных процессов, таких как внимание и поведенческие задачи. Substantia nigra pars compacta (SNc) является одним из основных источников дофамина в мозге и связан с селекцией действий, в основном как часть базальных ганглий. CNET - это гипотетический механизм нейронной сигнализации в SNc и LC (которые являются катехоламинергическими нейронами), который может помочь в выборе действия путем маршрутизации энергии между нейронами в каждой группе в рамках выбора действия, чтобы помочь одному или нескольким нейронам в каждой группе достичь потенциала действия. Впервые он был предложен в 2018 году и основан на ряде физических параметров этих нейронов, которые можно разбить на три основных компонента: 1) Ферритин и нейромеланин присутствуют в высоких концентрациях в этих нейронах, но в 2018 году было неизвестно, образуют ли они структуры, способные передавать электроны на относительно длинные расстояния в масштабе микрон между крупнейшими из этих нейронов, что ранее не было предложено или наблюдаемо. Эти структуры также должны были бы обеспечивать функцию маршрутизации или коммутации, которая также не была предложенной или наблюдаемой ранее. Впоследствии были получены доказательства наличия структур ферритина и нейромеланина в этих нейронах и их способности как проводить электроны последовательным туннелированием, так и маршрутизировать / переключать путь нейронов. 2)) Известно, что аксоны больших нейронов SNc имеют обширные арборы, но неизвестно, повысит ли постсинаптическая активность в синапсах этих аксонов мембранный потенциал этих нейронов достаточно, чтобы электроны были направлены к нейрону или нейронам с наибольшей постсинаптической активностью для целей отбора действия. В то время преобладающее объяснение цели этих нейронов заключалось в том, что они не посредничают в выборе действий и являются только модуляторными и неспецифическими. Паскаль Казер из Гарвардской медицинской школы впоследствии получил доказательства того, что большие нейроны SNc могут быть временно и пространственно специфичными и опосредовывать выбор действий. Другие данные указывают на то, что большие аксоны ЛК имеют схожее поведение. 3) Несколько источников электронов или экситонов для обеспечения энергии для механизма были выдвинуты в 2018 году, но в то время не были обнаружены. Диокситановый расщепление (которое может происходить во время соматического метаболизма дофамина путем деградации меланина хиноном) было одновременно предложено для генерации высокоэнергетических электронов тройного состояния профессором Дагом Брэшем в Йельском университете, что могло бы обеспечить источник электронов для механизма CNET. Хотя таким образом были получены доказательства ряда физических предсказаний гипотезы CNET, доказательств правильности самой гипотезы не искали. Один из способов попытаться определить, присутствует ли механизм CNET в этих нейронах, - использовать квантовые точечные флюорофоры и оптические зонды для определения того, происходит ли туннелирование электронов, связанное с ферритином в нейронах, в связи с конкретными действиями.
1) Ferritin and neuromelanin are present in high concentrations in those neurons, but it was unknown in 2018 whether they formed structures that would be capable of transmitting electrons over relatively long distances on the scale of microns between the largest of those neurons, which had not been previously proposed or observed. Those structures would also need to provide a routing or switching function, which had also not previously been proposed or observed. Evidence of the presence of ferritin and neuromelanin structures in those neurons and their ability to both conduct electrons by sequential tunneling and to route/switch the path of the neurons was subsequently obtained. 2) ) The axons of large SNc neurons were known to have extensive arbors, but it was unknown whether post synaptic activity at the synapses of those axons would raise the membrane potential of those neurons sufficiently to cause the electrons to be routed to the neuron or neurons with the most post synaptic activity for the purpose of action selection. At the time, prevailing explanations of the purpose of those neurons was that they did not mediate action selection and were only modulatory and non specific. Prof. Pascal Kaeser of Harvard Medical School subsequently obtained evidence that large SNc neurons can be temporally and spatially specific and mediate action selection. Other evidence indicates that the large LC axons have similar behavior. 3) Several sources of electrons or excitons to provide the energy for the mechanism were hypothesized in 2018 but had not been observed at that time. Dioxetane cleavage (which can occur during somatic dopamine metabolism by quinone degradation of melanin) was contemporaneously proposed to generate high energy triplet state electrons by Prof. Doug Brash at Yale, which could provide a source for electrons for the CNET mechanism. While evidence of a number of physical predictions of the CNET hypothesis has thus been obtained, evidence of whether the hypothesis itself is correct has not been sought. One way to try to determine whether the CNET mechanism is present in these neurons would be to use quantum dot fluorophores and optical probes to determine whether electron tunneling associated with ferritin in the neurons is occurring in association with specific actions.