Введение

Отрасль искусственного интеллекта, направленная на создание систем ИИ, обладающих "здравым смыслом". В искусственном интеллекте (ИИ) здравый смысл — это способность, схожая с человеческой, делать предположения о типе и сущности обыденных ситуаций, с которыми люди сталкиваются ежедневно. Эти предположения включают суждения о природе физических объектов, таксономических свойствах и намерениях людей. Устройство, демонстрирующее здравый смысл, может быть способно делать выводы, аналогичные тем, которые свойственны человеческой "народной психологии" (врожденной способности человека рассуждать о поведении и намерениях других людей) и "наивной физике" (естественному пониманию человеком физического мира).

Проблема логического рассуждения

По сравнению с людьми, существующему ИИ не хватает ряда ключевых аспектов человеческого здравого смысла. Прежде всего, люди обладают развитыми механизмами рассуждения о "наивной физике", включающей понимание пространства, времени и физических взаимодействий. Это позволяет даже маленьким детям легко делать выводы, например: "Если я столкну эту ручку со стола, она упадет на пол". Люди также используют мощный механизм "народной психологии", который помогает им интерпретировать предложения на естественном языке, такие как: "Городские советники отказали демонстрантам в разрешении, потому что те выступали за насилие". (Обычный ИИ испытывает трудности с определением того, кто именно выступал за насилие – советники или демонстранты). Отсутствие этого "общего знания" приводит к тому, что ИИ часто совершает ошибки, отличные от человеческих, которые могут казаться необъяснимыми. Например, современные беспилотные автомобили не способны рассуждать о местоположении и намерениях пешеходов так, как это делают люди, и вынуждены использовать нечеловеческие методы рассуждения, чтобы избежать аварий. К смежным областям здравого смысла относятся понимание количеств и измерений, времени и пространства, физики, психики, общества, планов и целей, а также действий и изменений.

Проблема знаний в области здравого смысла

Проблема знаний здравого смысла – это текущий проект в области искусственного интеллекта, направленный на создание базы данных, содержащей общее знание, которым, как ожидается, обладает большинство людей, представленное в форме, доступной для программ искусственного интеллекта, работающих с естественным языком. В силу широты охвата знаний здравого смысла, эта проблема считается одной из самых сложных в исследованиях в области ИИ. Для выполнения любой задачи на уровне человеческого разума, машина должна демонстрировать интеллект, сопоставимый с человеческим. К таким задачам относятся распознавание объектов, машинный перевод и интеллектуальный анализ текста. Для их решения машине необходимо оперировать теми же понятиями, которые распознает человек, обладающий знаниями здравого смысла.

Здравый смысл в умных задачах

В 1961 году Бар-Хиллель впервые обсудил необходимость и значимость практических знаний для обработки естественного языка в контексте машинного перевода. Некоторые неоднозначности разрешаются с помощью простых и легко усваиваемых правил. Другие требуют широкого понимания окружающего мира, и, следовательно, большего объема знаний здравого смысла. Например, при использовании машины для перевода текста возникают проблемы неоднозначности, которые можно было бы легко разрешить, достигнув конкретного и истинного понимания контекста. Онлайн-переводчики часто разрешают неоднозначности, используя аналогичные или похожие слова. Например, при переводе предложений "Электрик работает" и "Телефон работает" на немецкий язык, машина правильно переводит "работает" как "трудится" в первом предложении и как "функционирует" во втором. Машина, анализируя корпус текстов, обнаружила, что немецкие слова, обозначающие "трудиться" и "электрик", часто используются в сочетании и встречаются рядом друг с другом. То же самое справедливо и для слов "телефон" и "функционирует". Однако статистический подход, работающий в простых случаях, часто оказывается неэффективным в сложных. Существующие компьютерные программы выполняют простые языковые задачи, манипулируя короткими фразами или отдельными словами, но не стремятся к более глубокому пониманию и ориентированы на получение краткосрочных результатов.

Компьютерное зрение

Проблемы такого рода возникают в компьютерном зрении. Например, при просмотре фотографии ванной комнаты некоторые предметы, небольшие и видные лишь частично, такие как полотенца для лица и бутылки, узнаются благодаря окружающим объектам (туалет, раковина, ванна), которые позволяют понять назначение комнаты. На изолированном изображении их было бы трудно идентифицировать. Фильмы представляют собой еще более сложную задачу. Некоторые фильмы содержат сцены и моменты, которые нельзя понять, просто сопоставляя запомненные шаблоны с изображениями. Например, для понимания контекста фильма зрителю необходимо делать выводы о намерениях персонажей и строить предположения, основываясь на их поведении. В современном состоянии техники невозможно создать и управлять программой, способной выполнять такие задачи, как рассуждение, то есть предсказывать действия персонажей. Максимум, что можно сделать, – это распознавать базовые действия и отслеживать персонажей.

Робото-манипуляция

Необходимость и важность здравого смысла для автономных роботов, работающих в неконтролируемой реальной среде, очевидны. Например, если робот запрограммирован выполнять обязанности официанта на коктейльной вечеринке и он видит, что стакан, который он поднял, разбит, робот-официант не должен наливать жидкость в этот стакан, а должен взять другой. Такие задачи кажутся очевидными для человека, обладающего простым здравым смыслом, но обеспечить, чтобы робот избежал подобных ошибок, – сложная задача.

Временные рассуждения

Временное рассуждение — это способность делать выводы о знаниях человека о времени, длительности и временных интервалах. Например, если человек знает, что Моцарт родился после Гайдна и умер раньше него, он может использовать свои знания о временном рассуждении, чтобы заключить, что Моцарт умер в более молодом возрасте, чем Гайдн. Выводы, связанные с этим, сводятся к решению систем линейных неравенств. Интеграция такого рода рассуждений с конкретными задачами, такими как интерпретация естественного языка, представляет собой более сложную проблему, поскольку выражения естественного языка имеют контекстно-зависимую интерпретацию. Даже простые задачи, такие как присвоение временных меток процедурам, не могут быть выполнены с абсолютной точностью.

Качественное рассуждение

Качественное рассуждение – это форма рассуждений здравого смысла, которая успешно анализируется. Оно связано с направлением изменения взаимосвязанных величин. Например, если цена акции растет, то объем акций, выставленных на продажу, уменьшится. Если в экосистеме обитают волки и ягнята, и численность волков сокращается, то смертность ягнят также снизится. Эта теория была впервые сформулирована Йоханом де Клером, который проанализировал движение объекта на американских горках. Теория качественного рассуждения применяется во многих областях, таких как физика, биология, инженерия, экология и другие. Она является основой для многих практических программ, аналогового сопоставления и понимания текста.

Проблемы автоматизации рассуждений здравого смысла

По состоянию на 2014 год существует несколько коммерческих систем, стремящихся придать значимость использованию рассуждений здравого смысла. Однако они используют статистические данные как замену знаний здравого смысла, при этом само рассуждение отсутствует. Современные программы оперируют отдельными словами, но не стремятся и не предлагают более глубокого понимания. По мнению Эрнеста Дэвиса и Гэри Маркуса, пять основных препятствий мешают созданию удовлетворительного "рассуждающего на основе здравого смысла" (или "системы, обладающей здравым смыслом"). Проблема достижения компетентности на уровне человека в задачах, требующих "знаний здравого смысла", вероятно, является "AI-полной" (то есть её решение потребует создания искусственного интеллекта, сопоставимого с человеческим). Некоторые исследователи полагают, что данных, полученных с помощью обучения с учителем, недостаточно для создания искусственного общего интеллекта, способного к рассуждениям здравого смысла, и поэтому перешли к менее контролируемым методам обучения.

Подходы и методы

Исследование рассуждений Commonsense разделено на подходы, основанные на знаниях, и подходы, основанные на машинном обучении с использованием больших объемов данных, при этом взаимодействие между этими двумя типами подходов ограничено. Существуют также подходы, использующие краудсорсинг, которые стремятся создать базу знаний, связывая коллективные знания и вклад неспециалистов. Подходы, основанные на знаниях, можно разделить на подходы, основанные на математической логике.

В подходах, основанных на знаниях, эксперты анализируют характеристики умозаключений, необходимых для рассуждений в определенной области или для конкретной задачи. Подходы, основанные на знаниях, включают математически обоснованные подходы, неформальные подходы, основанные на знаниях, и подходы большого масштаба. Математически обоснованные подходы являются чисто теоретическими, и результатом является научная статья, а не программа. Работа ограничивается областью рассматриваемых доменов и техниками рассуждения, которые в ней отражены. В неформальных подходах, основанных на знаниях, теории рассуждений базируются на анекдотических данных и интуиции, полученных из эмпирической поведенческой психологии. Неформальные подходы распространены в компьютерном программировании. Два других популярных метода извлечения здравого смысла из веб-документов включают веб-майнинг и краудсорсинг. COMET (2019), использующий как архитектуру языковой модели OpenAI GPT, так и существующие базы знаний о здравом смысле, такие как ConceptNet, заявляет о способности генерировать выводы о здравом смысле на уровне, приближающемся к человеческим показателям. Как и многие другие современные разработки, COMET чрезмерно полагается на поверхностные языковые шаблоны и, как считается, не обладает глубоким пониманием многих понятий здравого смысла на уровне человека. Другие подходы к языковому моделированию включают обучение на визуальных сценах, а не только на тексте, и обучение на текстовых описаниях сценариев, связанных с физикой здравого смысла.