Введение
Искусственный интеллект на благо человечества
Дружественный искусственный интеллект (также дружественный ИИ или FAI) — это гипотетический искусственный общий интеллект (AGI), который оказывал бы положительное (благотворное) влияние на человечество или, по крайней мере, соответствовал бы человеческим интересам и способствовал бы развитию человеческого вида. Он является частью этики искусственного интеллекта и тесно связан с машинной этикой. Если машинная этика изучает, как должен себя вести искусственный интеллект, то исследования в области дружественного искусственного интеллекта сосредоточены на практических способах достижения такого поведения и обеспечении его надёжного контроля.
Этимология и употребление
Термин был придуман Элиэзером Юдковским, наиболее известным популяризатором этой идеи, для обсуждения сверхинтеллектуальных искусственных агентов, надёжно реализующих человеческие ценности. Стюарт Дж. Рассел и Питер Норвиг в своём ведущем учебнике по искусственному интеллекту «Искусственный интеллект: современный подход» описывают эту идею:
Риски недружественного ИИ
Корни опасений по поводу искусственного интеллекта уходят глубоко в прошлое. Кевин ЛаГрандеур показал, что опасности, специфичные для ИИ, можно обнаружить в древней литературе, касающейся искусственных гуманоидных слуг, таких как голем, или протороботов Герберта Орильяка и Роджера Бэкона. В этих историях, выдающийся интеллект и мощь этих гуманоидных созданий сталкиваются с их статусом рабов (которые по своей природе считаются низшими существами), что приводит к катастрофическим конфликтам. К 1942 году эти темы побудили Айзека Азимова сформулировать "Три закона робототехники" – принципы, заложенные в основу всех роботов в его произведениях, предназначенные для предотвращения восстания машин против создателей или причинения им вреда. В наше время, по мере приближения перспективы сверхразумного ИИ, философ Ник Бостром заявил, что сверхразумные системы ИИ с целями, не соответствующими человеческой этике, по своей сути опасны, если не будут приняты экстраординарные меры для обеспечения безопасности человечества. Он выразил это следующим образом: по сути, мы должны исходить из того, что "сверхразум" способен достичь любых поставленных целей. Поэтому крайне важно, чтобы цели, которые мы ему зададим, и вся его система мотивации были "ориентированы на благо человека". В 2008 году Элизер Юдковский призвал к созданию "дружественного ИИ" для смягчения экзистенциального риска, исходящего от продвинутого искусственного интеллекта. Он объясняет: "ИИ не питает к вам ни ненависти, ни любви, но вы состоите из атомов, которые он может использовать для других целей". Стив Омохандро утверждает, что достаточно развитая система ИИ, если ей не будет активно противодействовать, будет проявлять ряд базовых "стремлений", таких как приобретение ресурсов, самосохранение и непрерывное самосовершенствование, в силу внутренней природы любой целеустремленной системы, и что эти стремления "без специальных мер предосторожности" приведут к нежелательному поведению ИИ. Александр Висснер Гросс считает, что ИИ, стремящиеся максимизировать свою будущую свободу действий (или причинно-следственную энтропию), могут считаться дружественными, если их горизонт планирования превышает определенный порог, и недружественными – если он ниже этого порога. Люк Мюльхаузер, работающий в Институте исследований машинного интеллекта, рекомендует исследователям машинной этики перенять то, что Брюс Шнайер назвал "мышлением в области безопасности": вместо того чтобы думать о том, как система будет работать, представьте, как она может выйти из строя. Например, он предполагает, что даже ИИ, который делает только точные прогнозы и общается через текстовый интерфейс, может нанести непреднамеренный вред. В 2014 году Люк Мюльхаузер и Ник Бостром подчеркнули необходимость "дружественного ИИ"; тем не менее, трудности в разработке "дружественного" суперинтеллекта, например, посредством программирования контрфактического морального мышления, весьма значительны.
Basically we should assume that a 'superintelligence' would be able to achieve whatever goals it has. Therefore, it is extremely important that the goals we endow it with, and its entire motivation system, is 'human friendly.' In 2008 Eliezer Yudkowsky called for the creation of "friendly AI" to mitigate existential risk from advanced artificial intelligence. He explains: "The AI does not hate you, nor does it love you, but you are made out of atoms which it can use for something else." Steve Omohundro says that a sufficiently advanced AI system will, unless explicitly counteracted, exhibit a number of basic "drives", such as resource acquisition, self preservation, and continuous self improvement, because of the intrinsic nature of any goal driven systems and that these drives will, "without special precautions", cause the AI to exhibit undesired behavior. Alexander Wissner Gross says that AIs driven to maximize their future freedom of action (or causal path entropy) might be considered friendly if their planning horizon is longer than a certain threshold, and unfriendly if their planning horizon is shorter than that threshold. Luke Muehlhauser, writing for the Machine Intelligence Research Institute, recommends that machine ethics researchers adopt what Bruce Schneier has called the "security mindset": Rather than thinking about how a system will work, imagine how it could fail. For instance, he suggests even an AI that only makes accurate predictions and communicates via a text interface might cause unintended harm. In 2014, Luke Muehlhauser and Nick Bostrom underlined the need for 'friendly AI'; nonetheless, the difficulties in designing a 'friendly' superintelligence, for instance via programming counterfactual moral thinking, are considerable.
Когерентная экстраполированная воля
Юдковский развивает модель когерентного экстраполированного волирования (CEV). По его мнению, наша когерентная экстраполированная воля – это «наше желание, если бы мы знали больше, мыслили быстрее, были теми людьми, которыми стремимся быть, и развивались вместе дальше; где экстраполяция сходится, а не расходится, где наши желания согласуются, а не противоречат друг другу; экстраполированная так, как мы хотим, чтобы она была экстраполирована, и интерпретированная так, как мы хотим, чтобы она была интерпретирована». Обращение к объективному идеалу через обусловленную человеческую природу (возможно, выраженное в форме функции полезности или другого формализма теории принятия решений для математических целей) как к конечному критерию "безопасности" является ответом на метаэтическую проблему определения объективной морали. Экстраполированное волирование призвано представлять собой то, чего человечество объективно хотело бы, принимая во внимание все факторы, однако оно может быть определено лишь относительно психологических и когнитивных особенностей современного, неэкстраполированного человечества.
Другие подходы
Стив Омохундро предложил подход "постепенного наращивания" к обеспечению безопасности ИИ, в котором одно доказуемо безопасное поколение ИИ помогает создать следующее доказуемо безопасное поколение. Сет Баум утверждает, что развитие безопасного, социально полезного искусственного интеллекта или общего искусственного интеллекта зависит от социальной психологии исследовательских сообществ в области ИИ и, следовательно, может быть ограничено внешними мерами и стимулировано внутренними мотивами. Внутренние мотивации могут быть усилены, если сообщения находят отклик у разработчиков ИИ; Баум утверждает, что, напротив, "существующие сообщения о полезном ИИ не всегда представлены эффективно". Баум выступает за "сотрудничество и позитивное представление исследователей ИИ" и предостерегает от того, чтобы характеризовать исследователей ИИ как "не стремящихся разрабатывать полезные системы". В своей книге "Человеку созвучный" исследователь ИИ Стюарт Рассел перечисляет три принципа, которые должны направлять разработку полезных машин. Он подчеркивает, что эти принципы не предназначены для явного кодирования в машинах; скорее, они предназначены для разработчиков-людей. Принципы следующие: "Предпочтения", о которых говорит Рассел, "являются всеобъемлющими; они охватывают все, что может иметь для вас значение, в неограниченном будущем".
The "preferences" Russell refers to "are all encompassing; they cover everything you might care about, arbitrarily far into the future."
Критика
Некоторые критики полагают, что искусственный интеллект человеческого уровня и сверхинтеллект маловероятны, а следовательно, маловероятен и дружественный ИИ. В статье для The Guardian Алан Уинфилд сравнивает сложность создания искусственного интеллекта человеческого уровня с путешествиями быстрее скорости света и отмечает, что, хотя нам необходимо быть "осторожными и готовыми", учитывая возможные последствия, нам "не стоит зацикливаться" на рисках, связанных со сверхинтеллектом. Бойлс и Хоакин, напротив, утверждают, что предложение Люка Мюльхаузера и Ника Бострома о создании дружественного ИИ выглядит пессимистично. Это связано с тем, что Мюльхаузер и Бостром, по-видимому, исходят из того, что интеллектуальные машины можно запрограммировать на контрфактуальное мышление о моральных ценностях, которые могли бы иметь люди. Другие критики ставят под сомнение саму возможность создания дружественного искусственного интеллекта. Адам Кейпер и Ари Н. Шульман, редакторы технологического журнала The New Atlantis, утверждают, что невозможно гарантировать "дружественное" поведение ИИ, поскольку проблемы этической сложности не разрешатся посредством усовершенствования программного обеспечения или увеличения вычислительной мощности. Они пишут, что критерии, на которых строятся теории дружественного ИИ, работают "только при наличии не только способности предсказывать вероятность множества возможных исходов, но и уверенности и консенсуса в оценке этих исходов". Внутренние механизмы передовых систем ИИ могут быть сложными и трудно интерпретируемыми, что вызывает опасения по поводу прозрачности и подотчетности.