Введение

Психологический тест

Тест Салли-Энн — это психологический тест, используемый в психологии развития для оценки способности человека понимать, что другие могут иметь ложные убеждения. Оригинальная разработка теста Салли-Энн была проведена Саймоном Бароном-Коэном, Аланом М. Лесли и Утой Фрит (1985 год); в 1988 году Лесли и Фрит повторили эксперимент с участием людей (вместо кукол) и получили схожие результаты.

Описание испытаний

Для разработки эффективного теста Барон-Коэн и др. модифицировали парадигму кукольной постановки Виммера и Пернера (1983), в которой куклы представляют конкретных персонажей в истории, а не гипотетических персонажей чистого повествования. В процессе тестирования, после знакомства с куклами, ребенку задают контрольный вопрос на запоминание их имен (Вопрос об именах). Затем разыгрывается короткая сценка: Салли берет шарик и прячет его в свою корзину. После этого она "уходит" из комнаты на прогулку. Пока ее нет, Энн перекладывает шарик из корзины Салли в свою коробку. Затем Салли снова появляется, и ребенку задают ключевой вопрос, Вопрос об убеждениях: "Где Салли будет искать свой шарик?". В исследовании Барона-Коэна и др. (1985) 23 из 27 клинически здоровых детей (85%) и 12 из 14 детей с синдромом Дауна (86%) правильно ответили на Вопрос об убеждениях. Однако, только четверо из 20 детей с аутизмом (20%) дали правильный ответ. В целом, дети младше четырех лет, а также большинство детей с аутизмом (старшего возраста), отвечали на Вопрос об убеждениях "в коробке Энн", по-видимому, не осознавая, что Салли не знает о перемещении ее шарика. Ruffman, Garnham и Rideout (2001) дополнительно исследовали связь между тестом Салли-Энн и аутизмом, рассматривая взгляд как социальную коммуникативную функцию. Они добавили третье возможное местонахождение шарика: карман исследователя. При тестировании детей с аутизмом и детей с умеренными нарушениями обучения в таком формате, было обнаружено, что обе группы одинаково хорошо отвечали на Вопрос об убеждениях; однако участники с умеренными нарушениями обучения надежно смотрели на правильное местонахождение шарика, в то время как участники с аутизмом этого не делали, даже если они правильно отвечали на вопрос. Эти результаты могут являться проявлением социальных дефицитов, характерных для аутизма. Tager-Flusberg (2007) отмечает, что, несмотря на эмпирические данные, полученные с помощью задания Салли-Энн, среди ученых растет неопределенность относительно значимости лежащей в его основе теории разума в контексте аутизма. Во всех проведенных исследованиях некоторые дети с аутизмом успешно выполняют задания на ложные убеждения, такие как Салли-Энн.

У других гоминидов

Отслеживание движения глаз шимпанзе, бонобо и орангутанов показывает, что все три вида способны предвидеть ложные убеждения субъекта в костюме Кинг Конга и успешно проходят тест Салли-Энн.

Искусственный интеллект

Исследователи в области искусственного интеллекта и вычислительной когнитивной науки давно пытаются вычислительно смоделировать способность человека рассуждать о (ложных) убеждениях других в задачах, таких как тест Салли-Энн. Для воспроизведения этой способности в компьютерах было предпринято множество подходов, включая нейросетевые модели, распознавание эпистемических планов и байесовскую теорию разума. Эти подходы обычно моделируют агентов как рационально выбирающих действия на основе своих убеждений и желаний, что может быть использовано для предсказания их будущих действий (как в тесте Салли-Энн) или для вывода их текущих убеждений и желаний. В ограниченных условиях эти модели способны воспроизводить поведение, подобное человеческому, при решении задач, аналогичных тесту Салли-Энн, при условии, что задачи представлены в формате, читаемом машиной. 22 марта 2023 года исследовательская группа из Microsoft опубликовала статью, показывающую, что ИИ-система GPT 4, основанная на больших языковых моделях (LLM), может успешно пройти один из вариантов теста Салли-Энн, что авторы интерпретируют как свидетельство "очень высокого уровня теории разума" у GPT 4. Однако обобщаемость этого результата была поставлена под сомнение в нескольких других работах, которые указывают на то, что способность GPT 4 рассуждать об убеждениях других агентов остаётся ограниченной (точность 59% по бенчмарку ToMi) и не является устойчивой к "атакующим" изменениям теста Салли-Энн, с которыми люди справляются гибко. В то время как некоторые авторы утверждают, что производительность GPT 4 в задачах, подобных тесту Салли-Энн, можно повысить до 100% с помощью улучшенных стратегий промптинга, этот подход, по-видимому, улучшает точность лишь до 73% на более крупном наборе данных ToMi и не позволяет надёжно делать градированные выводы о целях других агентов на основе наблюдаемых действий. Таким образом, степень, в которой LLM, такие как GPT 4, способны к социальному рассуждению, остаётся активной областью исследований.