Тест минимального интеллектуального сигнала: количественная оценка интеллекта ИИ.
Minimum intelligent signal test
Тест минимального разумного сигнала (MIST): альтернатива тесту Тьюринга, оценивающая "человечность" ИИ через вопросы с ответами "да/нет". Оптимизация ИИ.
Сравнивайте с английским: нажмите на абзац — оригинал откроется в окне. Кнопка EN под абзацем показывает его прямо в тексте.
Введение
Минимальный тест интеллектуального сигнала, или MIST, является вариацией теста Тьюринга, предложенной Крисом Маккинстри, в котором на вопросы допускаются только булевы ответы (да/нет или истина/ложь). Цель такого теста – получить количественную статистическую меру человечности, которую впоследствии можно использовать для оптимизации работы систем искусственного интеллекта, предназначенных для имитации человеческих ответов. Маккинстри собрал около 80 000 утверждений, на которые можно ответить «да» или «нет», например:
The minimum intelligent signal test, or MIST, is a variation of the Turing test proposed by Chris McKinstry in which only boolean (yes/no or true/false) answers may be given to questions. The purpose of such a test is to provide a quantitative statistical measure of humanness, which may subsequently be used to optimize the performance of artificial intelligence systems intended to imitate human responses. McKinstry gathered approximately 80,000 propositions that could be answered yes or no, e. g.:
Является ли Земля планетой? Был ли Авраам Линкольн когда-либо президентом Соединенных Штатов? Больше ли Солнце моей стопы? Иногда ли люди лгут? Он назвал эти утверждения «мыслепикселями» (Mindpixels). Эти вопросы проверяют как конкретные знания об аспектах культуры, так и базовые факты о значении различных слов и понятий. Таким образом, его можно сравнить с тестом SAT, тестами на интеллект и другими спорными измерениями умственных способностей. Цель Маккинстри заключалась не в том, чтобы различать оттенки интеллекта, а в том, чтобы определить, можно ли вообще считать компьютерную программу интеллектуальной. По мнению Маккинстри, программа, способная значительно превосходить случайный выбор ответов на большом количестве вопросов MIST, будет считаться обладающей определенным уровнем интеллекта и понимания. Например, в тесте из 20 вопросов, если программа будет угадывать ответы случайным образом, можно ожидать, что она в среднем даст 10 правильных ответов. Но вероятность того, что программа случайно угадает все 20 ответов правильно, составляет всего один случай из 220, то есть один случай из 1 048 576; следовательно, если программа сможет поддерживать такой уровень производительности в нескольких независимых испытаниях, без предварительного доступа к утверждениям, её следует считать интеллектуальной.
Is Earth a planet? Was Abraham Lincoln once President of the United States? Is the sun bigger than my foot? Do people sometimes lie? He called these propositions Mindpixels. These questions test both specific knowledge of aspects of culture, and basic facts about the meaning of various words and concepts. It could therefore be compared with the SAT, intelligence testing and other controversial measures of mental ability. McKinstry's aim was not to distinguish between shades of intelligence but to identify whether a computer program could be considered intelligent at all. According to McKinstry, a program able to do much better than chance on a large number of MIST questions would be judged to have some level of intelligence and understanding. For example, on a 20 question test, if a program were guessing the answers at random, it could be expected to score 10 correct on average. But the probability of a program scoring 20 out of 20 correct by guesswork is only one in 220, i. e. one in 1,048,576; so if a program were able to sustain this level of performance over several independent trials, with no prior access to the propositions, it should be considered intelligent.
Обсуждение
Маккинстри раскритиковал существующие подходы к искусственному интеллекту, такие как чат-боты, заявив, что его вопросы могут "вывести из строя" программы ИИ, быстро выявив их слабые места. Он противопоставил свой подход – серию прямых вопросов, оценивающих возможности ИИ, – методу теста Тьюринга и методу премии Лобнера, заключающимся во взаимодействии с ИИ посредством свободной текстовой беседы. Критики MIST отметили, что ИИ в стиле Маккинстри тоже было бы легко "вывести из строя" из-за невозможности обеспечить его правильными ответами на все возможные вопросы типа "да/нет" с помощью конечного набора Mindpixels, созданных человеком. Тот факт, что ИИ может правильно ответить на вопрос "Солнце больше моей ноги?", не означает, что он также сможет правильно ответить на варианты вроде "Солнце больше, чем (моя рука | моя печень | яичный желток | Альфа Центавра А | )". Однако, покойный Маккинстри мог бы возразить, что действительно разумная и обладающая знаниями сущность (сопоставимая с человеком) смогла бы вывести ответы, такие как (да | да | да | не знаю | ), опираясь на свои знания об относительных размерах упомянутых объектов. Иными словами, MIST задумывался как тест для ИИ, а не как предложение по его реализации. Можно также утверждать, что MIST является более объективным тестом интеллекта, чем тест Тьюринга – субъективная оценка, которую некоторые могут считать скорее мерой доверчивости спрашивающего, чем интеллекта машины. Согласно этому аргументу, человеческое суждение в тесте Тьюринга подвержено эффекту ЭЛИЗА – тенденции ошибочно принимать поверхностные признаки интеллекта за реальные, очеловечивая программу. В ответ на это, как предлагалось в эссе Алана Тьюринга "Могут ли машины думать?", можно сказать, что если программа является убедительной имитацией разумного существа, то она, по сути, разумна. Таким образом, спор сводится к тому, что значит для программы обладать "настоящим" интеллектом и по каким признакам его можно определить. Схожие дебаты ведутся вокруг изучения языка у высших приматов, где утверждается, что они освоили некоторые аспекты языка жестов, но значимость этого обучения остаётся спорной.
McKinstry criticized existing approaches to artificial intelligence such as chatterbots, saying that his questions could "kill" AI programs by quickly exposing their weaknesses. He contrasted his approach, a series of direct questions assessing an AI's capabilities, to the Turing test and Loebner Prize method of engaging an AI in undirected typed conversation. Critics of the MIST have noted that it would be easy to "kill" a McKinstry style AI too, due to the impossibility of supplying it with correct answers to all possible yes/no questions by ways of a finite set of human generated Mindpixels: the fact that an AI can answer the question "Is the sun bigger than my foot?" correctly does not mean that it can answer variations like "Is the sun bigger than (my hand | my liver | an egg yolk | Alpha Centauri A | )" correctly, too. However, the late McKinstry might have replied that a truly intelligent, knowledgeable entity (on a par with humans) would be able to work out answers such as (yes | yes | yes | don't know | ) by applying its knowledge of the relative sizes of the objects named. In other words, the MIST was intended as a test of AI, not as a suggestion for implementing AI. It can also be argued that the MIST is a more objective test of intelligence than the Turing test, a subjective assessment that some might consider to be more a measure of the interrogator's gullibility than of the machine's intelligence. According to this argument, a human's judgment of a Turing test is vulnerable to the ELIZA effect, a tendency to mistake superficial signs of intelligence for the real thing, anthropomorphizing the program. The response, suggested by Alan Turing's essay "Can Machines Think? ", is that if a program is a convincing imitation of an intelligent being, it is in fact intelligent. The dispute is thus over what it means for a program to have "real" intelligence, and by what signs it can be detected. A similar debate exists in the controversy over great ape language, in which nonhuman primates are said to have learned some aspects of sign languages but the significance of this learning is disputed.