Ойын теориясында ең жақсы жауап стратегиясы және тепе-теңдік жағдайлары
Best response
Ойын теориясында ең жақсы жауап – қарсыластардың стратегиясын ескере отырып, ойыншыға ең тиімді нәтижені беретін стратегия. Nash тепе-теңдігі, координациялық және антикоординациялық ойындар туралы біліңіз.
Ағылшыншамен салыстырыңыз: абзацты басыңыз — түпнұсқа терезеде ашылады. Абзац астындағы EN түймесі оны мәтін ішінде көрсетеді.
Мазмұны
Кіріспе
Ойын теориясында ең жақсы жауап – бұл басқа ойыншылардың стратегияларын өзгермейтін деп есептегенде, ойыншыға ең тиімді нәтижені беретін стратегия (немесе стратегиялар). Ең жақсы жауап тұжырымы Джон Нэштің ең әйгілі жетістігі – Нэш тепе-теңдігінің негізінде жатыр, онда ойынның әрбір ойыншысы басқа ойыншылардың стратегияларына ең жақсы жауапты (немесе ең жақсы жауаптардың бірін) таңдайды.
In game theory, the best response is the strategy (or strategies) which produces the most favorable outcome for a player, taking other players' strategies as given (; ). The concept of a best response is central to John Nash's best known contribution, the Nash equilibrium, the point at which each player in a game has selected the best response (or one of the best responses) to the other players' strategies .
Үйлестіру ойындары
Ойыншылар екі ойыншы да бірдей стратегияны таңдағанда ең жоғары ұпай жинаған, мысалы, бұғы аулау және жыныстар шайқасы сияқты ойындар координациялық ойындар деп аталады. Бұл ойындардың реакция қисықтары 3-суреттегідей болады, онда сол төменгі бұрышта бір Нэш тепе-теңдігі, оң жоғарғы бұрышта тағы бір Нэш тепе-теңдігі және олардың арасындағы диагональ бойында аралас Нэш тепе-теңдігі болады.
Games in which players score highest when both players choose the same strategy, such as the stag hunt and battle of the sexes, are called coordination games. These games have reaction correspondences of the same shape as Figure 3, where there is one Nash equilibrium in the bottom left corner, another in the top right, and a mixing Nash somewhere along the diagonal between the other two.
Үйлестіруге қарсы ойындар
Тоқты мен бүркіт-көгершін ойыны сияқты, ойыншылар қарама-қарсы стратегияларды таңдағанда, яғни, үйлестірілмегенде ең жоғары ұпай жинайтын ойындар антикоординациялық ойындар деп аталады. Олардың реакциялық сәйкестіктері (4-суретте көрсетілген) координациялық ойындарға кері бағытта кесіседі және үш Нэш тепе-теңдігіне ие: біреуі жоғарғы сол, екіншісі төменгі оң бұрышта, онда бір ойыншы бір стратегияны, екіншісі оған қарама-қарсы стратегияны таңдайды. Үшінші Нэш тепе-теңдігі – төменгі сол бұрыштан жоғарғы оң бұрышқа дейінгі диагональ бойында орналасқан аралас стратегия. Егер ойыншылар өзара кім екенін білмесе, аралас Нэш эволюциялық тұрақты стратегия (ESS) болып табылады, себебі ойын төменгі сол бұрыштан жоғарғы оң бұрышқа дейінгі диагональдық сызықпен шектеледі. Әйтпесе, корреляциясыз асимметрия бар деп есептеледі және бұрыштық Нэш тепе-теңдіктері ESS болып табылады.
Games such as the game of chicken and hawk dove game in which players score highest when they choose opposite strategies, i. e., discoordinate, are called anti coordination games. They have reaction correspondences (Figure 4) that cross in the opposite direction to coordination games, with three Nash equilibria, one in each of the top left and bottom right corners, where one player chooses one strategy, the other player chooses the opposite strategy. The third Nash equilibrium is a mixed strategy which lies along the diagonal from the bottom left to top right corners. If the players do not know which one of them is which, then the mixed Nash is an evolutionarily stable strategy (ESS), as play is confined to the bottom left to top right diagonal line. Otherwise an uncorrelated asymmetry is said to exist, and the corner Nash equilibria are ESSes.
Стратегиясы басым ойындар
Доминантты стратегиясы бар ойындардың реакция сәйкестіктері тек бір нүктеде ғана қиылысады, бұл нүкте төменгі сол немесе жоғары оң бұрышта орналасады, егер төлемдер симметриялы 2x2 ойында болса. Мысалы, бір рет ойналатын тұтқынның дилеммасында "Ынтымақтастық" әрекеті қарсыластың ынтымақтастық жасайтын кез келген ықтималдығы үшін оңтайлы емес. 5-суретте мұндай ойынның реакция сәйкестігі көрсетілген, онда өлшемдер "Ынтымақтастыққа ойнау ықтималдығы" болып табылады, ал Нэш тепе-теңдігі төменгі сол бұрышта, егде екі ойыншы да ынтымақтастыққа ойнамайды. Егер өлшемдер "Ақау жасау ықтималдығы" ретінде анықталса, онда екі ойыншының да ең жақсы жауап қисықтары қарсыластың стратегиялық ықтималдығының барлық мәндері үшін 1-ге тең болады және реакция сәйкестіктері жоғарғы оң бұрышта қиылысады (және Нэш тепе-теңдігін құрайды).
Games with dominated strategies have reaction correspondences which only cross at one point, which will be in either the bottom left, or top right corner in payoff symmetric 2x2 games. For instance, in the single play prisoner's dilemma, the "Cooperate" move is not optimal for any probability of opponent Cooperation. Figure 5 shows the reaction correspondence for such a game, where the dimensions are "Probability play Cooperate", the Nash equilibrium is in the lower left corner where neither player plays Cooperate. If the dimensions were defined as "Probability play Defect", then both players best response curves would be 1 for all opponent strategy probabilities and the reaction correspondences would cross (and form a Nash equilibrium) at the top right corner.
Басқа (өнім асимметриясы) ойындар
Төлемдердегі асимметриясы бар 2x2 ойындарда реакция сәйкестіктерінің кеңірек диапазоны мүмкін. Әр ойыншы үшін 6-суретте көрсетілген бес түрлі ең жақсы жауап пішіні бар. Солдан оңға қарай бұл пішіндер: үстемдік стратегиясы (әрқашан 2-ні таңдау), үстемдік стратегиясы (әрқашан 1-ді таңдау), өсу (басқа ойыншының 2-ні таңдау ықтималдығы белгілі бір шектен жоғары болса 2-ні таңдау), төмендеу (басқа ойыншының 2-ні таңдау ықтималдығы белгілі бір шектен жоғары болса 1-ді таңдау) және бейтарап (барлық жағдайларда екі стратегия да бірдей тиімді). Төлемдері симметриялы 2x2 ойындарының тек төрт түрі ғана бар (олардың бірі тривиальды), бірақ әр ойыншы үшін бес түрлі ең жақсы жауап қисығы төлемдері асимметриялы ойын түрлерінің көбірек болуына мүмкіндік береді. Олардың көптегені бір-бірінен нақты айырмашылығы жоқ. Мөлшерлемелерді қайта анықтауға болады (1 және 2 стратегияларының атауларын ауыстыру арқылы) логикалық тұрғыдан бірдей симметриялы ойындар жасау үшін.
A wider range of reaction correspondences shapes is possible in 2x2 games with payoff asymmetries. For each player there are five possible best response shapes, shown in Figure 6. From left to right these are: dominated strategy (always play 2), dominated strategy (always play 1), rising (play strategy 2 if probability that the other player plays 2 is above threshold), falling (play strategy 1 if probability that the other player plays 2 is above threshold), and indifferent (both strategies play equally well under all conditions). While there are only four possible types of payoff symmetric 2x2 games (of which one is trivial), the five different best response curves per player allow for a larger number of payoff asymmetric game types. Many of these are not truly different from each other. The dimensions may be redefined (exchange names of strategies 1 and 2) to produce symmetrical games which are logically identical.
Бiр-бiрiне сәйкес келетін теңгелер
Ассиметриялы төлемдерге ие бір танымал ойын – тең ақша тастау ойыны. Бұл ойында бір ойыншы, қатар ойыншысы – y өлшемінде көрсетілген – егер ойыншылар үйлессе (екеуі де сырға немесе екеуі де құйрық таңдаса) жеңеді, ал екінші ойыншы, баған ойыншысы – x осьінде көрсетілген – егер ойыншылар үйлеспесе жеңеді. Ойыншы Y-нің реакция функциясы үйлестіру ойынына, ал ойыншы X-тің реакция функциясы үйлеспеу ойынына сәйкес келеді. Ұлттық тепе-теңдіктің жалғыз түрі – екі ойыншының да тәуелсіз түрде 0,5 ықтималдығымен сырға және құйрыққа қол қоятын аралас стратегиялардың комбинациясы.
One well known game with payoff asymmetries is the matching pennies game. In this game one player, the row player — graphed on the y dimension — wins if the players coordinate (both choose heads or both choose tails) while the other player, the column player — shown in the x axis — wins if the players discoordinate. Player Y's reaction correspondence is that of a coordination game, while that of player X is a discoordination game. The only Nash equilibrium is the combination of mixed strategies where both players independently choose heads and tails with probability 0.5 each.
Тегістелген
Ең жақсы жауап сәйкестіктерінің орнына кейбір модельдер ең жақсы жауап функцияларын тегістейді. Бұл функциялар ең жақсы жауап сәйкестігіне ұқсас, бірақ функция бір таза стратегиядан екіншісіне "секіріп" өтпейді. Айырмашылық 8-суретте көрсетілген, онда қара түс ең жақсы жауап сәйкестігін, ал қалған түстер әртүрлі тегістелген ең жақсы жауап функцияларын көрсетеді. Стандартты ең жақсы жауап сәйкестіктерінде, тіпті бір әрекеттен алуға болатын ең кішкентай пайда да сол әрекетті 1-ге жуық ықтималдықпен ойнауға себеп болады. Тегістелген ең жақсы жауапта екі әрекет арасындағы айырмашылық азайғанда, ойыншының таңдауы 50:50-ге жақымдасады. Ең жақсы жауап функцияларын тегістеуге болатын көптеген функциялар бар. Мұнда көрсетілген функциялар келесі функцияның бірнеше түрі:
Instead of best response correspondences, some models use smoothed best response functions. These functions are similar to the best response correspondence, except that the function does not "jump" from one pure strategy to another. The difference is illustrated in Figure 8, where black represents the best response correspondence and the other colors each represent different smoothed best response functions. In standard best response correspondences, even the slightest benefit to one action will result in the individual playing that action with probability 1. In smoothed best response as the difference between two actions decreases the individual's play approaches 50:50. There are many functions that represent smoothed best response functions. The functions illustrated here are several variations on the following function:
мұндағы – әрекеттен күтілетін пайданы, ал – функцияның нақты ең жақсы жауаптан қаншалықты ауытқуын анықтайтын параметр ( үлкен болса, ойыншының "қателік" жасау ықтималдығы артады). Ең жақсы жауапты тегістеудің теориялық және эмпирикалық тұрғыдан бірнеше артықшылығы бар. Біріншіден, ол психологиялық эксперименттермен сәйкес келеді: егер адамдар екі әрекеттің арасында шамамен айырмашылықты сезінбесе, олар көбінесе кездейсоқ таңдайды. Екіншіден, ойыншының әрекеті әрқашан нақты анықталады, себебі бұл функция болып табылатын сәйкестік. Соңында, кейбір оқу ережелерімен (мысалы, фиктивті ойын) ең жақсы жауапты тегістеуді қолдану ойыншылардың аралас стратегиядағы Нэш тепе-теңдігін үйренуіне әкелуі мүмкін.
where represents the expected payoff of action , and is a parameter that determines the degree to which the function deviates from the true best response (a larger implies that the player is more likely to make 'mistakes'). There are several advantages to using smoothed best response, both theoretical and empirical. First, it is consistent with psychological experiments; when individuals are roughly indifferent between two actions they appear to choose more or less at random. Second, the play of individuals is uniquely determined in all cases, since it is a correspondence that is also a function. Finally, using smoothed best response with some learning rules (as in Fictitious play) can result in players learning to play mixed strategy Nash equilibria .