Принцип максимальной энтропии в байесовской статистике
Principle of maximum entropy
Принцип максимальной энтропии в байесовской статистике: выбор вероятностного распределения с наибольшей энтропией при известных данных. Основы и применение.
Сравнивайте с английским: нажмите на абзац — оригинал откроется в окне. Кнопка EN под абзацем показывает его прямо в тексте.
Содержание
Введение
Принцип в байесовской статистике
Principle in Bayesian statistics
Принцип максимальной энтропии утверждает, что распределение вероятностей, наилучшим образом отражающее текущее состояние знаний о системе, – это распределение с наибольшей энтропией, при условии точно заданных априорных данных (например, утверждения, выражающего проверяемую информацию). Другими словами: возьмите точно заданные априорные данные или проверяемую информацию о функции распределения вероятностей. Рассмотрите множество всех возможных распределений вероятностей, удовлетворяющих этим априорным данным. Согласно этому принципу, распределение с максимальной информационной энтропией является оптимальным выбором.
The principle of maximum entropy states that the probability distribution which best represents the current state of knowledge about a system is the one with largest entropy, in the context of precisely stated prior data (such as a proposition that expresses testable information). Another way of stating this: Take precisely stated prior data or testable information about a probability distribution function. Consider the set of all trial probability distributions that would encode the prior data. According to this principle, the distribution with maximal information entropy is the best choice.
История
Принцип был впервые сформулирован Э. Т. Джейнсом в двух статьях 1957 года, где он подчеркнул естественную взаимосвязь между статистической механикой и теорией информации. В частности, Джейнс предложил новое и весьма общее обоснование того, почему работает гиббсовский метод статистической механики. Он утверждал, что энтропия статистической механики и информационная энтропия теории информации по сути являются одним и тем же. Следовательно, статистическую механику следует рассматривать как частное применение общего инструмента логического вывода и теории информации.
The principle was first expounded by E. T. Jaynes in two papers in 1957 where he emphasized a natural correspondence between statistical mechanics and information theory. In particular, Jaynes offered a new and very general rationale why the Gibbsian method of statistical mechanics works. He argued that the entropy of statistical mechanics and the information entropy of information theory are basically the same thing. Consequently, statistical mechanics should be seen just as a particular application of a general tool of logical inference and information theory.
Обзор
В большинстве практических случаев заданные априорные данные или проверяемая информация представляются набором сохраняющихся величин (средние значения некоторых моментных функций), связанных с рассматриваемым распределением вероятностей. Именно так принцип максимальной энтропии наиболее часто используется в статистической термодинамике. Другая возможность – задать некоторые симметрии распределения вероятностей. Эквивалентность между сохраняющимися величинами и соответствующими группами симметрий подразумевает аналогичную эквивалентность для этих двух способов задания проверяемой информации в методе максимальной энтропии. Принцип максимальной энтропии также необходим для обеспечения уникальности и непротиворечивости вероятностных оценок, полученных различными методами, в частности статистической механикой и логическим выводом. Принцип максимальной энтропии явно отражает нашу свободу в использовании различных форм априорных данных. В качестве частного случая может быть принята равномерная априорная плотность вероятности (принцип безразличия Лапласа, иногда называемый принципом недостаточного основания). Таким образом, принцип максимальной энтропии – это не просто альтернативный взгляд на обычные методы вывода классической статистики, а представляет собой значительное концептуальное обобщение этих методов. Однако эти утверждения не означают, что термодинамические системы не нуждаются в доказательстве эргодичности для обоснования рассмотрения их как статистического ансамбля. Говоря простым языком, принцип максимальной энтропии можно рассматривать как утверждение об эпистемической скромности или максимальном незнании. Выбранное распределение – это то, которое делает наименьшие предположения о знаниях, выходящих за рамки заданных априорных данных, то есть допускает наибольшее незнание, выходящее за рамки заданных априорных данных.
In most practical cases, the stated prior data or testable information is given by a set of conserved quantities (average values of some moment functions), associated with the probability distribution in question. This is the way the maximum entropy principle is most often used in statistical thermodynamics. Another possibility is to prescribe some symmetries of the probability distribution. The equivalence between conserved quantities and corresponding symmetry groups implies a similar equivalence for these two ways of specifying the testable information in the maximum entropy method. The maximum entropy principle is also needed to guarantee the uniqueness and consistency of probability assignments obtained by different methods, statistical mechanics and logical inference in particular. The maximum entropy principle makes explicit our freedom in using different forms of prior data. As a special case, a uniform prior probability density (Laplace's principle of indifference, sometimes called the principle of insufficient reason), may be adopted. Thus, the maximum entropy principle is not merely an alternative way to view the usual methods of inference of classical statistics, but represents a significant conceptual generalization of those methods. However these statements do not imply that thermodynamical systems need not be shown to be ergodic to justify treatment as a statistical ensemble. In ordinary language, the principle of maximum entropy can be said to express a claim of epistemic modesty, or of maximum ignorance. The selected distribution is the one that makes the least claim to being informed beyond the stated prior data, that is to say the one that admits the most ignorance beyond the stated prior data.
Предыдущие вероятности
Принцип максимальной энтропии часто используется для получения априорных распределений вероятностей для байесовского вывода. Джейнс был горячим сторонником этого подхода, утверждая, что распределение с максимальной энтропией представляет собой распределение, содержащее наименьший объем информации. Значительный объем литературы сейчас посвящен построению априорных распределений с максимальной энтропией и их связи с кодированием каналов.
The principle of maximum entropy is often used to obtain prior probability distributions for Bayesian inference. Jaynes was a strong advocate of this approach, claiming the maximum entropy distribution represented the least informative distribution. A large amount of literature is now dedicated to the elicitation of maximum entropy priors and links with channel coding.
Последующие вероятности
Максимальная энтропия является достаточным правилом обновления для радикального пробабилизма. Вероятностная кинематика Ричарда Джеффри является частным случаем вывода, основанного на принципе максимальной энтропии. Однако максимальная энтропия не является обобщением всех достаточных правил обновления.
Maximum entropy is a sufficient updating rule for radical probabilism. Richard Jeffrey's probability kinematics is a special case of maximum entropy inference. However, maximum entropy is not a generalisation of all such sufficient updating rules.
Модели максимальной энтропии
В качестве альтернативы, этот принцип часто применяется при спецификации модели: в этом случае наблюдаемые данные сами по себе рассматриваются как проверяемая информация. Такие модели широко используются в обработке естественного языка. Примером такой модели является логистическая регрессия, которая соответствует классификатору максимальной энтропии для независимых наблюдений.
Alternatively, the principle is often invoked for model specification: in this case the observed data itself is assumed to be the testable information. Such models are widely used in natural language processing. An example of such a model is logistic regression, which corresponds to the maximum entropy classifier for independent observations.