Введение

Принцип в байесовской статистике

Принцип максимальной энтропии утверждает, что распределение вероятностей, наилучшим образом отражающее текущее состояние знаний о системе, – это распределение с наибольшей энтропией, при условии точно заданных априорных данных (например, утверждения, выражающего проверяемую информацию). Другими словами: возьмите точно заданные априорные данные или проверяемую информацию о функции распределения вероятностей. Рассмотрите множество всех возможных распределений вероятностей, удовлетворяющих этим априорным данным. Согласно этому принципу, распределение с максимальной информационной энтропией является оптимальным выбором.

История

Принцип был впервые сформулирован Э. Т. Джейнсом в двух статьях 1957 года, где он подчеркнул естественную взаимосвязь между статистической механикой и теорией информации. В частности, Джейнс предложил новое и весьма общее обоснование того, почему работает гиббсовский метод статистической механики. Он утверждал, что энтропия статистической механики и информационная энтропия теории информации по сути являются одним и тем же. Следовательно, статистическую механику следует рассматривать как частное применение общего инструмента логического вывода и теории информации.

Обзор

В большинстве практических случаев заданные априорные данные или проверяемая информация представляются набором сохраняющихся величин (средние значения некоторых моментных функций), связанных с рассматриваемым распределением вероятностей. Именно так принцип максимальной энтропии наиболее часто используется в статистической термодинамике. Другая возможность – задать некоторые симметрии распределения вероятностей. Эквивалентность между сохраняющимися величинами и соответствующими группами симметрий подразумевает аналогичную эквивалентность для этих двух способов задания проверяемой информации в методе максимальной энтропии. Принцип максимальной энтропии также необходим для обеспечения уникальности и непротиворечивости вероятностных оценок, полученных различными методами, в частности статистической механикой и логическим выводом. Принцип максимальной энтропии явно отражает нашу свободу в использовании различных форм априорных данных. В качестве частного случая может быть принята равномерная априорная плотность вероятности (принцип безразличия Лапласа, иногда называемый принципом недостаточного основания). Таким образом, принцип максимальной энтропии – это не просто альтернативный взгляд на обычные методы вывода классической статистики, а представляет собой значительное концептуальное обобщение этих методов. Однако эти утверждения не означают, что термодинамические системы не нуждаются в доказательстве эргодичности для обоснования рассмотрения их как статистического ансамбля. Говоря простым языком, принцип максимальной энтропии можно рассматривать как утверждение об эпистемической скромности или максимальном незнании. Выбранное распределение – это то, которое делает наименьшие предположения о знаниях, выходящих за рамки заданных априорных данных, то есть допускает наибольшее незнание, выходящее за рамки заданных априорных данных.

Предыдущие вероятности

Принцип максимальной энтропии часто используется для получения априорных распределений вероятностей для байесовского вывода. Джейнс был горячим сторонником этого подхода, утверждая, что распределение с максимальной энтропией представляет собой распределение, содержащее наименьший объем информации. Значительный объем литературы сейчас посвящен построению априорных распределений с максимальной энтропией и их связи с кодированием каналов.

Последующие вероятности

Максимальная энтропия является достаточным правилом обновления для радикального пробабилизма. Вероятностная кинематика Ричарда Джеффри является частным случаем вывода, основанного на принципе максимальной энтропии. Однако максимальная энтропия не является обобщением всех достаточных правил обновления.

Модели максимальной энтропии

В качестве альтернативы, этот принцип часто применяется при спецификации модели: в этом случае наблюдаемые данные сами по себе рассматриваются как проверяемая информация. Такие модели широко используются в обработке естественного языка. Примером такой модели является логистическая регрессия, которая соответствует классификатору максимальной энтропии для независимых наблюдений.