Введение

Метод статистического вывода

Байесовский вывод (англ. Bayesian inference) — метод статистического вывода, в котором теорема Байеса используется для обновления вероятности гипотезы по мере поступления новых доказательств или информации. В основе байесовского вывода лежит использование априорных знаний, представленных в виде априорного распределения, для оценки апостериорных вероятностей. Байесовский вывод является важным методом в статистике, особенно в математической статистике. Байесовское обновление особенно важно при динамическом анализе последовательности данных. Байесовский вывод находит применение в самых разных областях, включая науку, инженерию, философию, медицину, спорт и юриспруденцию. В философии теории принятия решений байесовский вывод тесно связан с субъективной вероятностью, часто называемой «байесовской вероятностью».

Альтернативы байесовскому обновлению

Обновление Байеса широко используется и вычислительно удобно. Однако это не единственное правило обновления, которое можно считать рациональным. Ян Хэкинг отметил, что традиционные аргументы о "голландской книге" не предписывали байесовское обновление: они оставляли открытой возможность того, что небайесовские правила обновления могут избежать парадокса "голландской книги". Хэкинг писал: "Ни аргумент о "голландской книге", ни какое-либо другое доказательство аксиом вероятности в арсенале персоналистов не подразумевает динамическое предположение. Ни одно из них не влечет за собой байесовский подход. Следовательно, персоналисту необходимо динамическое предположение, чтобы быть байесовцем. В принципе, персоналист мог бы отказаться от байесовской модели обучения на опыте. Соль может потерять свой вкус". Действительно, существуют небайесовские правила обновления, которые также избегают парадокса "голландской книги" (как обсуждается в литературе по "кинематике вероятностей") после публикации правила Ричарда К. Джеффри, которое применяет правило Байеса к случаю, когда вероятность присваивается самому доказательству. Дополнительные гипотезы, необходимые для однозначного обоснования байесовского обновления, были признаны значительными, сложными и неудовлетворительными.

Вывод о исключительных и исчерпывающих возможностях

Если свидетельства одновременно используются для обновления убеждений относительно набора взаимоисключающих и исчерпывающих утверждений, то байесовский вывод можно рассматривать как воздействие на это распределение убеждений в целом.

Общая формулировка

Предположим, что процесс генерирует независимые и одинаково распределенные события, но распределение вероятностей неизвестно. Пусть пространство событий представляет собой текущее состояние знаний о процессе. Каждая модель представлена событием . Условные вероятности задаются для определения моделей. – степень уверенности в том, что до первого шага вывода, является набором начальных априорных вероятностей. Они должны суммироваться в 1, но в остальном могут быть произвольными. Предположим, что процесс наблюдается и генерирует . Для каждого , априорная вероятность обновляется до апостериорной вероятности . Согласно теореме Байеса:

При наблюдении дополнительных данных эта процедура может быть повторена.

Определения

, точка данных в общем случае. Это может быть, по сути, вектор значений. , параметр распределения точки данных, то есть это может быть вектор параметров. , гиперпараметр распределения параметра, то есть это может быть вектор гиперпараметров. — это выборка, набор наблюдаемых точек данных, то есть . — это новая точка данных, распределение которой необходимо предсказать.

Байесовское заключение

Предыдущее распределение — это распределение параметра (параметров) до получения каких-либо данных, то есть предыдущее распределение может быть нелегко определить; в таком случае одним из возможных решений является использование априорного распределения Джеффриса для получения предыдущего распределения перед его обновлением новыми наблюдениями. Распределение выборки — это распределение наблюдаемых данных при заданных значениях параметров, то есть это также называется правдоподобием, особенно когда рассматривается как функция параметра (параметров), иногда записывается как Маргинальное правдоподобие (иногда также называемое свидетельством) — это распределение наблюдаемых данных, усредненное по параметрам, то есть оно количественно определяет степень согласованности между данными и экспертным мнением в геометрическом смысле, который можно сделать точным. Если маргинальное правдоподобие равно 0, то между данными и экспертным мнением нет согласованности, и правило Байеса неприменимо. Апостериорное распределение — это распределение параметра (параметров) после учета наблюдаемых данных. Оно определяется правилом Байеса, которое является основой байесовского вывода: это выражается словами как «апостериорное пропорционально правдоподобию, умноженному на предыдущее», или иногда как «апостериорное = правдоподобие, умноженное на предыдущее, деленное на свидетельство». На практике, для почти всех сложных байесовских моделей, используемых в машинном обучении, апостериорное распределение не может быть получено в замкнутой форме, главным образом потому, что пространство параметров может быть очень многомерным, или байесовская модель сохраняет определенную иерархическую структуру, сформированную на основе наблюдений и параметров. В таких ситуациях необходимо прибегать к методам аппроксимации. Общий случай: пусть — условное распределение при заданном , а — распределение совместного распределения тогда условное распределение при заданном определяется как Существование и единственность необходимого условного математического ожидания является следствием теоремы Радона — Никодима. Она была сформулирована Колмогоровым в его знаменитой книге 1933 года. Колмогоров подчеркивает важность условной вероятности, написав в предисловии: «Я хотел бы обратить внимание на… и особенно на теорию условных вероятностей и условных математических ожиданий». Теорема Байеса определяет апостериорное распределение на основе предыдущего распределения. Единственность требует выполнения условий непрерывности. Теорему Байеса можно обобщить, включив в нее несобственные априорные распределения, такие как равномерное распределение на действительной прямой. Современные методы Монте-Карло на основе цепей Маркова повысили значимость теоремы Байеса, включая случаи с несобственными априорными распределениями.

Интерпретация фактора

То есть, если модель верна, то наблюдаемые данные были бы более вероятны, чем предсказывается текущим уровнем убежденности. Обратное верно при уменьшении уровня убежденности. Если уровень убежденности не меняется, то данные независимы от модели, то есть наблюдаемые данные имели бы такую же вероятность, как и предсказывается текущим уровнем убежденности, если модель верна.

Правило Кромвеля

Если тогда, если и , то . Это можно интерпретировать как то, что сильные убеждения невосприимчивы к опровергающим доказательствам. Первое непосредственно следует из теоремы Байеса. Второе можно вывести, применив первое правило к событию "не " вместо "", получив "если , то ", из чего результат следует немедленно.

Асимптотическое поведение задней

Рассмотрим поведение распределения убеждений при многократном обновлении на основе независимых и одинаково распределенных испытаний. Для достаточно "хороших" априорных вероятностей теорема Бернштейна — фон Мизеса утверждает, что в пределе бесконечного числа испытаний апостериорное распределение сходится к нормальному распределению, не зависящему от начального априорного, при определенных условиях, впервые сформулированных и строго доказанных Джозефом Л. Дубом в 1948 году, а именно, если рассматриваемая случайная величина имеет конечное пространство вероятностей. Более общие результаты были получены позднее статистиком Дэвидом А. Фридманом, который опубликовал две основополагающие работы в 1963 и 1965 годах, в которых исследовал, когда и при каких условиях гарантируется асимптотическое поведение апостериорного распределения. Его статья 1963 года, как и работа Дуба (1949), рассматривает конечный случай и приходит к удовлетворительному заключению. Однако, если случайная величина имеет бесконечное, но счетное пространство вероятностей (то есть соответствует игральной кости с бесконечным числом граней), то в статье 1965 года показано, что для плотного подмножества априорных распределений теорема Бернштейна — фон Мизеса неприменима. В этом случае асимптотическая сходимость практически невозможна. Позднее, в 1980-х и 1990-х годах, Фридман и Перси Диаконис продолжили изучение случая бесконечных счетных пространств вероятностей. В заключение следует отметить, что числа испытаний может быть недостаточно для подавления влияния начального выбора, и особенно для больших (но конечных) систем сходимость может быть очень медленной.

Приоры

В параметрическом виде априорное распределение часто предполагается принадлежащим к семейству распределений, называемых сопряжёнными априорными распределениями. Преимущество сопряжённого априорного распределения заключается в том, что апостериорное распределение также будет принадлежать к этому же семейству, и вычисления могут быть выполнены в аналитической форме.

Вероятность гипотезы

+ Таблица сопряженности #1H1 #2H2 Итого Простое, E 30 20 50 Шоколадное, ¬E 10 20 30 Итого 40 40 80 P(H1|E) = 30 / 50 = 0.6

Предположим, есть две полные миски с печеньем. В миске №1 10 шоколадных и 30 простых печений, а в миске №2 по 20 каждого вида. Наш друг Фред случайным образом выбирает миску, а затем случайным образом выбирает печенье. Мы можем предположить, что у Фреда нет оснований относиться к одной миске иначе, чем к другой, и то же самое касается и печенья. Выбранное печенье оказывается простым. Какова вероятность того, что Фред выбрал его из миски №1? Интуитивно понятно, что ответ должен быть больше половины, поскольку в миске №1 больше простых печений. Точный ответ дается теоремой Байеса. Пусть обозначает миску №1, а – миску №2. Поскольку миски идентичны с точки зрения Фреда, , и сумма этих двух вероятностей должна равняться 1, следовательно, обе равны 0.5. Событие – это наблюдение простого печенья. Исходя из содержимого мисок, мы знаем, что и Формула Байеса дает:

До наблюдения за печеньем вероятность того, что Фред выбрал миску №1, была априорной вероятностью, , которая равнялась 0.5. После наблюдения за печеньем мы должны пересмотреть вероятность до , которая равна 0.6.

Прогнозирование

Археолог проводит раскопки на участке, предположительно относящемся к средневековому периоду – с XI по XVI век. Однако точное время заселения участка в пределах этого периода неизвестно. Обнаружены фрагменты керамики, часть из которых глазурована, а часть – украшена. Предполагается, что если участок был заселен в раннем средневековье, то 1% керамики был бы глазурованным, а 50% ее площади – украшенной. Если же заселение произошло в позднем средневековье, то 81% керамики был бы глазурованным, а 5% ее площади – украшенной. Насколько уверен археолог в датировке поселения по мере обнаружения новых фрагментов? Степень достоверности непрерывной переменной (века) необходимо вычислить, используя дискретный набор событий в качестве доказательств. Предполагая линейное изменение доли глазурованной керамики и украшенной площади с течением времени, а также независимость этих переменных,

предполагается равномерное априорное распределение и независимое, одинаково распределенное поведение при каждой выборке. При обнаружении нового фрагмента определенного типа теорема Байеса используется для обновления степени достоверности для каждого значения века. На графике представлена компьютерная симуляция изменения степени достоверности при обнаружении 50 фрагментов. В ходе симуляции участок был заселен примерно в 1420 году. Вычисляя площадь под соответствующей частью графика для 50 испытаний, археолог может заключить, что практически нет вероятности заселения участка в XI и XII веках, около 1% вероятности заселения в XIII веке, 63% вероятности в XIV веке и 36% вероятности в XV веке. Теорема Бернштейна — фон Мизеса утверждает здесь об асимптотической сходимости к "истинному" распределению, поскольку пространство вероятностей, соответствующее дискретному набору событий, конечно (см. выше раздел об асимптотическом поведении апостериорного распределения).

Выбор модели

Байесовская методология также играет роль в выборе модели, где целью является выбор одной модели из набора конкурирующих моделей, наиболее точно отражающей лежащий в основе процесс, который сгенерировал наблюдаемые данные. При байесовском сравнении моделей выбирается модель с наибольшей апостериорной вероятностью, учитывая данные. Апостериорная вероятность модели зависит от свидетельств, или предельной правдоподобности, отражающей вероятность того, что данные были сгенерированы данной моделью, и от априорного убеждения относительно модели. Если две конкурирующие модели априори считаются равновероятными, то отношение их апостериорных вероятностей соответствует фактору Байеса. Поскольку байесовское сравнение моделей направлено на выбор модели с наибольшей апостериорной вероятностью, эта методология также называется правилом выбора максимума апостериорной вероятности (MAP) или правилом апостериорной вероятности MAP.

Вероятностное программирование

Хотя байесовские методы концептуально просты, они могут быть сложны с математической и вычислительной точки зрения. Языки вероятностного программирования (PPL) предоставляют функции для удобного построения байесовских моделей, а также эффективные методы автоматического вывода. Это позволяет отделить построение модели от процесса вывода, давая возможность специалистам сосредоточиться на решении конкретных задач, а языкам PPL – взять на себя обработку вычислительных деталей.

Анализ статистических данных

См. отдельную статью в Википедии, посвященную байесовской статистике, в особенности раздел о статистическом моделировании на этой странице.

Компьютерные приложения

Байесовский вывод находит применение в искусственном интеллекте и экспертных системах. Методы байесовского вывода являются фундаментальной частью компьютерных методов распознавания образов с конца 1950-х годов. Существует также постоянно растущая связь между байесовскими методами и методами Монте-Карло, основанными на моделировании, поскольку сложные модели не могут быть проанализированы аналитически с помощью байесовского анализа, в то время как структура графической модели может позволить использовать эффективные алгоритмы моделирования, такие как выборка Гиббса и другие схемы алгоритма Метрополиса — Хэстингса. В последнее время байесовский вывод приобрел популярность в сообществе филогенетики по этим причинам: ряд приложений позволяет одновременно оценивать множество демографических и эволюционных параметров. В контексте статистической классификации байесовский вывод использовался для разработки алгоритмов идентификации спама в электронной почте. Приложения, использующие байесовский вывод для фильтрации спама, включают CRM114, DSPAM, Bogofilter, SpamAssassin, SpamBayes, Mozilla, XEAMS и другие. Классификация спама рассматривается более подробно в статье о наивном классификаторе Байеса. Индуктивный вывод Соломоноффа — это теория предсказания, основанная на наблюдениях; например, предсказание следующего символа на основе заданной последовательности символов. Единственное предположение состоит в том, что среда подчиняется некоторому неизвестному, но вычислимому распределению вероятностей. Это формальная индуктивная структура, объединяющая два хорошо изученных принципа индуктивного вывода: байесовскую статистику и принцип бритвы Оккама. Универсальная априорная вероятность Соломоноффа любого префикса p вычислимой последовательности x — это сумма вероятностей всех программ (для универсального компьютера), вычисляющих что-либо, начинающееся с p. При заданном p и любом вычислимом, но неизвестном распределении вероятностей, из которого получена x, универсальная априорная вероятность и теорема Байеса могут быть использованы для оптимального предсказания еще не наблюдаемых частей x.

Биоинформатика и медицинские приложения

Байесовский вывод находит применение в различных областях биоинформатики, в том числе в анализе дифференциальной экспрессии генов. Байесовский вывод также используется в общей модели оценки риска рака, известной как CIRI (Continuous Individualized Risk Index), где последовательные измерения используются для обновления байесовской модели, изначально основанной на априорных знаниях.

В зале суда

Байесовский вывод может быть использован присяжными для последовательного и непротиворечивого накопления доказательств за и против подсудимого, чтобы определить, соответствует ли совокупность этих доказательств их личному порогу обоснованности сомнений ("вне разумного сомнения"). Теорема Байеса применяется последовательно ко всем представленным доказательствам, при этом апостериорное распределение, полученное на одном этапе, становится априорным для следующего. Преимущество байесовского подхода заключается в том, что он предоставляет присяжным непредвзятый и рациональный механизм для объединения доказательств. Возможно, будет уместно объяснить теорему Байеса присяжным в терминах коэффициентов, поскольку коэффициенты ставок более понятны, чем вероятности. Альтернативно, логарифмический подход, заменяющий умножение сложением, может оказаться более удобным для присяжных. Если не вызывает сомнений сам факт совершения преступления, а лишь личность преступника, было предложено использовать равномерное априорное распределение для квалифицированной популяции. Например, если 1000 человек могли совершить преступление, априорная вероятность вины составит 1/1000. Использование теоремы Байеса присяжными является предметом споров. В Соединенном Королевстве эксперт защиты объяснил теорему Байеса присяжным в деле R v Adams. Присяжные признали подсудимого виновным, но дело было обжаловано на основании того, что присяжным, не желающим использовать теорему Байеса, не был предоставлен альтернативный способ оценки доказательств. Апелляционный суд оставил приговор в силе, но также выразил мнение, что "введение теоремы Байеса или любого аналогичного метода в уголовный процесс вовлекает присяжных в неуместные и излишне сложные теоретические рассуждения, отвлекая их от их основной задачи". Гарднер Медвин утверждает, что основанием для вынесения вердикта в уголовном процессе должна быть не вероятность вины, а вероятность представленных доказательств при условии невиновности подсудимого (аналогично p-значению в частотном подходе). Он утверждает, что для вычисления апостериорной вероятности вины с помощью теоремы Байеса необходимо знать априорную вероятность вины, которая, в свою очередь, зависит от распространенности преступления – фактора, который редко учитывается в уголовных процессах. Рассмотрим следующие три утверждения:
A – известные факты и показания могли иметь место, если бы подсудимый был виновен. B – известные факты и показания могли иметь место, если бы подсудимый был невиновен. C – подсудимый виновен. Гарднер Медвин утверждает, что для вынесения обвинительного приговора присяжные должны поверить в истинность A и ложность B. Истинность A и ложность B подразумевает истинность C, но обратное неверно. Возможно, что и B, и C истинны, но в этом случае он утверждает, что присяжные должны оправдать подсудимого, даже зная, что это позволит некоторым виновным избежать наказания. См. также парадокс Линдли.

Бейсианская эпистемология

Байесовская эпистемология – это направление, которое отстаивает использование байесовского вывода в качестве способа обоснования правил индуктивной логики. Карл Поппер и Дэвид Миллер отвергли идею байесовского рационализма, то есть применение правила Байеса для эпистемологических умозаключений: оно подвержено тому же порочному кругу, что и любая другая эпистемология, основанная на оправдании, поскольку предполагает то, что само стремится обосновать. Согласно этой точке зрения, рациональная интерпретация байесовского вывода должна рассматривать его лишь как вероятностную версию фальсификации, отвергая распространенное среди байесовцев убеждение, что высокая вероятность, полученная в результате серии байесовских обновлений, доказывает гипотезу вне всяких разумных сомнений или даже с вероятностью, превышающей 0.

Байес и байесовский вывод

Проблема, которую рассматривал Бейс в предложении 9 своего эссе "Опыт решения одной проблемы в учении о вероятностях", — это апостериорное распределение для параметра *a* (вероятности успеха) биномиального распределения.

История

Термин "байесовский" восходит к Томасу Бейсу (1701–1761), который доказал, что для неизвестного события можно установить вероятностные границы. Однако именно Пьер Симон Лаплас (1749–1827) сформулировал (как Принцип VI) то, что сейчас известно как теорема Байеса, и применил её для решения задач в небесной механике, медицинской статистике, теории надёжности и юриспруденции.

Средний или продвинутый

ДеГрут, Моррис Х., Оптимальные статистические решения. Библиотека классики Уайли. 2004. (Первоначально опубликовано (1970) издательством McGraw-Hill.) Jaynes, E. T. (1998). Теория вероятностей: логика науки. O'Hagan, A. и Forster, J. (2003). Усовершенствованная теория статистики Кендалла, том 2B: Байесовский вывод. Arnold, Нью-Йорк. Pearl, Judea. (1988). Вероятностное рассуждение в интеллектуальных системах: сети вероятностных выводов. San Mateo, CA: Morgan Kaufmann. Pierre Bessière et al. (2013). "Байесовское программирование". CRC Press. Francisco J. Samaniego (2010). "Сравнение байесовского и частотного подходов к оценке". Springer. Нью-Йорк.