Введение
Форма моделирования, которая использует статистику для прогнозирования результатов Прогнозирующее моделирование использует статистику для прогнозирования результатов. Чаще всего событие, которое мы хотим предсказать, происходит в будущем, но прогнозирующее моделирование может применяться к любому типу неизвестного события, независимо от того, когда оно произошло. Например, прогнозные модели часто используются для выявления преступлений и идентификации подозреваемых после совершения преступления. Во многих случаях модель выбирается на основе теории обнаружения, чтобы попытаться угадать вероятность результата при заданном количестве входных данных, например, при получении электронного письма, определяющего, насколько вероятно, что это спам. Модели могут использовать один или несколько классификаторов, пытаясь определить вероятность принадлежности набора данных к другому набору. Например, модель может быть использована для определения того, является ли электронное письмо спамом или "хамом" (не спамом). В зависимости от границ определения, прогнозное моделирование является синонимом или во многом перекрывает область машинного обучения, как это чаще упоминается в академических или исследовательских и опытно-конструкторских контекстах. При коммерческом использовании прогнозное моделирование часто называют прогнозной аналитикой. Прогнозирующее моделирование часто противопоставляется причинному моделированию/анализу. В первом случае можно полностью удовлетвориться использованием индикаторов или прокси-значений интересующего результата. В последнем случае человек стремится определить истинные причинно-следственные связи. Это различие привело к появлению литературы в области методов исследования и статистики и к общему утверждению, что "корреляция не подразумевает причинно-следственной связи".
Predictive modelling uses statistics to predict outcomes. Most often the event one wants to predict is in the future, but predictive modelling can be applied to any type of unknown event, regardless of when it occurred. For example, predictive models are often used to detect crimes and identify suspects, after the crime has taken place. In many cases, the model is chosen on the basis of detection theory to try to guess the probability of an outcome given a set amount of input data, for example given an email determining how likely that it is spam. Models can use one or more classifiers in trying to determine the probability of a set of data belonging to another set. For example, a model might be used to determine whether an email is spam or "ham" (non spam). Depending on definitional boundaries, predictive modelling is synonymous with, or largely overlapping with, the field of machine learning, as it is more commonly referred to in academic or research and development contexts. When deployed commercially, predictive modelling is often referred to as predictive analytics. Predictive modelling is often contrasted with causal modelling/analysis. In the former, one may be entirely satisfied to make use of indicators of, or proxies for, the outcome of interest. In the latter, one seeks to determine true cause and effect relationships. This distinction has given rise to a burgeoning literature in the fields of research methods and statistics and to the common statement that "correlation does not imply causation".
Модели
Почти любая статистическая модель может быть использована для целей прогнозирования. В целом, существует два класса прогнозных моделей: параметрические и непараметрические. Третий класс, полупараметрические модели, включает в себя функции обоих. Параметрические модели делают "специфические предположения в отношении одного или нескольких параметров популяции, которые характеризуют основное распределение". Непаметрические модели "обычно включают меньше предположений о структуре и форме распределения [чем параметрические модели], но обычно содержат сильные предположения о независимости".
Моделирование подъема
Моделирование подъема - это метод моделирования изменения вероятности, вызванной действием. Обычно это маркетинговая акция, такая как предложение купить продукт, использовать продукт больше или переподписать контракт. Например, в кампании по удержанию вы хотите предсказать изменение в вероятности того, что клиент останется клиентом, если с ним свяжутся. Модель изменения вероятности позволяет направлять кампанию по удержанию клиентов на тех клиентов, для которых изменение вероятности будет выгодно. Это позволяет программе удержания клиентов избежать нежелательного оттока или ухода клиентов, не тратив деньги на контакты с людьми, которые все равно будут действовать.
retention campaign you wish to predict the change in probability that a customer will remain a customer if they are contacted. A model of the change in probability allows the retention campaign to be targeted at those customers on whom the change in probability will be beneficial. This allows the retention programme to avoid triggering unnecessary churn or customer attrition without wasting money contacting people who would act anyway.
Археология
Прогнозирующее моделирование в археологии берет свое начало в работе Гордона Вилли в середине пятидесятых годов в долине Виру в Перу. Были проведены полные, интенсивные обследования, затем была определена соизмерность между культурными остатками и природными особенностями, такими как наклон и растительность. Развитие количественных методов и большая доступность применимых данных привело к росту дисциплины в 1960-х годах, а к концу 1980-х годов крупные управляющие землей во всем мире добились значительного прогресса. В целом, прогнозирующее моделирование в археологии устанавливает статистически обоснованные причинно-следственные или ковариабельные отношения между природными прокси, такими как типы почв, высота, наклон, растительность, близость к воде, геология, геоморфология и т. Д., И наличие археологических особенностей. Благодаря анализу этих количественно измеримых атрибутов земли, которая подверглась археологическому обследованию, иногда "археологическая чувствительность" неисследованных районов может быть предсказана на основе естественных прокси в этих районах. Крупные управляющие землей в Соединенных Штатах, такие как Бюро по управлению землей (BLM), Министерство обороны (DOD) и многочисленные агентства по автомобильным дорогам и паркам, успешно использовали эту стратегию. Используя прогнозирующее моделирование в своих планах управления культурными ресурсами, они способны принимать более обоснованные решения при планировании мероприятий, которые могут потребовать нарушения наземного режима и впоследствии повлиять на археологические памятники.
Управление взаимоотношениями с клиентами
Прогнозирующее моделирование широко используется в аналитическом управлении взаимоотношениями с клиентами и в добыче данных для создания моделей на уровне клиента, которые описывают вероятность того, что клиент предпримет определенные действия. Эти действия обычно связаны с продажами, маркетингом и удержанием клиентов. Например, крупная потребительская организация, такая как оператор мобильной связи, будет иметь набор прогнозных моделей для кросс-продажи продукта, глубокой продажи продукта (или продажи дополнительных товаров) и сброса. Также сейчас более распространено, чтобы такая организация имела модель спасаемости, использующую модель подъема. Это предсказывает вероятность того, что клиент может быть сохранен в конце контрактного периода (изменение вероятности отказа), в отличие от стандартной модели прогнозирования отказа.
Страхование автомобилей
Прогнозирующее моделирование используется в автомобильном страховании для распределения риска инцидентов между страхователями на основе информации, полученной от страхователей. Это широко используется в основанных на использовании страховых решениях, где прогнозные модели используют данные на основе телеметрии для построения модели прогнозного риска для вероятности претензий. Прогнозные модели "черного ящика" используют только GPS или датчики акселерометра. Некоторые модели включают в себя широкий спектр прогнозных данных, выходящих за рамки базовой телеметрии, включая расширенное поведение водителей, независимые записи аварий, историю дорожного движения и профили пользователей для предоставления улучшенных моделей риска.
Здравоохранение
В 2009 году Parkland Health & Hospital System начала анализировать электронные медицинские записи, чтобы использовать прогнозирующее моделирование для выявления пациентов с высоким риском реадмиссии. Первоначально больница сосредоточилась на пациентах с застойной сердечной недостаточностью, но программа расширилась, чтобы включать пациентов с диабетом, острым инфарктом миокарда и пневмонией. В 2018 году Banerjee et al. Предложена модель глубокого обучения для оценки краткосрочной продолжительности жизни (> 3 месяца) пациентов путем анализа свободных текстовых клинических записей в электронной медицинской карте, при сохранении последовательности временных посещений. Модель была обучена на большом наборе данных (10 293 пациента) и проверена на отдельном наборе данных (1818 пациентов). Он достиг площади под кривой ROC (операционная характеристика приемника) 0,89. Для обеспечения объяснительной способности они разработали интерактивный графический инструмент, который может улучшить понимание врачом основы прогнозов модели. Высокая точность и объяснительная способность модели PPES Met может позволить использовать модель в качестве инструмента поддержки принятия решений для персонализации лечения метастатического рака и предоставления ценной помощи врачам. Первые рекомендации по отчетности модели клинического прогнозирования были опубликованы в 2015 году (прозрачная отчетность многовариантной модели прогнозирования для индивидуального прогноза или диагностики (TRIPOD)), и с тех пор были обновлены. Для оценки продолжительности операции использовали прогнозные модели.
Алгоритмическая торговля
Прогнозирующее моделирование в торговле - это процесс моделирования, в котором вероятность результата прогнозируется с использованием набора переменных-предсказателей. Предсказательные модели могут быть построены для различных активов, таких как акции, фьючерсы, валюты, товары и т. д. Предсказательная модель все еще широко используется торговыми фирмами для разработки стратегий и торговли. Он использует математически продвинутое программное обеспечение для оценки показателей цены, объема, открытого процента и других исторических данных, чтобы обнаружить повторяющиеся модели.
Системы слежения за свинцом
Прогнозирующее моделирование дает генераторам лидов преимущество, прогнозируя результаты, основанные на данных, для каждой потенциальной кампании. Этот метод экономит время и выявляет потенциальные слепые точки, чтобы помочь клиенту принимать более разумные решения.
Заметные недостатки прогнозирующего моделирования
Хотя не широко обсуждается в основном сообществе прогнозных моделей, прогнозные моделирования - это методология, которая широко использовалась в финансовой отрасли в прошлом, и некоторые из основных неудач способствовали финансовому кризису 2007-2008 годов. Эти неудачи показывают опасность полагаться исключительно на модели, которые по своей сути отстают в своем развитии. Следующие примеры не являются полным списком: S&P, Moody's и Fitch оценивают вероятность дефолта облигаций с помощью дискретных переменных, называемых рейтингом. Рейтинг может принимать дискретные значения от ААА до D. Рейтинг является предиктором риска дефолта на основе различных переменных, связанных с заемщиком и историческими макроэкономическими данными. Рейтинговые агентства не смогли дать свой рейтинг на рынке облигаций с обеспечением ипотеки (CDO) на сумму 600 миллиардов долларов США. Почти весь сектор AAA (и сектор сверх-AAA, новый рейтинг, предоставленный рейтинговыми агентствами для представления сверхбезопасных инвестиций) рынка CDO в 2008 году потерял свой рейтинг или сильно понизился, многие из которых получили свой рейтинг менее чем за год до этого. До сих пор не было статистических моделей, которые пытались бы предсказать цены на рынке акций на основе исторических данных, которые последовательно делали бы правильные прогнозы в долгосрочной перспективе. Одним из наиболее запоминающихся провалов является Long Term Capital Management, фонд, который нанял высококвалифицированных аналитиков, в том числе лауреата Нобелевской премии по экономическим наукам, для разработки сложной статистической модели, которая предсказывала разрыв цен между различными ценными бумагами. Эти модели приносили впечатляющую прибыль до крупного провала, который заставил тогдашнего председателя Федеральной резервной системы Алана Гринспена вмешаться, чтобы посредничать в плане спасения брокерами Уолл-стрит, чтобы предотвратить крах рынка облигаций.
Bond rating. S&P, Moody's and Fitch quantify the probability of default of bonds with discrete variables called rating. The rating can take on discrete values from AAA down to D. The rating is a predictor of the risk of default based on a variety of variables associated with the borrower and historical macroeconomic data. The rating agencies failed with their ratings on the US$600 billion mortgage backed Collateralized Debt Obligation (CDO) market. Almost the entire AAA sector (and the super AAA sector, a new rating the rating agencies provided to represent super safe investment) of the CDO market defaulted or severely downgraded during 2008, many of which obtained their ratings less than just a year previously. So far, no statistical models that attempt to predict equity market prices based on historical data are considered to consistently make correct predictions over the long term. One particularly memorable failure is that of Long Term Capital Management, a fund that hired highly qualified analysts, including a Nobel Memorial Prize in Economic Sciences winner, to develop a sophisticated statistical model that predicted the price spreads between different securities. The models produced impressive profits until a major debacle that caused the then Federal Reserve chairman Alan Greenspan to step in to broker a rescue plan by the Wall Street broker dealers in order to prevent a meltdown of the bond market.
Возможные фундаментальные ограничения прогнозных моделей, основанных на подходе данных
История не всегда может точно предсказать будущее. Использование отношений, полученных из исторических данных, для прогнозирования будущего, подразумевает наличие определенных постоянных условий или констант в сложной системе. Это почти всегда приводит к некоторой неточности, когда система включает людей. Неизвестные неизвестные - проблема. При сборе данных коллектор сначала определяет набор переменных, для которых собираются данные. Однако, независимо от того, насколько обширным коллектор считает свой выбор переменных, всегда существует возможность новых переменных, которые не были рассмотрены или даже определены, но все же имеют решающее значение для результата. Алгоритмы могут быть побеждены враждебно. После того, как алгоритм становится общепринятым стандартом измерения, его могут использовать люди, которые понимают алгоритм и имеют стимул обманывать или манипулировать результатом. Это то, что произошло с рейтингом CDO, описанным выше. Дилеры CDO активно выполняли ввод рейтинговых агентств, чтобы достичь AAA или супер AAA на CDO, которые они выпускали, умело манипулируя переменными, которые были "неизвестны" для "сложных" моделей рейтинговых агентств.