Введение

Форма моделирования, которая использует статистику для прогнозирования результатов Прогнозирующее моделирование использует статистику для прогнозирования результатов. Чаще всего событие, которое мы хотим предсказать, происходит в будущем, но прогнозирующее моделирование может применяться к любому типу неизвестного события, независимо от того, когда оно произошло. Например, прогнозные модели часто используются для выявления преступлений и идентификации подозреваемых после совершения преступления. Во многих случаях модель выбирается на основе теории обнаружения, чтобы попытаться угадать вероятность результата при заданном количестве входных данных, например, при получении электронного письма, определяющего, насколько вероятно, что это спам. Модели могут использовать один или несколько классификаторов, пытаясь определить вероятность принадлежности набора данных к другому набору. Например, модель может быть использована для определения того, является ли электронное письмо спамом или "хамом" (не спамом). В зависимости от границ определения, прогнозное моделирование является синонимом или во многом перекрывает область машинного обучения, как это чаще упоминается в академических или исследовательских и опытно-конструкторских контекстах. При коммерческом использовании прогнозное моделирование часто называют прогнозной аналитикой. Прогнозирующее моделирование часто противопоставляется причинному моделированию/анализу. В первом случае можно полностью удовлетвориться использованием индикаторов или прокси-значений интересующего результата. В последнем случае человек стремится определить истинные причинно-следственные связи. Это различие привело к появлению литературы в области методов исследования и статистики и к общему утверждению, что "корреляция не подразумевает причинно-следственной связи".

Модели

Почти любая статистическая модель может быть использована для целей прогнозирования. В целом, существует два класса прогнозных моделей: параметрические и непараметрические. Третий класс, полупараметрические модели, включает в себя функции обоих. Параметрические модели делают "специфические предположения в отношении одного или нескольких параметров популяции, которые характеризуют основное распределение". Непаметрические модели "обычно включают меньше предположений о структуре и форме распределения [чем параметрические модели], но обычно содержат сильные предположения о независимости".

Моделирование подъема

Моделирование подъема - это метод моделирования изменения вероятности, вызванной действием. Обычно это маркетинговая акция, такая как предложение купить продукт, использовать продукт больше или переподписать контракт. Например, в кампании по удержанию вы хотите предсказать изменение в вероятности того, что клиент останется клиентом, если с ним свяжутся. Модель изменения вероятности позволяет направлять кампанию по удержанию клиентов на тех клиентов, для которых изменение вероятности будет выгодно. Это позволяет программе удержания клиентов избежать нежелательного оттока или ухода клиентов, не тратив деньги на контакты с людьми, которые все равно будут действовать.

Археология

Прогнозирующее моделирование в археологии берет свое начало в работе Гордона Вилли в середине пятидесятых годов в долине Виру в Перу. Были проведены полные, интенсивные обследования, затем была определена соизмерность между культурными остатками и природными особенностями, такими как наклон и растительность. Развитие количественных методов и большая доступность применимых данных привело к росту дисциплины в 1960-х годах, а к концу 1980-х годов крупные управляющие землей во всем мире добились значительного прогресса. В целом, прогнозирующее моделирование в археологии устанавливает статистически обоснованные причинно-следственные или ковариабельные отношения между природными прокси, такими как типы почв, высота, наклон, растительность, близость к воде, геология, геоморфология и т. Д., И наличие археологических особенностей. Благодаря анализу этих количественно измеримых атрибутов земли, которая подверглась археологическому обследованию, иногда "археологическая чувствительность" неисследованных районов может быть предсказана на основе естественных прокси в этих районах. Крупные управляющие землей в Соединенных Штатах, такие как Бюро по управлению землей (BLM), Министерство обороны (DOD) и многочисленные агентства по автомобильным дорогам и паркам, успешно использовали эту стратегию. Используя прогнозирующее моделирование в своих планах управления культурными ресурсами, они способны принимать более обоснованные решения при планировании мероприятий, которые могут потребовать нарушения наземного режима и впоследствии повлиять на археологические памятники.

Управление взаимоотношениями с клиентами

Прогнозирующее моделирование широко используется в аналитическом управлении взаимоотношениями с клиентами и в добыче данных для создания моделей на уровне клиента, которые описывают вероятность того, что клиент предпримет определенные действия. Эти действия обычно связаны с продажами, маркетингом и удержанием клиентов. Например, крупная потребительская организация, такая как оператор мобильной связи, будет иметь набор прогнозных моделей для кросс-продажи продукта, глубокой продажи продукта (или продажи дополнительных товаров) и сброса. Также сейчас более распространено, чтобы такая организация имела модель спасаемости, использующую модель подъема. Это предсказывает вероятность того, что клиент может быть сохранен в конце контрактного периода (изменение вероятности отказа), в отличие от стандартной модели прогнозирования отказа.

Страхование автомобилей

Прогнозирующее моделирование используется в автомобильном страховании для распределения риска инцидентов между страхователями на основе информации, полученной от страхователей. Это широко используется в основанных на использовании страховых решениях, где прогнозные модели используют данные на основе телеметрии для построения модели прогнозного риска для вероятности претензий. Прогнозные модели "черного ящика" используют только GPS или датчики акселерометра. Некоторые модели включают в себя широкий спектр прогнозных данных, выходящих за рамки базовой телеметрии, включая расширенное поведение водителей, независимые записи аварий, историю дорожного движения и профили пользователей для предоставления улучшенных моделей риска.

Здравоохранение

В 2009 году Parkland Health & Hospital System начала анализировать электронные медицинские записи, чтобы использовать прогнозирующее моделирование для выявления пациентов с высоким риском реадмиссии. Первоначально больница сосредоточилась на пациентах с застойной сердечной недостаточностью, но программа расширилась, чтобы включать пациентов с диабетом, острым инфарктом миокарда и пневмонией. В 2018 году Banerjee et al. Предложена модель глубокого обучения для оценки краткосрочной продолжительности жизни (> 3 месяца) пациентов путем анализа свободных текстовых клинических записей в электронной медицинской карте, при сохранении последовательности временных посещений. Модель была обучена на большом наборе данных (10 293 пациента) и проверена на отдельном наборе данных (1818 пациентов). Он достиг площади под кривой ROC (операционная характеристика приемника) 0,89. Для обеспечения объяснительной способности они разработали интерактивный графический инструмент, который может улучшить понимание врачом основы прогнозов модели. Высокая точность и объяснительная способность модели PPES Met может позволить использовать модель в качестве инструмента поддержки принятия решений для персонализации лечения метастатического рака и предоставления ценной помощи врачам. Первые рекомендации по отчетности модели клинического прогнозирования были опубликованы в 2015 году (прозрачная отчетность многовариантной модели прогнозирования для индивидуального прогноза или диагностики (TRIPOD)), и с тех пор были обновлены. Для оценки продолжительности операции использовали прогнозные модели.

Алгоритмическая торговля

Прогнозирующее моделирование в торговле - это процесс моделирования, в котором вероятность результата прогнозируется с использованием набора переменных-предсказателей. Предсказательные модели могут быть построены для различных активов, таких как акции, фьючерсы, валюты, товары и т. д. Предсказательная модель все еще широко используется торговыми фирмами для разработки стратегий и торговли. Он использует математически продвинутое программное обеспечение для оценки показателей цены, объема, открытого процента и других исторических данных, чтобы обнаружить повторяющиеся модели.

Системы слежения за свинцом

Прогнозирующее моделирование дает генераторам лидов преимущество, прогнозируя результаты, основанные на данных, для каждой потенциальной кампании. Этот метод экономит время и выявляет потенциальные слепые точки, чтобы помочь клиенту принимать более разумные решения.

Заметные недостатки прогнозирующего моделирования

Хотя не широко обсуждается в основном сообществе прогнозных моделей, прогнозные моделирования - это методология, которая широко использовалась в финансовой отрасли в прошлом, и некоторые из основных неудач способствовали финансовому кризису 2007-2008 годов. Эти неудачи показывают опасность полагаться исключительно на модели, которые по своей сути отстают в своем развитии. Следующие примеры не являются полным списком: S&P, Moody's и Fitch оценивают вероятность дефолта облигаций с помощью дискретных переменных, называемых рейтингом. Рейтинг может принимать дискретные значения от ААА до D. Рейтинг является предиктором риска дефолта на основе различных переменных, связанных с заемщиком и историческими макроэкономическими данными. Рейтинговые агентства не смогли дать свой рейтинг на рынке облигаций с обеспечением ипотеки (CDO) на сумму 600 миллиардов долларов США. Почти весь сектор AAA (и сектор сверх-AAA, новый рейтинг, предоставленный рейтинговыми агентствами для представления сверхбезопасных инвестиций) рынка CDO в 2008 году потерял свой рейтинг или сильно понизился, многие из которых получили свой рейтинг менее чем за год до этого. До сих пор не было статистических моделей, которые пытались бы предсказать цены на рынке акций на основе исторических данных, которые последовательно делали бы правильные прогнозы в долгосрочной перспективе. Одним из наиболее запоминающихся провалов является Long Term Capital Management, фонд, который нанял высококвалифицированных аналитиков, в том числе лауреата Нобелевской премии по экономическим наукам, для разработки сложной статистической модели, которая предсказывала разрыв цен между различными ценными бумагами. Эти модели приносили впечатляющую прибыль до крупного провала, который заставил тогдашнего председателя Федеральной резервной системы Алана Гринспена вмешаться, чтобы посредничать в плане спасения брокерами Уолл-стрит, чтобы предотвратить крах рынка облигаций.

Возможные фундаментальные ограничения прогнозных моделей, основанных на подходе данных

История не всегда может точно предсказать будущее. Использование отношений, полученных из исторических данных, для прогнозирования будущего, подразумевает наличие определенных постоянных условий или констант в сложной системе. Это почти всегда приводит к некоторой неточности, когда система включает людей. Неизвестные неизвестные - проблема. При сборе данных коллектор сначала определяет набор переменных, для которых собираются данные. Однако, независимо от того, насколько обширным коллектор считает свой выбор переменных, всегда существует возможность новых переменных, которые не были рассмотрены или даже определены, но все же имеют решающее значение для результата. Алгоритмы могут быть побеждены враждебно. После того, как алгоритм становится общепринятым стандартом измерения, его могут использовать люди, которые понимают алгоритм и имеют стимул обманывать или манипулировать результатом. Это то, что произошло с рейтингом CDO, описанным выше. Дилеры CDO активно выполняли ввод рейтинговых агентств, чтобы достичь AAA или супер AAA на CDO, которые они выпускали, умело манипулируя переменными, которые были "неизвестны" для "сложных" моделей рейтинговых агентств.