Введение

Data farming - это процесс использования разработанных вычислительных экспериментов для "расти" данных, которые затем могут быть проанализированы с использованием статистических и визуализационных методов для получения представления о сложных системах. Эти методы могут быть применены к любой вычислительной модели. Обработка данных отличается от добычи данных, о чем свидетельствуют следующие метафоры: шахтеры ищут ценные наггетсы руды, закопанные в земле, но не имеют контроля над тем, что там есть, или насколько сложно извлечь наггетсы из их окружения. Аналогичным образом, исследователи данных стремятся найти ценные кубики информации, скрытые в огромных объемах данных. Методы добычи данных используют статистические и графические меры, чтобы попытаться определить интересные корреляции или кластеры в наборе данных. Фермеры обрабатывают землю, чтобы получить максимальный урожай. Они манипулируют окружающей средой в свою пользу, используя ирригацию, борьбу с вредителями, смена посевов, удобрения и многое другое. Эксперименты, проведенные в небольших масштабах, позволяют определить эффективность этих методов лечения. Аналогичным образом, фермеры данных манипулируют имитационными моделями в свою пользу, используя масштабные эксперименты для выращивания данных из своих моделей таким образом, чтобы легко извлечь полезную информацию. результаты могут выявить корневые причинно-следственные связи между факторами входа модели и ответами модели, а также богатые графические и статистические представления об этих отношениях. Целевая группа НАТО по моделированию и моделированию задокументировала процесс обработки данных в Заключительном докладе MSG 088. Здесь, Data Farming использует совместные процессы в сочетании быстрого прототипирования сценария, моделирования моделирования, проектирования экспериментов, высокопроизводительных вычислений, а также анализа и визуализации в итеративном цикле циклов.

История

Наука о проектировании экспериментов (DOE) существует уже более века, ее первопроходцем был Р. А. Фишер для сельскохозяйственных исследований. Многие классические экспериментальные конструкции могут использоваться в симуляционных исследованиях. Однако у вычислительных экспериментов гораздо меньше ограничений, чем у реальных экспериментов, с точки зрения затрат, количества факторов, требуемого времени, способности к репликации, способности к автоматизации и т. Д. Следовательно, необходима структура, специально ориентированная на крупномасштабные симуляционные эксперименты. Люди проводили вычислительные эксперименты с тех пор, как появились компьютеры. Термин "ферма данных" является более поздним, он был придуман в 1998 году в связи с проектом Marine Corp's Project Albert, в котором были созданы модели дистилляции на основе малых агентов (тип стохастического моделирования) для захвата конкретных военных проблем. Эти модели были запущены тысячи или миллионы раз в Мауи высокопроизводительный компьютерный центр и другие объекты. Аналитики проекта Альберт будут работать с военными экспертами по теме, чтобы усовершенствовать модели и интерпретировать результаты. Первоначально использование полнофакториальных (сетевых) конструкций с применением грубой силы означало, что моделирование должно было выполняться очень быстро, а исследования требовали высокопроизводительных вычислений. Тем не менее, только небольшое количество факторов (на ограниченном количестве уровней) можно было исследовать из-за проклятия размерности. Центр SEED по обработке данных в Военно-морской аспирантуре также тесно сотрудничал с Project Albert в создании моделей, анализе выводов и создании новых экспериментальных конструкций для лучшего использования вычислительных возможностей на Мауи и других объектах. Недавние прорывы в разработке конструкций, специально разработанных для обработки данных, можно найти в других областях.

Семинары

Серия международных семинаров по обработке данных проводится с 1998 года Центром обработки данных SEED. Первый Международный семинар по обработке данных был проведен в 1991 году, и с тех пор было проведено еще 16 семинаров. На семинарах присутствовали представители самых разных стран, таких как Канада, Сингапур, Мексика, Турция и Соединенные Штаты. Международные семинары по обработке данных работают в сотрудничестве между различными группами экспертов. В последнем семинаре, который состоялся в 2008 году, приняли участие более 100 команд. Командам фермеров данных отведена определенная область изучения, например, робототехника, внутренняя безопасность и помощь при стихийных бедствиях. Различные формы обработки данных экспериментируются и используются каждой группой, например, ПМБ Пифагора, модель командования боевыми операциями логистики и модель эффектора датчиков на основе агентов (ABSEM).