Введение
Экоинформатика, или экологическая информатика, – это наука об информации в экологии и природоохранной науке. Она объединяет экологические и информационные науки для определения сущностей и природных процессов с помощью языка, понятного как людям, так и компьютерам. Однако это быстро развивающаяся область в экологии, и существуют различные взгляды на то, что представляет собой экоинформатика. В настоящее время существует несколько определений, в основном сосредоточенных на создании инструментов для доступа и анализа данных о природных системах. Однако сфера и цели экоинформатики, безусловно, шире, чем разработка стандартов метаданных для документирования наборов данных. Экоинформатика направлена на содействие экологическим исследованиям и управлению окружающей средой путем разработки способов доступа к базам данных экологической информации, их интеграции и создания новых алгоритмов, позволяющих объединять различные экологические наборы данных для проверки экологических гипотез. Экоинформатика связана с концепцией экосистемных услуг. Экоинформатика характеризует семантику знаний о природных системах. Поэтому значительная часть современных исследований в области экоинформатики связана с разделом информатики, известным как представление знаний, а активные проекты в области экоинформатики развивают связи с такими направлениями, как Семантическая сеть. Текущие инициативы по эффективному управлению, обмену и повторному использованию экологических данных свидетельствуют о растущей важности таких областей, как экоинформатика, для создания основ эффективного управления экологической информацией. Примеры этих инициатив – проекты DataNet Национального научного фонда, DataONE, Data Conservancy и искусственный интеллект для охраны окружающей среды и устойчивого развития. Важно отметить, что этапы планирования, сбора, проверки, описания и сохранения относятся к субъекту сбора данных, которым могут быть отдельные исследователи или крупные сети сбора данных, в то время как этапы обнаружения, интеграции и анализа обычно относятся к отдельному исследователю. Планирование: для проектов в области экоинформатики требуются данные из нескольких баз данных. Каждая база данных содержит различные данные, поэтому исследователям необходимо определить, какие типы экологических или природоохранных данных им понадобятся для ответа на их исследовательский вопрос. Сбор: Данные собираются различными способами. В экоинформатике это обычно ограничивается ручным вводом данных в электронную таблицу и извлечением данных из существующей базы данных. Развитие реляционных баз данных облегчило экологам загрузку соответствующих данных и интеграцию наборов данных. Проверка: Записи данных должны быть тщательно проверены для подтверждения их точности и пригодности, например, для выявления выбросов и ошибочных точек. Тот же принцип применяется к данным, загруженным из наборов данных. Эта ответственность лежит как на экологе, загружающем данные, так и на организации, создающей систему сбора данных. Описание: Точное описание метаданных набора данных, используемого в исследовании, должно содержать достаточно информации для понимания методологии сбора и обработки данных, времени и целей сбора данных, а также способа их хранения. Это важно для воспроизводимости, особенно для проектов, которые опираются друг на друга и могут повторно использовать данные. Сохранение: После сбора данных институциональной организацией они должны быть заархивированы таким образом, чтобы они были легко доступны. В идеале это должно быть в базах данных, которые поддерживаются и не подвергаются риску устаревания. Обнаружение: Хотя существуют хорошие практики для обнаружения данных для начала исследовательского проекта, этот процесс часто затруднен отсутствием полезных опубликованных данных, поскольку исследователи могут собирать данные, специфичные для своего исследования, но не публиковать их для более широкого использования. На этапе сбора данных это можно решить путем улучшения практики обмена данными, например, путем связывания наборов данных при публикации статей или исследований. На этапе получения данных это можно решить путем более точного поиска данных, например, с использованием ключевых слов для поиска соответствующих наборов данных. Интеграция: Объединение наборов данных может быть сложным и трудоемким процессом, в основном из-за методологических различий в сборе данных. Существует несколько подходов к этому, но лучшие практики обычно включают вычислительные подходы, а именно использование R или Python для автоматизации процессов и предотвращения ошибок. Анализ: Анализ данных может принимать различные формы и должен быть адаптирован к конкретному экологическому проекту. Однако все методы анализа данных должны быть хорошо документированы, включая процедуру анализа, обоснование выбранных методов и любые недостатки конкретного подхода.
Assure: Data entries should be checked thoroughly to validate their accuracy and usability, such as to check for outliers and erroneous points. The same principle applies to data downloaded from datasets. This responsibility falls on both the ecologist downloading the data, and the entity that sets up the data collection system. Describe: An accurate description of the metadata of a dataset that is used in a study should include enough information to deduce the data collection and processing methodology, when the data were collected, why the data were collected, and how the data were stored. This is important for reproducibility, especially for projects that build on each other and may recycle data
Preserve: After data is collected by an institutional entity, it should be archived such that it is easily accessible. Ideally, this is in databases that are maintained and not at risk of deprecation
Discover: While there are good practices for discovering data to start a research project, this process is often marred by a lack of usable, published data, as researchers may collect data specific to their study, but may not publish this data for wider use. On the data collection end, this can be addressed by better data sharing practices, such as by linking datasets when publishing papers or studies. On the data procurement end, this can be addressed by more precise data searching, such as using key words to find relevant datasets. Integrate: Synthesizing datasets together can be difficult and labor intensive, largely due to the methodological differences in data collection. There are several approaches to this, but the best practices typically involve computational approaches, namely using R or Python, to automate the processes and prevent errors
Analyze: Data analysis can take several forms, and should be tailored to the specific ecological project. However, all data analysis methods should be well documented, including the procedure for analysis, justification for analysis methods, and any shortcomings in a specific approach.
Экосистема
Экосистемные исследования, по определению, охватывают взаимодействия во всем спектре наук о жизни – от микроскопических биохимических реакций до крупномасштабных геологических явлений. Следовательно, большие базы данных могут быть не разработаны специально для решения конкретной исследовательской задачи, но должны быть достаточно всеобъемлющими, чтобы поддерживать большинство исследований. Поскольку вопросы экосистемного уровня требуют широкого взгляда, проекты, связанные с данными об экосистемах, скорее всего, будут включать данные из нескольких баз данных. Распространенным подходом к включению данных в исследования на уровне экосистем является модель сетевой науки, в которой механизмы сбора данных и ресурсы рассматриваются как большая взаимосвязанная сеть, а не как отдельные сущности. Эта сеть может включать несколько станций сбора данных в пределах одной базы данных или охватывать несколько баз данных. В настоящее время существует несколько крупномасштабных сетей, однако они не генерируют данных в объеме, необходимом для того, чтобы рассматривать экологию как науку о больших данных. Текущая проблема для экоинформатики в экосистемной экологии заключается в том, что основная часть финансирования направляется на генерацию новых данных, а не на поддержание существующих инфраструктур данных. Интеграция данных, полученных в разных пространственных масштабах, также может быть сложной, поскольку каждый набор данных может содержать различные типы информации.
Городская экология
Нынешний акцент на создании умных городов и интеграции сетей датчиков в инфраструктуру делает их важным источником данных для экологических исследований. Типичные вопросы городской экологии касаются влияния урбанизации на местную экосистему и способов стимулирования дальнейшего развития для поддержания городского биоразнообразия. Хотя сети датчиков в городах обычно собирают данные об окружающей среде для оптимизации городских процессов, их также можно использовать для экологических инициатив, особенно для понимания сложных, многоуровневых взаимосвязей между городами и их местной экосистемой. Это также позволяет лучше понять текущее состояние городской среды и выявить возможности для восстановления природных ландшафтов в городах. Например, анализ моделей передвижения может указать на районы, подходящие для создания парков и зеленых зон. Данные наблюдений за птицами могут помочь определить видовой состав птиц на данной территории.
Инфекционные болезни
Как и другие области экологии, возникающие инфекционные заболевания и эпидемиология охватывают различные уровни, от изучения генетики, определяющей динамику заболеваний, до масштабных пространственно-временных анализов. В связи с этим, исследования инфекционных заболеваний могут включать в себя все: от биоинформатики, генетических и аминокислотных последовательностей, до данных экологического мониторинга. На микроуровне эти данные могут быть использованы для прогнозирования заразности/передачливости, лекарственной устойчивости, потенциальных лекарственных препаратов и участков мутаций. На макроуровне они могут применяться для выявления социальных тенденций или факторов окружающей среды, способствующих переходу инфекции к человеку, мест заражения и практик, вызывающих распространение болезни.