Введение
Качество данных относится к состоянию качественной или количественной информации. Существует множество определений качества данных, но данные обычно считаются высококачественными, если они "пригодны для предполагаемых целей в операционной деятельности, принятии решений и планировании". Более того, данные считаются высококачественными, если они корректно отражают реальный объект или явление, которому они соответствуют. Помимо этих определений, с ростом числа источников данных возрастает важность внутренней согласованности данных, независимо от их пригодности для конкретных внешних целей. Мнения людей о качестве данных могут часто различаться, даже при обсуждении одного и того же набора данных, используемого для одной и той же цели. В таких случаях управление данными используется для выработки согласованных определений и стандартов качества данных. Для обеспечения качества данных может потребоваться очистка данных, включая стандартизацию.
Data quality refers to the state of qualitative or quantitative pieces of information. There are many definitions of data quality, but data is generally considered high quality if it is "fit for [its] intended uses in operations, decision making and planning". Moreover, data is deemed of high quality if it correctly represents the real world construct to which it refers. Furthermore, apart from these definitions, as the number of data sources increases, the question of internal data consistency becomes significant, regardless of fitness for use for any particular external purpose. People's views on data quality can often be in disagreement, even when discussing the same set of data used for the same purpose. When this is the case, data governance is used to form agreed upon definitions and standards for data quality. In such cases, data cleansing, including standardization, may be required in order to ensure data quality.
История
До появления недорогих компьютерных носителей данных, огромные мэйнфреймы использовались для хранения данных об именах и адресах служб доставки. Это было необходимо для правильной маршрутизации почты по назначению. Мэйнфреймы использовали бизнес-правила для исправления распространенных орфографических и опечаток в данных об именах и адресах, а также для отслеживания клиентов, которые переехали, умерли, были заключены в тюрьму, поженились, развелись или столкнулись с другими жизненными изменениями. Государственные учреждения начали предоставлять почтовые данные нескольким сервисным компаниям для сопоставления с данными клиентов и Национальным реестром изменений адресов (NCOA). Эта технология позволила крупным компаниям сэкономить миллионы долларов по сравнению с ручной коррекцией данных клиентов. Крупные компании экономили на почтовых расходах, поскольку счета и рекламные материалы точнее достигали целевых клиентов. Изначально предлагаемое как услуга, обеспечение качества данных переместилось внутрь корпораций с появлением недорогих и мощных серверных технологий. Компании, ориентированные на маркетинг, часто сосредотачивали свои усилия по обеспечению качества на информации об именах и адресах, но качество данных признается важным свойством для всех типов данных. Принципы качества данных могут применяться к данным цепочки поставок, транзакционным данным и практически к любой другой категории данных. Например, приведение данных цепочки поставок в соответствие с определенным стандартом приносит организации пользу: 1) предотвращение избыточного запаса схожих, но немного отличающихся товаров; 2) предотвращение ложных показаний отсутствия товара на складе; 3) улучшение понимания закупок у поставщиков для получения скидок за объем; и 4) снижение логистических затрат на хранение и доставку деталей в крупной организации. Для компаний, ведущих значительные исследовательские работы, качество данных может включать разработку протоколов для исследовательских методов, снижение погрешности измерений, проверку границ данных, перекрестную табуляцию, моделирование и выявление выбросов, проверку целостности данных и т.д.
Обеспечение качества данных
Обеспечение качества данных — это процесс профилирования данных для выявления несоответствий и других аномалий, а также выполнение операций по очистке данных (например, удаление выбросов, интерполяция пропущенных значений) для повышения качества данных. Эти операции могут выполняться в рамках создания хранилища данных или в рамках администрирования базы данных существующего прикладного программного обеспечения.
Безопасность и конфиденциальность медицинских данных
Использование мобильных устройств в здравоохранении, или mHealth, создает новые вызовы для безопасности и конфиденциальности данных о здоровье, что напрямую сказывается на качестве этих данных. Мобильные телефоны и планшеты используются для сбора, передачи и анализа данных практически в реальном времени. Однако эти устройства часто используются и в личных целях, что делает их более уязвимыми к угрозам безопасности и потенциальным утечкам данных. Без надлежащих мер защиты такое личное использование может подвергнуть риску качество, безопасность и конфиденциальность данных о здоровье.
Качество данных в области общественного здравоохранения
В последние годы качество данных стало одним из ключевых приоритетов программ в области общественного здравоохранения, особенно в связи с растущими требованиями к подотчетности. Работа над достижением амбициозных целей в борьбе с такими заболеваниями, как СПИД, туберкулез и малярия, должна опираться на надежные системы мониторинга и оценки, которые генерируют качественные данные о реализации программ. Эти программы и аудиторы все чаще нуждаются в инструментах для стандартизации и упрощения процесса определения качества данных, верификации качества предоставляемых данных и оценки базовых систем управления данными и отчетности по показателям. Примером является инструмент оценки качества данных, разработанный ВОЗ и MEASURE Evaluation. ВОЗ, Глобальный фонд, GAVI и MEASURE Evaluation совместно работают над созданием согласованного подхода к обеспечению качества данных в различных областях и программах.
Качество открытых данных
Существует ряд научных работ, посвященных анализу качества данных в открытых источниках, таких как Википедия, Викиданные, DBpedia и другие. В случае Википедии, анализ качества может относиться как ко всей статье в целом. Моделирование качества осуществляется различными методами. Некоторые из них используют алгоритмы машинного обучения, включая Random Forest, Support Vector Machine и другие. Методы оценки качества данных в Викиданных, DBpedia и других источниках связанных данных (LOD) отличаются.
ECCMA (Ассоциация по управлению кодами электронной коммерции)
Ассоциация по управлению кодами электронной коммерции (ECCMA) – это международная некоммерческая ассоциация, основанная на членстве, деятельность которой направлена на повышение качества данных посредством внедрения международных стандартов. ECCMA в настоящее время является руководителем проектов по разработке стандартов ISO 8000 и ISO 22745, являющихся международными стандартами для качества данных и обмена основными данными о материалах и услугах, соответственно. ECCMA предоставляет платформу для сотрудничества между ведущими экспертами в области качества данных и управления данными по всему миру с целью создания и поддержания глобальных открытых стандартных словарей, используемых для однозначной идентификации информации. Наличие этих словарей терминов позволяет передавать информацию между компьютерными системами без потери ее смысла.