Введение
Классификация данных — это процесс организации данных в категории на основе их атрибутов, например, типа файла, содержимого или других метаданных. Данным присваиваются классы, описывающие набор атрибутов, характерных для соответствующих наборов данных. Цель состоит в том, чтобы придать осмысленную структуру необработанной неструктурированной информации. Анализ больших данных показал, насколько важна классификация данных для современных организаций. В сфере управления данными классификация данных, как часть процесса управления жизненным циклом информации (ILM), может быть определена как инструмент категоризации данных, позволяющий организациям эффективно отвечать на следующие вопросы: какие типы данных имеются в наличии? Какой уровень конфиденциальности требуется? Где в настоящее время хранятся данные? Какие уровни доступа реализованы? Какой уровень защиты внедрен и соответствует ли он требованиям нормативных документов? Как правило, классификация данных рассматривается как набор меток, используемых для определения типа данных, особенно в отношении конфиденциальности и целостности. При внедрении она служит связующим звеном между ИТ-специалистами и владельцами процессов или приложений. ИТ-специалисты получают информацию о ценности данных, а руководство (обычно владельцы приложений) лучше понимает, какая часть инфраструктуры требует инвестиций для обеспечения эффективной работы. Это особенно важно для управления рисками, юридических расследований и соблюдения государственных нормативных требований. Классификация данных обычно выполняется вручную, однако существует множество инструментов от различных поставщиков, которые могут помочь в сборе информации о данных. При классификации данных необходимо учитывать следующее:
What data types are available? What level of sensitivity is needed? Where is the data currently stored? What access levels are implemented? What protection level is implemented and does it adhere to compliance regulations? Typically, data classification is viewed as a multitude of label that are used to define the type of data, especially on confidentiality and integrity issues. When implemented, it provides a bridge between IT professionals and process or application owners. IT staff are informed about the value of data, and management (usually application owners) better understand which part of the data center needs investment to keep operations running effectively. This can be particularly important in risk management, legal discovery, and compliance with government regulations. Data classification is typically a manual process; however, there are many tools from different vendors that can help gather information about the data. Data classification needs to take into account the following:
Нормативные требования
Стратегическую или коммерческую ценность
Политики, специфичные для организации
Этические и вопросы конфиденциальности
Договорные соглашения
Strategic or proprietary worth
Organization specific policies
Ethical and privacy considerations
Contractual agreements
Необходимо учитывать уровни конфиденциальности данных.
Основные критерии классификации полуструктурированных или полиструктурированных данных
Временные критерии – самые простые и наиболее часто используемые, при которых различные типы данных оцениваются по времени создания, времени доступа, времени обновления и т.п. Критерии метаданных, такие как тип, имя, владелец, местоположение и т.д., могут использоваться для создания более продвинутой политики классификации. Критерии содержания, включающие использование продвинутых алгоритмов классификации контента, представляют собой наиболее сложные формы классификации неструктурированных данных. Следует отметить, что любой из этих критериев также может применяться к табличным или реляционным данным как "базовые критерии". Эти критерии зависят от конкретного приложения, а не являются неотъемлемыми характеристиками формы представления данных.
Подходы к классификации бизнес-данных
Существует три различных подхода к классификации данных в бизнес-среде, и каждый из этих методов – классификация на бумажных носителях, автоматизированная классификация и классификация, определяемая пользователем (или применяемая пользователем) – имеет свои преимущества и недостатки.
Политика классификации на бумажном носителе
Политика классификации корпоративных данных определяет, как сотрудники должны обращаться с различными типами данных, с которыми они работают, в соответствии с общей политикой и стратегией информационной безопасности организации. Хорошо сформулированная политика позволит пользователям быстро и интуитивно оценивать ценность информации и определять соответствующие правила обработки, например, кто имеет право доступа к данным и следует ли применять шаблон управления правами. Основная сложность, при отсутствии вспомогательных технологий, заключается в обеспечении осведомленности всех сотрудников о политике и ее правильном применении.
Политика автоматизированной классификации
Этот метод исключает участие пользователей, обеспечивая последовательное применение политики классификации во всех точках взаимодействия, без необходимости проведения масштабных коммуникационных и обучающих программ. Классификация осуществляется решениями, использующими программные алгоритмы, основанные на ключевых словах или фразах в содержимом для его анализа и классификации. Этот подход особенно эффективен в тех случаях, когда определенные типы данных создаются без участия пользователя – например, отчеты, генерируемые ERP-системами, – или когда данные содержат конкретную личную информацию, которую легко идентифицировать, такую как реквизиты кредитных карт. Однако автоматизированные решения не учитывают контекст и поэтому подвержены неточностям, выдавая ложноположительные результаты, которые могут вызывать недовольство пользователей и затруднять бизнес-процессы, а также ложноотрицательные ошибки, подвергающие организации риску утечки конфиденциальных данных.
Политика классификации, определяемая пользователями
Процесс классификации данных может быть полностью автоматизирован, но он наиболее эффективен, когда пользователь играет ключевую роль. Метод классификации, инициируемый пользователем, возлагает на сотрудников ответственность за определение подходящей метки и ее применение с помощью программного инструмента при создании, редактировании, отправке или сохранении данных. Преимущество вовлечения пользователя в процесс заключается в том, что его понимание контекста, деловой ценности и конфиденциальности данных позволяет ему принимать обоснованные и точные решения о выборе метки. Классификация, инициируемая пользователем, является дополнительным уровнем защиты, часто используемым в сочетании с автоматической классификацией. Вовлечение пользователей в классификацию также приносит дополнительные организационные преимущества, такие как повышение осведомленности о безопасности, улучшение корпоративной культуры и возможность мониторинга поведения пользователей, что облегчает отчетность и подтверждает соответствие требованиям. Кроме того, руководители могут использовать эти данные о поведении для выявления потенциальных внутренних угроз и устранения проблем путем предоставления пользователям дополнительных инструкций, например, посредством дополнительного обучения или ужесточения политик.