Введение

Количества, символы или символы, на которых выполняются операции компьютером В информатике данные (считаются в единственном числе, множественном числе или как массовое существительное) - это любая последовательность одного или нескольких символов; датум - это один символ данных. Данные требуют интерпретации, чтобы стать информацией. Цифровые данные - это данные, которые представлены с использованием двоичной системы чисел единиц (1) и нулей (0), вместо аналогового представления. В современных (после 1960 года) компьютерных системах все данные являются цифровыми. Данные существуют в трех состояниях: данные в состоянии покоя, данные в процессе передачи и данные в использовании. Данные в компьютере, в большинстве случаев, перемещаются как параллельные данные. Данные, перемещающиеся в компьютер или из него, в большинстве случаев перемещаются как последовательные данные. Данные, полученные из аналогового устройства, например, датчика температуры, могут быть преобразованы в цифровые с помощью преобразователя аналого-цифрового. Данные, представляющие величины, символы или символы, с которыми выполняются операции компьютером, хранятся и записываются на магнитных, оптических, электронных или механических носителях записи и передаются в виде цифровых электрических или оптических сигналов. Данные поступают и выходят из компьютеров через периферийные устройства. Физические элементы памяти компьютера состоят из адреса и байта/слова хранения данных. Цифровые данные часто хранятся в реляционных базах данных, таких как таблицы или базы данных SQL, и обычно могут быть представлены как абстрактные пары ключей / значений. Данные могут быть организованы во многих различных типах структур данных, включая массивы, графики и объекты. Структуры данных могут хранить данные многих различных типов, включая числа, строки и даже другие структуры данных.

Характеристики

Метаданные помогают преобразовать данные в информацию. Метаданные - это данные о данных. Метаданные могут быть подразумеваемыми, указанными или приведенными. Данные, относящиеся к физическим событиям или процессам, будут иметь временную составляющую. Это временная составляющая может быть подразумевается. Это происходит, когда устройство, такое как регистратор температуры, получает данные от датчика температуры. Когда температура принимается, предполагается, что данные имеют временную ссылку на сейчас. Так что устройство записывает дату, время и температуру вместе. Когда регистратор данных сообщает о температуре, он также должен сообщать дату и время в виде метаданных для каждого показания температуры. В основном компьютеры следуют последовательности инструкций, которые даются им в виде данных. Набор инструкций для выполнения данной задачи (или задач) называется программой. Программа - это данные в виде закодированных инструкций для управления работой компьютера или другой машины. В номинальном случае программа, выполняемая компьютером, будет состоять из машинного кода. Элементы хранения, которыми манипулирует программа, но которые фактически не выполняются центральным процессором (CPU), также являются данными. В самом важном случае, единый датчик - это значение, хранящееся в определенном месте. Поэтому компьютерные программы могут работать на других компьютерных программах, манипулируя их программными данными. Чтобы хранить байты данных в файле, они должны быть сериализированы в формате файла. Обычно программы хранятся в специальных типах файлов, отличных от тех, которые используются для других данных. Исполняемые файлы содержат программы; все другие файлы также являются файлами данных. Однако исполняемые файлы могут также содержать данные, используемые программой, которые встроены в программу. В частности, некоторые исполняемые файлы имеют сегмент данных, который номинально содержит константы и начальные значения переменных, оба из которых могут считаться данными. Граница между программой и данными может стать размытой. Например, переводчик - это программа. Входные данные для интерпретатора сами по себе являются программой, но не выраженной в языке машины. Во многих случаях интерпретируемой программой будет текстовый файл, читаемый человеком, который манипулируется с помощью программы текстового редактора. Метапрограммирование также включает в себя программы, манипулирующие другими программами в качестве данных. Программы, такие как компиляторы, ссылочные, отладчики, обновляющие программы, вирусосканеры и т. Д., Используют другие программы в качестве своих данных. Например, пользователь может сначала дать операционной системе инструкцию загрузить программу текстового процессора из одного файла, а затем использовать запущенную программу для открытия и редактирования документа, хранящегося в другом файле. В этом примере документ будет считаться данными. Если в текстовом процессоре также есть проверка орфографии, то словарь (список слов) для проверки орфографии также будет считаться данными. Алгоритмы, используемые проверяющим правописание, чтобы предложить исправления, будут либо данными машинного кода, либо текстом на каком-то интерпретируемом языке программирования. В альтернативном использовании двоичные файлы (которые не читаются человеком) иногда называются данными, в отличие от текста, читаемого человеком. Общий объем цифровых данных в 2007 году оценивался в 281 миллиард гигабайт (281 эксабайт).

ОЗУ

Память случайного доступа (RAM) содержит данные, к которым CPU имеет прямой доступ. Процессор может манипулировать данными только в пределах своих регистров процессора или памяти. Это в отличие от хранения данных, где процессор должен направлять передачу данных между устройством хранения (диском, лентой) и памятью. RAM - это массив линейных соседних местоположений, которые процессор может читать или записывать, предоставляя адрес для операции чтения или записи. Процессор может работать в любом месте в памяти в любое время в любом порядке. В оперативной памяти наименьший элемент данных - бинарный бит. Возможности и ограничения доступа к оперативной памяти специфичны для процессора. В общем, основная память расположена как массив местоположений, начинающийся с адреса 0 (гексадецимальный 0). Каждое место может хранить обычно 8 или 32 бита в зависимости от архитектуры компьютера.

Ключи

Ключи данных не обязательно должны быть прямым аппаратным адресом в памяти. Коды косвенных, абстрактных и логических ключей могут храниться в сочетании с значениями для формирования структуры данных. Структуры данных имеют предопределенные смещения (или ссылки или пути) с начала структуры, в которых хранятся значения данных. Таким образом, ключ данных состоит из ключа к структуре плюс смещение (или ссылки или пути) в структуру. Когда такая структура повторяется, сохраняя изменения значений данных и ключей данных в рамках одной и той же повторяющейся структуры, результат можно рассматривать как таблицу, в которой каждый элемент повторяющейся структуры считается столбцом, а каждое повторение структуры считается строкой таблицы. В такой организации данных ключ данных обычно представляет собой значение в одном (или совокупности значений в нескольких) столбцах.

Организованные периодические структуры данных

Табличный вид повторяющихся структур данных - лишь одна из многих возможностей. Повторяющиеся структуры данных могут быть организованы иерархически, так что узлы связаны друг с другом в каскаде родительских-детских отношений. Значения и потенциально более сложные структуры данных связаны с узлами. Таким образом, узелочная иерархия обеспечивает ключ для обращения к структурам данных, связанным с узлами. Это представление можно рассматривать как перевернутое дерево. Общим примером являются современные файловые системы операционных систем компьютеров, а XML - еще один.

Сортированные или упорядоченные данные

Данные имеют некоторые присущие им особенности, когда они сортируются по ключу. Все значения для подмножеств ключа отображаются вместе. При последовательном прохождении групп данных с одним и тем же ключом или подмножеством ключевых изменений это называется в кругах обработки данных перерывом или контрольным перерывом. Это особенно облегчает агрегацию значений данных на подмножествах ключа.

Периферическое хранение

До появления объемной нелетучей памяти, такой как флэш, постоянное хранение данных традиционно достигалось путем записи данных на внешние блок-устройства, такие как магнитная лента и дисковые накопители. Эти устройства обычно ищут местоположение на магнитных носителях, а затем читают или записывают блоки данных заранее определенного размера. В этом случае местоположение поиска на носителе является ключом данных, а блоки являются значениями данных. Ранние файловые системы с необработанными дисками или дисковые операционные системы зарезервировали соседствующие блоки на дисковом накопителе для файлов данных. В этих системах файлы могли быть заполнены, исчерпав пространство для данных до того, как все данные были записаны в них. Таким образом, большое количество неиспользуемого пространства для данных было зарезервировано непродуктивно, чтобы обеспечить достаточно свободного пространства для каждого файла. Позже файловые системы ввели разделы. Они зарезервировали блоки дискового пространства для данных на разделах и использовали выделенные блоки более экономично, динамически присваивая блоки раздела файлу по мере необходимости. Для этого файловая система должна была отслеживать, какие блоки были использованы или неиспользованы файлами данных в каталоге или таблице распределения файлов. Хотя это позволило лучше использовать пространство данных на диске, это привело к фрагментации файлов на диске и сопутствующей нагрузке на производительность из-за дополнительного времени поиска для чтения данных. Современные файловые системы реорганизуют фрагментированные файлы динамически, чтобы оптимизировать время доступа к файлам. Дальнейшее развитие файловых систем привело к виртуализации дисковых накопителей, т. е. где логический накопитель может быть определен как разделы из ряда физических накопителей.

Индексированные данные

Получение небольшого подмножества данных из гораздо более крупного набора может подразумевать неэффективное последовательное поиск данных. Индексы - это способ копирования ключей и адресов местоположения из структур данных в файлах, таблицах и наборах данных, а затем их организации с использованием инвертированных деревянных структур для сокращения времени, необходимого для извлечения подмножества исходных данных. Для этого ключ подмножества данных, подлежащих извлечению, должен быть известен до начала извлечения. Наиболее популярными индексами являются дерево B и динамические методы индексации хеш-ключа. Индексирование - это накладные расходы на хранение и извлечение данных. Существуют и другие способы организации индексов, например, сортировка ключей и использование алгоритма бинарного поиска.

Данные базы данных

Появление баз данных привело к созданию дополнительного слоя абстракции для постоянного хранения данных. Базы данных используют метаданные и структурированный язык запросов между клиентскими и серверными системами, общаясь через компьютерную сеть, используя двухфазную систему регистрации транзакций для обеспечения полноты транзакций при сохранении данных.

Параллельная распределенная обработка данных

Современные масштабируемые и высокопроизводительные технологии сохранения данных, такие как Apache Hadoop, полагаются на массивно параллельную распределенную обработку данных на многих обычных компьютерах в сети с высокой пропускной способностью. В таких системах данные распределяются между несколькими компьютерами, и поэтому любой конкретный компьютер в системе должен быть представлен в ключе данных, либо непосредственно, либо косвенно. Это позволяет различать два идентичных набора данных, каждый из которых обрабатывается на разных компьютерах одновременно.