Введение
Техника сегментации данных
В компьютерном хранении данных, разделение данных на полосы (striping) — это техника сегментирования логически последовательных данных, таких как файл, таким образом, чтобы последовательные сегменты хранились на разных физических устройствах хранения. Разделение на полосы полезно, когда устройство обработки запрашивает данные быстрее, чем может предоставить одно устройство хранения. Распределяя сегменты по нескольким устройствам, к которым можно получить доступ одновременно, увеличивается общая пропускная способность данных. Это также полезный метод для балансировки нагрузки ввода-вывода на массиве дисков. Разделение на полосы используется в дисковых накопителях в резервированных массивах независимых дисков (RAID), контроллерах сетевых интерфейсов, массивах дисков, различных компьютерах в кластерных файловых системах и распределённых системах хранения, а также в оперативной памяти в некоторых системах.
Метод
Один из методов организации RAID заключается в чередовании последовательных сегментов данных по устройствам хранения в циклическом порядке, начиная с начала последовательности. Этот метод хорошо подходит для потоковой передачи данных, но последующие произвольные обращения потребуют знания о том, на каком устройстве хранится нужный сегмент. Если данные хранятся таким образом, что физическому адресу каждого сегмента данных соответствует конкретное устройство, то устройство для доступа к любому запрошенному сегменту можно определить по адресу, не зная смещения данных в общей последовательности. Могут применяться и другие методы, при которых последовательные сегменты не хранятся на последовательных устройствах. Такое нециклическое чередование может быть полезно в некоторых схемах коррекции ошибок.
Преимущества и недостатки
Преимущества полосатой обработки включают в себя производительность и пропускную способность. Последовательное чередование во времени доступа к данным позволяет кумулятивно умножить меньшую пропускную способность каждого устройства хранения на количество используемых устройств. Увеличенная пропускная способность позволяет устройству обработки данных продолжать работу без прерываний и, следовательно, быстрее завершать процедуры. Это проявляется в повышении производительности обработки данных. Поскольку различные сегменты данных хранятся на разных устройствах хранения, отказ одного устройства приводит к повреждению всей последовательности данных. По сути, вероятность отказа массива устройств хранения равна сумме вероятностей отказа каждого отдельного устройства. Этот недостаток полосатой обработки можно устранить за счет хранения избыточной информации, такой как паритет, для коррекции ошибок. В такой системе устранение недостатка достигается ценой необходимости дополнительного объема памяти.
Терминология
Сегменты последовательных данных, записываемые на диск или считываемые с него перед продолжением операции на следующем диске, обычно называются блоками, шагами или полосными единицами, а их логические группы, формирующие единую полосатую операцию, – полосами. Объем данных в одном блоке (полосной единице), часто измеряемый в байтах, может именоваться как размер блока, размер шага, размер полосы, глубина полосы или длина полосы. Количество дисков данных в массиве иногда называют шириной полосы, но это также может относиться к объему данных внутри полосы. Объем данных в одном шаге, умноженный на количество дисков данных в массиве (то есть глубина полосы, умноженная на ширину полосы, что в геометрической аналогии дает площадь), иногда называют размером полосы или шириной полосы. Широкое полосное распределение происходит, когда блоки данных распределяются по нескольким массивам, возможно, по всем дискам в системе. Узкое полосное распределение происходит, когда блоки данных распределяются по дискам в одном массиве.