Кіріспе
Жоғары өнімділік кластерлі файл жүйесі
GPFS (General Parallel File System, brand name IBM Storage Scale and previously IBM Spectrum Scale) is high performance clustered file system software developed by IBM. It can be deployed in shared disk or shared nothing distributed parallel modes, or a combination of these. It is used by many of the world's largest commercial companies, as well as some of the supercomputers on the Top 500 List. For example, it is the filesystem of the Summit
at Oak Ridge National Laboratory which was the #1 fastest supercomputer in the world in the November 2019 TOP500 list of supercomputers. Summit is a 200 Petaflops system composed of more than 9,000 POWER9 processors and 27,000 NVIDIA Volta GPUs. The storage filesystem called Alpine has 250 PB of storage using Spectrum Scale on IBM ESS storage hardware, capable of approximately 2.5 TB/s of sequential I/O and 2.2 TB/s of random I/O. Like typical cluster filesystems, GPFS provides concurrent high speed file access to applications executing on multiple nodes of clusters. It can be used with AIX clusters, Linux clusters, on Microsoft Windows Server, or a heterogeneous cluster of AIX, Linux and Windows nodes running on x86, Power or IBM Z processor architectures. In addition to providing filesystem storage capabilities, it provides tools for management and administration of the GPFS cluster and allows for shared access to file systems from remote clusters.
GPFS (General Parallel File System, тауарлық атауы IBM Storage Scale және бұрын IBM Spectrum Scale) – IBM компаниясы әзірлеген жоғары өнімділік кластерлі файл жүйесі бағдарламалық құралы. Оны ортақ дискілік немесе ортақ ештеңе жоқ, параллель режимдерде немесе олардың комбинациясында орнатуға болады. Оны әлемдегі ең ірі коммерциялық компаниялар, сондай-ақ Top 500 тізіміндегі кейбір суперкомпьютерлер пайдаланады. Мысалы, ол 2019 жылғы қараша айындағы TOP500 суперкомпьютерлер тізімінде әлемдегі ең жылдам суперкомпьютер болып табылған Oak Ridge Ұлттық зертханасындағы Саммит файлдық жүйесі. Саммит – бұл 9000-нан астам POWER9 процессорларынан және 27000 NVIDIA Volta GPU-дан тұратын 200 петафлопс жүйе. Alpine деп аталатын сақтау жүйесінде Spectrum Scale-ді IBM ESS сақтау аппараттық құрылғысында пайдалана отырып, шамамен 2,5 ТБ/с ретті I/O және 2,2 ТБ/с кездейсоқ I/O мүмкіндігі бар 250 ПБ сақтау сыйымдылығы бар. Типикалық кластерлік файл жүйелері сияқты, GPFS кластерлердің бірнеше түйіндерінде іске қосылатын қолданбаларға бір мезгілде жоғары жылдамдықты файлдарға қол жеткізуді қамтамасыз етеді. Ол AIX кластерлерімен, Linux кластерлерімен, Microsoft Windows Server-де немесе x86, Power немесе IBM Z процессор архитектураларында жұмыс істейтін AIX, Linux және Windows түйіндерінің гетерогенді кластерлерімен қолданылуы мүмкін. Файл жүйелерін сақтау мүмкіндіктерін ұсынудан басқа, ол GPFS кластерін басқару және әкімшілдеу үшін құралдарды ұсынады және қашық кластерлерден файлдық жүйелерге ортақ қол жеткізуге мүмкіндік береді.
GPFS (General Parallel File System, brand name IBM Storage Scale and previously IBM Spectrum Scale) is high performance clustered file system software developed by IBM. It can be deployed in shared disk or shared nothing distributed parallel modes, or a combination of these. It is used by many of the world's largest commercial companies, as well as some of the supercomputers on the Top 500 List. For example, it is the filesystem of the Summit
at Oak Ridge National Laboratory which was the #1 fastest supercomputer in the world in the November 2019 TOP500 list of supercomputers. Summit is a 200 Petaflops system composed of more than 9,000 POWER9 processors and 27,000 NVIDIA Volta GPUs. The storage filesystem called Alpine has 250 PB of storage using Spectrum Scale on IBM ESS storage hardware, capable of approximately 2.5 TB/s of sequential I/O and 2.2 TB/s of random I/O. Like typical cluster filesystems, GPFS provides concurrent high speed file access to applications executing on multiple nodes of clusters. It can be used with AIX clusters, Linux clusters, on Microsoft Windows Server, or a heterogeneous cluster of AIX, Linux and Windows nodes running on x86, Power or IBM Z processor architectures. In addition to providing filesystem storage capabilities, it provides tools for management and administration of the GPFS cluster and allows for shared access to file systems from remote clusters.
Тарих
GPFS 1993 жылы IBM Almaden Research Center-дегі ғылыми жоба ретінде Tiger Shark файлдық жүйесі ретінде басталды. Tiger Shark бастапқыда жоғары өнімді мультимедиялық қолданбаларды қолдау үшін жасалған. Бұл жоба ғылыми есептеулер үшін де өте қолайлы болып шықты. Тағы бір түбірі – IBM-нің Vesta файлдық жүйесі, ол 1992 және 1995 жылдар аралығында IBM-нің Томас Дж. Уотсон ғылыми-зерттеу орталығында ғылыми жоба ретінде әзірленген. Vesta параллель I/O жүйелері бар жоғары өнімді мультикомпьютерлерде жұмыс істейтін параллель қолданбалардың қажеттіліктерін қанағаттандыру үшін файлдық бөлу тұжырымын енгізді. Бөлу кезінде файл байттар тізбегі емес, керісінше, параллель қол жетімді бірнеше ажыратылған тізбектер болып табылады. Бөлу файлдық жүйенің I/O түйіндерінің саны мен түрін абстракциялайды және I/O түйіндеріндегі деректердің физикалық таралуына қарамастан, файлдардың әртүрлі логикалық бөлінген көріністерін қамтамасыз етеді. Ажыратылмаған тізбектер параллель қолданбаның жеке процестеріне сәйкес орналастырылған, бұл жүйелік мүмкіндіктерді жақсартуға мүмкіндік береді. Vesta 1994 жылы PIOFS файлдық жүйесі ретінде коммерцияланды, ал 1998 жылы GPFS оны алмастырды. Ескі және жаңа файлдық жүйелердің басты айырмашылығы – GPFS Vesta/PIOFS ұсынған арнайы интерфейсті стандартты Unix API-мен алмастырды: жоғары өнімді параллель I/O-ны қолдауға арналған барлық мүмкіндіктер пайдаланушылардан жасырынып, жүйенің ішкі бөлігінде іске асырылды. GPFS 1998 жылдан бері IBM AIX-те, 2001 жылдан бері Linux-та және 2008 жылдан бері Windows Server-де қолжетімді. Бүгінде оны Top 500 Supercomputing List-ке енген 500 үздік суперкомпьютердің көптеген түрлері қолданады. Іске қосылғаннан бері ол цифрлық медиа, желілік талдау және кеңейтілген файлдық қызметтер сияқты көптеген коммерциялық қолданбалар үшін сәтті пайдаланылды. 2010 жылы IBM GPFS SNC мүмкіндігі бар GPFS нұсқасын көрсетті, мұнда SNC – Shared Nothing Cluster (ортақ ештеңесі жоқ кластер) дегенді білдіреді. Бұл 2012 жылдың желтоқсанында GPFS 3.5 нұсқасымен ресми түрде жарияланды және қазір FPO (File Placement Optimizer – файлды орналастыруды оңтайландырушы) деп аталады. Бұл арнайы серверлерді (мысалы, SAN пайдалану) қажет етудің орнына желіге қосылған серверлер кластерінде жергілікті дискілерді пайдалануға мүмкіндік береді. FPO SAP HANA және DB2 DPF сияқты ортақ ештеңесі жоқ деректер қоры кластерлері сияқты жоғары деректер локалдығы бар жұмыс жүктемелеріне қолайлы және HDFS-ке үйлесімді файлдық жүйе ретінде қолданылуы мүмкін.
(File Placement Optimizer). This allows it to use locally attached disks on a cluster of network connected servers rather than requiring dedicated servers with shared disks (e. g. using a SAN). FPO is suitable for workloads with high data locality such as shared nothing database clusters such as SAP HANA and DB2 DPF, and can be used as a HDFS compatible filesystem.
Hadoop үлестірілген файл жүйесімен салыстырғанда (HDFS)
Hadoop-тың HDFS файлдық жүйесі, тауарлық аппараттық құралдарда – яғни RAID дискілері мен сақтау аймағы желісі (SAN) жоқ деректер орталықтарында, осыған ұқсас немесе одан да көп көлемдегі деректерді сақтау үшін жасалған. HDFS файлдарды блоктарға бөліп, оларды файлдық жүйенің әртүрлі түйіндерінде сақтайды. GPFS толыққанды Posix файлдық жүйесінің семантикасына ие. GPFS өзінің каталогтар индексін және басқа метадеректерді файлдық жүйе арқылы таратады. Ал Hadoop оны Басты және Екінші Наменодаларда сақтайды, яғни барлық индекстік ақпаратты оперативтік жадыда сақтау қажет үлкен серверлерде. GPFS файлдарды кішкентай блоктарға бөледі. Hadoop HDFS 64 МБ немесе одан да үлкен блоктарды қалайды, себебі бұл Наменоданың сақтау талаптарын азайтады. Кішкентай блоктар немесе көптеген кішкентай файлдар файлдық жүйенің индексін тез толтырып жібереді, сондықтан файлдық жүйенің көлемін шектеу қажет.
Ақпараттың өмірлік циклын басқару
Сақтау жинақтары файл жүйесінде дискілерді топтастыруға мүмкіндік береді. Әкімші дискілерді өнімділік, орналасуы немесе сенімділік сипаттамаларына сәйкес топтастыру арқылы сақтау деңгейлерін құра алады. Мысалы, бір жинақ жоғары өнімділік Fibre Channel дискілерінен, ал екіншісі экономикалық SATA жадтан құралуы мүмкін. Файлдар жиынтығы – файл жүйесі атау кеңістігінің тармағы болып табылады және атау кеңістігін кішірек, басқарылатын бөлімдерге бөлуге мүмкіндік береді. Файлдар жиынтығы квоталарды белгілеуге және бастапқы деректерді орналастыру немесе деректерді көшіруді басқару саясатында көрсетуге болатын әкімшілік шекараны қамтамасыз етеді. Бір файлдар жиынтығындағы деректер бір немесе бірнеше сақтау жинағында орналасуы мүмкін. Файл деректерінің орналасуы және олардың көшірілуі пайдаланушы анықтаған саясаттағы ережелерге негізделеді. Пайдаланушы анықтаған саясаттың екі түрі бар: файлды орналастыру және файлды басқару. Файлды орналастыру саясаты файлдар құрылған кезде файл деректерін тиісті сақтау жинағына бағыттайды. Файлды орналастыру ережелері файл атауы, пайдаланушы аты немесе файлдар жиынтығы сияқты атрибуттар бойынша таңдалады. Файлды басқару саясаты файл деректерін жылжытуға, көшіруге немесе файлдарды жоюға мүмкіндік береді. Файлды басқару саясатын каталог құрылымындағы файлдың орнын өзгертпей деректерді бір жинақтан екіншісіне көшіру үшін пайдалануға болады. Файлды басқару ережелері файлдың соңғы қолданылу уақыты, жолының атауы немесе көлемі сияқты атрибуттармен анықталады. Саясатты өңдеу механизмі кеңейтілген және бірнеше түйінде бір уақытта жұмыс істей алады. Бұл басқару саясатын миллиардтаған файлдары бар бір файл жүйесіне қолдануға және бірнеше сағат ішінде аяқтауға мүмкіндік береді.