Ағылшыншамен салыстырыңыз: абзацты басыңыз — түпнұсқа терезеде ашылады. Абзац астындағы EN түймесі оны мәтін ішінде көрсетеді.
Мазмұны
Кіріспе
Локстеп жүйелері – бір уақытта бірдей операцияларды параллель түрде орындайтын, қателерге төзімді компьютерлік жүйелер. Дубликация (қайталану) қателерді анықтау және түзетуге мүмкіндік береді: егер кем дегенде екі жүйе болса (қос модульді дубликация), қате пайда болды ма жоқ па, оны анықтау үшін локстеп операцияларының нәтижелерін салыстыруға болады, ал егер кем дегенде үш жүйе болса (үш модульді дубликация), қате көпшілік дауыс беру арқылы автоматты түрде түзетілуі мүмкін. "Локстеп" термині әскери қолданыстан шыққан, онда ол синхронды жүруді білдіреді, яғни қадамдар физикалық мүмкіндік шегінде бірге жүреді. Локстеп режимінде жұмыс істеу үшін әрбір жүйе бір анықталған күйден келесі анықталған күйге өтуге бапталады. Жүйеге жаңа деректер келгенде, ол оларды өңдеп, жаңа нәтижелер шығарады және күйін жаңартады. Осы өзгерістер жиынтығы (жаңа деректер, жаңа нәтижелер, жаңа күй) бір қадамды құрайды деп есептеледі және оны атомдық транзакция ретінде қарастыру керек; яғни, барлығы бірдей орындалады немесе ештеңе орындалмайды, аралық жағдай болмайды. Кейде жүйелер арасында уақыт серпілісі (кешігу) орнатылады, бұл сыртқы факторлардың (мысалы, кернеудің өсуі, иондаушы сәулелену немесе тікелей инженерия) салдарынан туындаған қателерді анықтау мүмкіндігін арттырады.
Lockstep systems are fault tolerant computer systems that run the same set of operations at the same time in parallel. The redundancy (duplication) allows error detection and error correction: the output from lockstep operations can be compared to determine if there has been a fault if there are at least two systems (dual modular redundancy), and the error can be automatically corrected if there are at least three systems (triple modular redundancy), via majority vote. The term "lockstep" originates from army usage, where it refers to synchronized walking, in which marchers walk as closely together as physically practical. To run in lockstep, each system is set up to progress from one well defined state to the next well defined state. When a new set of inputs reaches the system, it processes them, generates new outputs and updates its state. This set of changes (new inputs, new outputs, new state) is considered to define that step, and must be treated as an atomic transaction; in other words, either all of it happens, or none of it happens, but not something in between. Sometimes a timeshift (delay) is set between systems, which increases the detection probability of errors induced by external influences (e. g. voltage spikes, ionizing radiation, or in situ reverse engineering).
Локстеп жады
Кейбір өндірушілер, Intel сияқты, lockstep жады терминін көп арналы жад құрылымын сипаттау үшін қолданады, онда кэш жолдары екі жад арнасы арасында бөлінеді, сондықтан кэш жолының жартысы бірінші арнадағы DIMM-де, ал екінші жартысы екінші арнадағы DIMM-де сақталады. Екі ECC-қосылған DIMM-нің бір қателікті түзету және екі қателікті анықтау (SECDED) мүмкіндіктерін lockstep құрылымында біріктіру арқылы, олардың бір чиптегі деректерді түзету (SDDC) қасиетін екі чиптегі деректерді түзетуге (DDDC) дейін кеңейтуге болады, бұл кез келген бір жад чипінің бұзылуынан қорғайды. Intel-дің lockstep жады құрылымының кемшіліктері – пайдаланылатын RAM мөлшерінің азаюы (үш арналы жад құрылымында жадтың максималды көлемі физикалық түрде қол жетімді максималдың үштен бір бөлігіне дейін төмендейді) және жад подсистемасының өнімділігінің төмендеуі.
Some vendors, including Intel, use the term lockstep memory to describe a multi channel memory layout in which cache lines are distributed between two memory channels, so one half of the cache line is stored in a DIMM on the first channel, while the second half goes to a DIMM on the second channel. By combining the single error correction and double error detection (SECDED) capabilities of two ECC enabled DIMMs in a lockstep layout, their single device data correction (SDDC) nature can be extended into double device data correction (DDDC), providing protection against the failure of any single memory chip. Downsides of the Intel's lockstep memory layout are the reduction of effectively usable amount of RAM (in case of a triple channel memory layout, maximum amount of memory reduces to one third of the physically available maximum), and reduced performance of the memory subsystem.
Екі модульді артық
Егер есептеу жүйелері дубликатталған болса, бірақ екеуі де әр қадамды белсенді түрде өңдейтін болса, қадамның соңында олардың нәтижелері әртүрлі болған жағдайда, араларында шешім қабылдау қиынға түседі. Осы себепті, DMR жүйелерін "басшы/құл" конфигурациясы түрінде, құл "қосалқы режимде" басшыға көмектеседі, синхронды жұмыс істеуге қарағанда осылай жұмыс істеу кең таралған. Құл бірлігінің әр қадамды белсенді түрде өңдеуінің қажеттілігі болмағандықтан, басшы әр қадамның өңделуі аяқталғаннан кейін өзінің күйін құлға көшіру – жиі қолданылатын тәсіл. Егер басшы қандай да бір уақытта істен шықса, құл бұрынғы белгілі жақсы қадамнан жұмысты жалғастыруға дайын болады. Lockstep немесе DMR тәсілі (басшыдағы қателерді анықтау құралдарымен бірге қолданылғанда) басшыдағы аппараттық ақауларға қарсы қорғаныс ұсынуға мүмкіндік береді, бірақ олар бағдарламалық қателерден қорғамайды. Егер басшы бағдарламалық қатеге байланысты істен шықса, құл сәтсіз аяқталған қадамды қайта орындауға тырысқанда, сол қатені қайталап, сол сияқты істен шығуы әбден мүмкін, бұл – жалпы түбірден туындаған қателіктің мысалы.
Where the computing systems are duplicated, but both actively process each step, it is difficult to arbitrate between them if their outputs differ at the end of a step. For this reason, it is common practice to run DMR systems as "master/slave" configurations with the slave as a "hot standby" to the master, rather than in lockstep. Since there is no advantage in having the slave unit actively process each step, a common method of working is for the master to copy its state at the end of each step's processing to the slave. Should the master fail at some point, the slave is ready to continue from the previous known good step. While either the lockstep or the DMR approach (when combined with some means of detecting errors in the master) can provide redundancy against hardware failure in the master, they do not protect against software error. If the master fails because of a software error, it is highly likely that the slave in attempting to repeat the execution of the step which failed will simply repeat the same error and fail in the same way, an example of a common mode failure.
Үш модульді артық
Егер есептеу жүйелері үш рет қайталанса, оларды "дауыс беру" жүйелері ретінде қарастыру мүмкін болады. Егер бір құрылғының нәтижесі қалған екеуінен өзгеше болса, ол бұзылған деп анықталады. Қалған екеуінің сәйкес нәтижесі дұрыс деп есептеледі.
Where the computing systems are triplicated, it becomes possible to treat them as "voting" systems. If one unit's output disagrees with the other two, it is detected as having failed. The matched output from the other two is treated as correct.