# Устранение отказов и восстановление работоспособности компонентов систем защиты информации автоматизированных систем Отказ – это случайное событие, заключающееся в нарушении работоспособности системы. Кроме того, отказ автоматической системы определяется как выход параметра за границы установленного допуска. 1. Классификация отказов по характеру изменения параметра Исходя из характера изменения параметра, целесообразно разделить отказы приборов и элементов на внезапные и постепенные. Такое деление удобно при расчете безотказности системы, поскольку внезапный отказ вызывается как отказом элементов принципиальной схемы, так и отказом конструктивных и вспомогательных элементов. Для большинства систем и приборов постепенный отказ определяется лишь изменением параметров принципиальной и кинематической схем. Внезапные отказы: при их появлении нерезервированная система не может выполнять предназначаемые функции. Постепенные отказы: небольшие отклонения параметра за границу допусков обычно приводят не к отказу системы, а лишь к изменению ее эффективности (в зависимости от величины отклонения параметра прибора за границу допуска). При оценке безотказности системы в случае постепенных отказов влияние величины отклонения параметра системы за границу допуска можно характеризовать эффективностью параметра системы. При таком делении отказов элементов на внезапные и постепенные можно считать, что: отсутствие внезапного отказа свидетельствует о прочности элемента; постепенное изменение параметра свидетельствует о его точности. Следовательно, отсутствие обоих отказов может быть интерпретировано как условная прочность. Для фиксированного интервала времени работы системы безотказность представляет собой вероятность совместного осуществления двух событий, у которых отсутствуют внезапные и постепенные отказы. 2. Особенности отказов приборов с источниками энергии Приборы, содержащие источники энергии, а также элементы, коммутирующие энергию, характеризуются такими видами внезапных отказов, как обрыв и ложный сигнал на выходе устройства. То есть для приборов этой группы вид отказа определяется наличием или отсутствием сигнала на входе прибора. 3. Прерывистые отказы (сбои) Кроме внезапных и постепенных отказов, весьма полезно выделить при исследовании надежности автоматических систем прерывистые отказы, часто называемые сбоями (самовосстанавливающимися отказами). Прерывистые отказы в основном определяются помехами, воздействующими на систему, а для контактных элементов — также окружающими условиями, например вибрациями для контактов электромеханических реле. Характерную особенность прерывистых отказов составляют определенные трудности обнаружения и их устранения. Эффективным средством предупреждения последствий прерывистых отказов может служить применение кодов в дискретных системах. 4. Отказы функций АС Все рассмотренные выше виды отказов относятся к отказам комплекса технических средств АСУ ТП. Для описания надежности АС в целом необходимо учитывать взаимосвязь системы и технологического объекта управления. Надежность АС прежде всего связана со способностью системы выполнять требуемые функции. Тем самым становится естественным использование декомпозиции АС как многофункциональной системы по выполняемым функциям. При таком подходе следует ввести понятие отказа функции. В общем случае отказом функции является событие, заключающееся в нарушении хотя бы одного из основных установленных требований к качеству ее выполнения, возникающее при заданных условиях эксплуатации АС и функционирующем при заданных режимах технологическом объекте управления. Классификация функций АС и требования к их выполнению Установление критериев отказов функций проводится с учетом классификации функций в зависимости от требования к качеству их выполнения. Функции АС условно подразделяются на простые и составные; непрерывные и дискретные. Требования к выполнению функций АС в соответствии с приведенной классификацией: для дискретных функций задаются требования своевременного и безошибочного выполнения функций, отсутствия задержек при их реализации; для непрерывных функций задаются требования отсутствия вынужденных перерывов в выполнении функции и поддержания значений показателей качества их выполнения в заданных пределах; отказ составной функции формулируется как нарушение требований к выполнению некоторого сочетания простых функций, при этом если последствия отказов каждой из простых функций одинаковы, может быть задано требование по ограничению числа одновременно не выполняемых простых функций. Признаки классификации отказов функций Отказы функций можно классифицировать по следующим признакам: по влиянию на работу объекта управления: вызвавшие аварию с повреждением оборудования, останов технологического процесса, ухудшение качества протекания технологического процесса; по причинам возникновения: из-за отказов технических средств, ошибок программного обеспечения, неправильных действий персонала; по степени нарушения работоспособности: полные и частичные; по наличию внешних проявлений: явные и неявные; по виду нарушения для дискретных функций: несрабатывание (отсутствие сигналов или команд при наличии условий, требующих их функционирования) и ложное срабатывание (выработка сигналов или команд при отсутствии условий, требующих их функционирования). 5. Показатели надежности функции АС Показатели надежности функции АС выбираются в соответствии с классификацией функции по временному режиму выполнения с учетом классификации и критериев отказов. Основным показателем безотказности различных непрерывных функций является средняя наработка на отказ. Вместо нее допускается использовать параметр потока отказов, если поток отказов функции является стационарным. При рассмотрении поведения функции до первого отказа показателем безотказности является средняя наработка до отказа. 6. Цели диагностики АС Главная цель диагностики АС для обработки данных или решения научных задач — повышение эксплуатационной надежности — означает увеличение скорости обнаружения отказа, сводящее к минимуму время простоя машины и (или) устранения неисправности. Между тем главная цель диагностики управляющей АС — поддерживать готовность системы, то есть обеспечивать управление объектом и прочие услуги в некоторой минимальной степени, пусть даже с возросшим временем обслуживания. Пример различия: при обработке данных можно пойти на срыв выполнения текущих заданий и передачу всех ресурсов системы в распоряжение диагностических программ; при оперативном управлении система должна сохранять управление важными технологическими величинами. 7. Методы и средства для предотвращения, обнаружения ошибок и восстановления работоспособности программ Они разделяются на четыре основных группы: 1. Предотвращение ошибок: структурные методы проектирования и реализации программ; доказательство корректности модулей; тестирование. 2. Обнаружение ошибок: обследование состояния системы для обнаружения неверного состояния или последовательности таких состояний; обследование данных и структур данных; обследование характеристик производительности; использование механизмов защиты программного обеспечения и аппаратуры. 3. Диагностика ошибок: быстрая регистрация доступной информации об ошибке и ее экспресс-анализ; детальный анализ последствий ошибки для определения области ее действия и нахождения вероятной причины возникновения; использование словаря обслуживания, содержащего набор симптоматических причин возникновения ошибок и соответствующих способов исправления. 4. Коррекция и восстановление: игнорирование ошибки и продолжение выполнения программы; повторение неверно выполненной операции и продолжение вычислений, если это повторение оказалось успешным; возврат к точке возникновения ошибки и перезапуск с этой точки; восстановление данных и структур данных, возобновление вычислений так, как это указано в одном из предыдущих пунктов; начальный перезапуск. 8. Обеспечение функции восстановления работоспособности Функция восстановления работоспособности может быть обеспечена: восстановлением содержимого отдельных ячеек ОЗУ; формированием контрольных точек и перезапуском программ с контрольных точек; копированием участков ОЗУ; реконфигурацией технических и программных средств системы. Формирование контрольных точек заключается в пересылке в некоторую область памяти, в соответствующий массив, содержимого регистров процессора и заданных областей памяти. Копирование участков ОЗУ обеспечивает сохранение информации и быстрое восстановление работоспособности системы. Копия участка может быть создана в другом месте ОЗУ, во внешней памяти или на другом носителе. Копируемые участки ОЗУ в АС могут быть следующие: общая область памяти (COMMON), выводимая на внешнюю память; область памяти с функциональными программами (копии создаются в резервной памяти перед выполнением отдельных функциональных программ и уничтожаются после их успешного выполнения); состояние списков операционной системы; массивы технологических данных (обычно выводятся во внешнюю память). Программы реконфигурации технических и программных средств системы позволяют: подключить резервные устройства в случае отказа основных; перейти к устройствам с низкой производительностью, с уменьшением объема вводимых и выводимых данных; обеспечить работу с программами реального времени, размещаемыми в различных блоках ОЗУ или на различных программных цилиндрах (дорожках) магнитного диска. 9. Функция обслуживания и сервиса системы Функция обслуживания и сервиса системы обеспечивает: вывод информирующих и предупреждающих сообщений о нарушениях работоспособности; распечатку рабочих массивов программ оперативного контроля; распечатку байтов состояния процессора и устройств; формирование стека адресов, характеризующих предысторию процесса реализации программ.