Enlight Control Systems LLC — EST. 2015 47.912°N, 106.926°E · UlaanbaatarУБ --:--
Нүүр/SEC.04 · Мэдлэг/Редундант — үйлдвэрийн удирдлагын системийн найдвартай байдлын архитектурRedundancy — designing high-availability control and SCADA systems

Редундант — үйлдвэрийн удирдлагын системийн найдвартай байдлын архитектур

Redundancy — designing high-availability control and SCADA systems

АвтоматжуулалтAutomation2026-08-049 MIN

Тасралтгүй ажиллагаатай үйлдвэрт удирдлагын системийн хэдхэн минутын зогсолт ч асар их хохирол дагуулдаг. Гэтэл ямар ч төхөөрөмж хэзээ нэгэн цагт эвдэрдэг — асуулт нь «эвдрэх үү?» биш, «эвдрэхэд юу болох вэ?» юм. Редундант (нөөцлөлт) гэдэг нь системийн аль нэг хэсэг эвдэрсэн ч үйл ажиллагаа тасалдахгүй байхаар давхар бүрдүүлж зохион байгуулахыг хэлнэ. Гол зарчим нь: ганц цэгийн эвдрэл (Single Point of Failure, SPOF) үлдээхгүй байх.

Яагаад нөөцлөлт хэрэгтэй болдог вэ?

  • Үйлдвэрлэлийн алдагдал. Тасралтгүй процесст (баяжуулах үйлдвэр, дулааны станц, ус хангамж) удирдлагын систем зогсоход бүх шугам зогсоно. Алт боловсруулах үйлдвэрийн нэг цагийн зогсолт олборлолтын шууд алдагдал болдог.
  • Аюулгүй байдал. Зарим процессыг «зүгээр зогсоож» болдоггүй: цианидын уусгалт, өндөр даралтын зуух, химийн урвал — удирдлага алдагдвал тоног төхөөрөмж, хүний аюулгүй байдалд шууд эрсдэл үүснэ.
  • Тоног төхөөрөмжийн гэмтэл. Гэнэтийн зогсолт нь өөрөө эвдрэл дагуулдаг: тээрэм ачаатай зогсох, шугам хөлдөх, насос гидравлик цохилтод өртөх гэх мэт.
  • Дахин эхлүүлэх өртөг. Том процессыг зогссон үед эхлүүлэх нь хэдэн цагаас хэдэн өдөр үргэлжилж, асаах процесс бүр нэмэлт эрсдэл дагуулна.

Эрсдэлийг хэрхэн тооцож төлөвлөдөг вэ?

Редундант бол «байвал сайхан» биш — тооцоонд суурилсан инженерийн шийдвэр юм. Төлөвлөлтийн явц:

  • Зогсолтын үнийг тооцох. Нэг цагийн зогсолт хэдэн төгрөгийн алдагдал хүлээх вэ? (үйлдвэрлэлийн алдагдал + дахин асаах зардал + гэрээний торгууль + тоног төхөөрөмжийн эрсдэл)
  • SPOF шинжилгээ. Системийн бүдүүвчийг мөрдөж «энэ тоноглол гэмтэхэд юу зогсох вэ?» гэж цэг бүрээр тодорхойлно: тэжээл, CPU, сүлжээний свич, кабель, сервер, хатуу диск...
  • Магадлал × үр дагавар. Элемент бүрийн эвдрэх магадлал (MTBF — эвдрэл хоорондын дундаж хугацаа) ба сэргээх хугацааг (MTTR) үнэлж, эрсдэлийн зэрэглэл тогтооно.
  • Хүртээмжийн зорилт (availability). Жилийн зөвшөөрөгдөх зогсолтоор илэрхийлнэ: 99% = жилд ~87 цаг; 99.9% = ~8.8 цаг; 99.99% = ~53 минут; 99.999% = ~5 минут. Зорилт өндөрсөх тусам шаардлагатай нөөцлөлтийн түвшин өснө.
  • Өртөг харьцуулах. Нөөцлөлтийн нэмэлт хөрөнгө оруулалтыг зогсолтоос үүсэх зардалтай харьцуулна — ихэвчлэн Hot Standby CPU-гийн үнэ нэг ээлжийн зогсолтын алдагдлаас бага байдаг.

Нөөцлөлтийн шатлалууд

Редундантыг «бүгдийг давхарлах» гэж ойлгож болохгүй — шатлал бүрээр авч үздэг. Доод түвшнээс дээш:

  • Тэжээл — давхар тэжээлийн эх үүсвэр, UPS, давхар тэжээлийн блок
  • I/O ба талбайн сүлжээ — давхар цагираг Ethernet, тархмал I/O; нэг кабель тасарсан ч сүлжээ хэвийн үлдэнэ
  • Контроллёр (CPU) — Hot Standby хос процессор
  • Дээд түвшний сүлжээ — давхар свич, давхар зам (dual LAN)
  • SCADA сервер — Primary/Standby хос сервер, өгөгдлийн синхрончлол
  • Клиент — олон оператор станц, серверийн авто-шилжилт
  • Өгөгдөл — historian-ы давхар хадгалалт, нөөц хуулбар

Чухал зарчим: хамгийн сул холбоос системийн түвшинг тодорхойлно. CPU-г давхарлаад ганц свичээр холбовол свич нь SPOF болно.

Ямар тохиолдолд ямар шийдэл вэ?

Cold, Warm, Hot standby гурван түвшний харьцуулалт: сэргээх хугацаа, өгөгдөл, өртөг
Cold, Warm, Hot standby гурван түвшний харьцуулалт: сэргээх хугацаа, өгөгдөл, өртөг
  • Cold standby — сэлбэг агуулахад бэлэн, гараар солино. Сэргээлт: цагаас өдөр хүртэл. Зогсолт нь хүлээж болохуйц туслах системд (агааржуулалт, туслах насос) тохиромжтой.
  • Warm standby — нөөц төхөөрөмж асаалттай хүлээж, гараар эсвэл хагас автоматаар шилжинэ. Сэргээлт: минутын эрэмбэ. Богино тасалдал зөвшөөрөгдөх чухал системд.
  • Hot standby — хоёр төхөөрөмж зэрэг ажиллаж, төлөв нь тасралтгүй синхрончилж, гэмтэл гарахад автоматаар, саадгүй (bumpless) шилжинэ. Тасралтгүй, аюултай процесст заавал.
  • Voting (2oo3) — гурван суваг зэрэг хэмжиж олонхоор шийднэ; хамгаалалтын (SIS/SIL) системд хэрэглэгддэг тусдаа сэдэв.

Modicon M580 Hot Standby (HSBY)

Schneider Electric-ийн M580 ePAC нь Hot Standby-г процессорын түвшинд, зориулалтын шийдэл:

  • Primary + Standby CPU хос — тусгай HSBY холбоосоор scan бүрд бүрэн синхрончилно: программын төлөв, санах ой, таймер, тоолуур бүгд
  • Автомат, саадгүй шилжилт — Primary эвдрэхэд Standby хормын дотор удирдлагыг авна; гаралтууд «цохилтгүй» (bumpless) — процесс мэдрэхгүй
  • X80 Ethernet RIO тархмал I/O — CRA адаптертай drop-ууд давхар цагираг сүлжээнд: нэг кабель тасарсан ч бүх I/O холбоотой үлдэнэ
  • Hot-swap — I/O модулиудыг ажиллагааны явцад шууд солино
  • CCOTF (Change Configuration On The Fly) — тохиргоог зогсолтгүйгээр өөрчлөх: шинэ drop, модуль нэмэхэд процесс үргэлжилнэ
  • Вэб оношилгоо — CPU болон drop бүрийн төлөвийг вэб хөтчөөс шууд харна
Бүрэн редундант архитектур: SCADA серверийн хос, давхар сүлжээ, M580 HSBY хос, давхар цагираг, RIO drop-ууд
Бүрэн редундант архитектур: SCADA серверийн хос, давхар сүлжээ, M580 HSBY хос, давхар цагираг, RIO drop-ууд

Бид энэ архитектурыг Эрдэнэ-Монголын Баянхөндийн алт боловсруулах үйлдвэрт бодитоор хэрэгжүүлсэн: Hot Standby M580 хос, үйлдвэрийн хэсэг бүрд X80 RIO drop, давхар цагираг Ethernet — ганц цэгийн эвдрэлгүй систем.

AVEVA Plant SCADA-гийн redundancy боломжууд

Plant SCADA (Citect) нөөцлөлтийг программ хангамжийн функцын бүх түвшинд хэрэгжүүлдэг:

  • Серверийн хос (Primary/Standby) — I/O, Alarm, Trend, Report сервер бүрийг хослуулан ажиллуулна; Primary унавал Standby автоматаар үүргийг авна
  • Клиентийн авто-шилжилт — оператор станцууд ажиллаж буй сервер рүү өөрөө шилжинэ; оператор юу ч дарахгүй, дэлгэц «үсрэхгүй»
  • Өгөгдлийн синхрончлол — дохиоллын төлөв, баталгаажуулалт, түүхэн тренд хоёр серверт ижил хадгалагдана — шилжилтэд өгөгдөл алдагдахгүй
  • Давхар сүлжээний зам — сервер, клиент, PLC хоорондын холбоо олон замтай; нэг сүлжээ унахад нөгөөгөөр үргэлжилнэ
  • Тархмал архитектур, clustering — олон объектын системд кластер бүр өөрийн нөөцлөлттэй байж, нэгдсэн хяналтад нэгдэнэ
  • Онлайн өөрчлөлт — тохиргооны шинэчлэлтийг ажиллагааг тасалдуулахгүй суулгана

PLC түвшний HSBY ба SCADA түвшний server redundancy хоёр бие биеэ нөхөж бүтэн гинжийг үүсгэнэ: аль ч түвшний ганц эвдрэл оператор болон процесст үл мэдэгдэнэ.

Дүгнэлт

Редундант бол өртөг биш — даатгал юм. Зөв төлөвлөлт нь зогсолтын үнэ, эрсдэлийн шинжилгээнд суурилж, шатлал бүрийг тэнцвэртэй нөөцөлдөг. Бид судалгаа-аудитаас эхлээд Hot Standby архитектурын зураг төсөл, хэрэгжүүлэлт, зогсолтгүй шилжилт хүртэл бүрэн гүйцэтгэдэг.

Танай системийн SPOF шинжилгээг үнэгүй хийлгэе гэвэл: 7733-4478 эсвэл энэ сайтын AI туслахтай ярилцаарай.

In a continuous plant, even a few minutes of control-system downtime is expensive. Yet every device eventually fails — the question is not "will it fail?" but "what happens when it does?". Redundancy means architecting the system with duplicated elements so that operation survives any single failure. The guiding principle: no Single Point of Failure (SPOF).

Why redundancy is needed

  • Production loss. In continuous processes (processing plants, heating plants, water utilities) a control-system stop halts the whole line.
  • Safety. Some processes cannot simply be stopped: cyanide leaching, high-pressure boilers, chemical reactions — losing control creates immediate risk to equipment and people.
  • Equipment damage. Sudden stops cause their own failures: mills stopping under load, freezing lines, water hammer.
  • Restart cost. Restarting a large process takes hours to days, and every start-up adds risk.

How the risk is assessed and planned

Redundancy is an engineering decision based on numbers, not a nice-to-have:

  • Price the downtime. What does one hour cost? (lost production + restart cost + contractual penalties + equipment risk)
  • SPOF analysis. Walk the system diagram asking "if this one thing fails, what stops?" — power, CPU, switch, cable, server, disk...
  • Probability × consequence. Assess each element's MTBF and MTTR, and rank the risks.
  • Availability target. Expressed as allowed annual downtime: 99% ≈ 87 h/yr; 99.9% ≈ 8.8 h; 99.99% ≈ 53 min; 99.999% ≈ 5 min. Higher targets demand higher redundancy tiers.
  • Compare costs. Weigh the redundancy investment against the downtime price — a Hot Standby CPU usually costs less than one shift of lost production.

Redundancy levels

Redundancy is applied level by level, not "duplicate everything": power (dual feeds, UPS) → I/O and field network (dual-ring Ethernet, distributed I/O) → controller (Hot Standby CPU pair) → upper network (dual switches and paths) → SCADA servers (primary/standby with synchronization) → clients (multiple stations, automatic failover) → data (redundant historian, backups).

Key principle: the weakest link sets the system level. Duplicating CPUs but connecting them through one switch just moves the SPOF.

Which case needs which solution

Cold, warm and hot standby compared: recovery time, data, cost
Cold, warm and hot standby compared: recovery time, data, cost
  • Cold standby — spare on the shelf, manual replacement; recovery in hours to days. For tolerant auxiliary systems.
  • Warm standby — backup powered and waiting, manual/semi-automatic switchover; recovery in minutes. For important systems tolerating a short break.
  • Hot standby — both units run in parallel, state continuously synchronized, automatic bumpless switchover. Mandatory for continuous and hazardous processes.
  • Voting (2oo3) — three channels vote by majority; the domain of safety (SIS/SIL) systems.

Modicon M580 Hot Standby (HSBY)

  • Primary + Standby CPU pair — fully synchronized every scan over a dedicated HSBY link: program state, memory, timers, counters
  • Automatic bumpless switchover — the standby takes control instantly; outputs don't bump, the process doesn't notice
  • X80 Ethernet RIO — CRA-adapter drops on a dual-ring network: one broken cable loses no I/O
  • Hot-swap I/O modules during operation
  • CCOTF — change configuration on the fly: add drops and modules without stopping
  • Web diagnostics for the CPUs and every drop
Fully redundant architecture: SCADA server pair, dual network, M580 HSBY pair, dual ring, RIO drops
Fully redundant architecture: SCADA server pair, dual network, M580 HSBY pair, dual ring, RIO drops

We deployed exactly this architecture at Erdene Mongol's Bayan Khundii gold plant: Hot Standby M580 pair, X80 RIO drops in every plant area, dual-ring Ethernet — no single point of failure.

AVEVA Plant SCADA redundancy

  • Server pairs (Primary/Standby) for the I/O, Alarm, Trend and Report server roles with automatic takeover
  • Automatic client failover — operator stations switch servers by themselves, with no operator action
  • Data synchronization — alarm states, acknowledgements and trends kept identical on both servers; nothing is lost in a switchover
  • Redundant network paths between servers, clients and PLCs
  • Distributed architecture and clustering — each cluster carries its own redundancy inside one unified system
  • Online changes deployed without interrupting operation

PLC-level HSBY and SCADA-level server redundancy complement each other into an unbroken chain: a single failure at any level is invisible to the operator and the process.

Conclusion

Redundancy is not a cost — it is insurance. Proper design starts from the downtime price and risk analysis, then balances every level. We deliver the full cycle: audit, Hot Standby architecture design, implementation and zero-downtime migration.

Get a free SPOF analysis of your system: 7733-4478 or talk to the AI assistant on this site.

← Бүх нийтлэл

Танай төсөлд тохирох шийдлийг ярилцъя

Инженер маань үнэгүй урьдчилсан үнэлгээ, төсөв гаргаж өгнө.

Enlight туслах

AI · Онлайн