Надійність ІТ-інфраструктури сьогодні — це не лише технічне питання, а й один із факторів безперервності бізнесу. Відмови обладнання, простої критичних сервісів або проблеми з відновленням можуть напряму впливати на операційну діяльність компанії, якість обслуговування клієнтів і фінансові результати.
Саме тому проєктування сучасної ІТ-інфраструктури має починатися не лише з вибору продуктивного обладнання, а й із чіткого розуміння того, який рівень доступності та відмовостійкості необхідний бізнесу і якими технічними рішеннями його можна забезпечити.
У цій статті розглянемо практичний підхід до проєктування надійної та відмовостійкої ІТ-інфраструктури — від формування вимог і розробки схеми рішення до виконання проєктної оцінки надійності.
Матеріал буде корисним як компаніям, які тільки розпочинають планування та проєктування власної ІТ-інфраструктури, так і організаціям, у яких інфраструктура вже побудована, але її надійність необхідно оцінити, підтвердити або підвищити.
На конкретних цифрах покажемо, як на кінцеву надійність ІТ-інфраструктури впливають:
- резервування на рівні окремих одиниць обладнання;
- резервування внутрішніх компонентів;
- рівень сервісної підтримки виробника;
- наявність актуального складу запасних частин, інструментів та приладдя (ЗІП);
- рівень підготовки адміністративного персоналу.
Це дозволяє перейти від загального поняття «надійна інфраструктура» до конкретних показників, які можна розрахувати, порівняти та використати для прийняття технічних і бізнес-рішень.
З чого починається проєктування
Процес проєктування починається з оцінки вимог завдання на проєктування (ЗнП).
Типове ЗнП для певної ІТ-інфраструктури може містити такі вимоги до надійності:
- граничний термін експлуатації ІТ-обладнання (Te) — 10 років;
- рівень резервування мережевого обладнання — 2N;
- рівень резервування каналів зв’язку — 2N;
- рівень резервування обладнання системи зберігання та обробки даних — 2N; (без урахування системи зберігання даних);
- систему зберігання даних (СЗД) спроєктувати на високонадійному обладнанні класу Business-Critical із рівнем доступності 99,9999%;
- коефіцієнт готовності всієї ІТ-інфраструктури (Кг) — 99,999%;
- виконати проєктну оцінку надійності з підтвердженням зазначеного рівня Кг.
Значення граничного терміну експлуатації ІТ-обладнання (Te) у 10 років для певної інфраструктури є типовим. Воно базується на середньому рівні Mean Time Between Failures (MTBF) для комплексу обладнання, а також на актуальності самого обладнання для вирішення поставлених завдань.
Експлуатація 10-річного обладнання у більшості випадків уже є економічно недоцільною: витрати на його підтримку зростають, доступність запасних частин знижується, а технологічні можливості можуть перестати відповідати потребам бізнесу.
Водночас показник Te необхідно визначати з урахуванням конкретного сценарію використання.
Наприклад, якщо йдеться про проєктування ІТ-інфраструктури для завдань штучного інтелекту (ШІ), закладати Te на рівні 10 років некоректно. Для таких систем технологічний цикл значно коротший і може становити близько 5–6 років.
Тобто, неможливо якісно спроєктувати інфраструктуру, якщо її розрахунковий термін експлуатації відірваний від реальних технологічних та бізнес-потреб.
Резервування як основа відмовостійкості
Далі в завданні на проєктування зазвичай визначаються рівні резервування для різних класів обладнання та каналів зв’язку.
Якщо ми будуємо надійну та відмовостійку ІТ-інфраструктуру, рівень резервування критичних компонентів має бути не нижчим за 2N.
Такий підхід дозволяє зберігати працездатність системи навіть у разі відмови одного з ключових елементів.
Винятком може бути система зберігання даних, оскільки архітектура та позиціонування цього класу обладнання передбачають високий рівень внутрішньої надійності та резервування компонентів. Тому в багатьох випадках додаткове резервування СЗД на рівні окремих пристроїв не є необхідним.
Більшість завдань на проєктування обмежуються визначенням показника Te та необхідних рівнів резервування. І в багатьох випадках цього достатньо, щоб створена інфраструктура могла стабільно працювати та виконувати поставлені завдання.
Проте для бізнес-критичних систем виникає значно важливіше питання:
чи достатньо просто використати високонадійне обладнання провідних світових виробників і реалізувати резервування?
Які кінцеві показники надійності матиме така інфраструктура?
Скільки часу потенційного простою на рік вона передбачає?
Який рівень сервісної підтримки необхідний для забезпечення стабільної роботи та наскільки він впливатиме на кінцевий показник доступності?
Як CIO може аргументовано обґрунтувати перед CEO або наглядовою радою бюджет на ІТ-інфраструктуру, сервісну підтримку та ЗІП?
І, нарешті, які гарантовані показники Service Level Agreement (SLA) може закладати сервісна ІТ-компанія для своїх клієнтів?
Саме на ці питання дозволяє відповісти проєктна оцінка надійності.
Вона дає можливість ще на етапі проєктування побачити потенційні точки ризику, оцінити вплив окремих компонентів на доступність системи та аргументовано визначити, де додаткові інвестиції в резервування або сервіс дійсно виправдані.
Як вимірюється надійність ІТ-інфраструктури
Одним з основних показників надійності роботи обладнання є коефіцієнт готовності (Кг).
Національний стандарт ДСТУ 2860-94 «Надійність техніки. Терміни та визначення» визначає Кг як «імовірність того, що об'єкт виявиться працездатним у довільний момент часу, крім запланованих періодів, протягом яких використання об'єкта за призначенням не передбачено».
Для ІТ-інфраструктури цей коефіцієнт зазвичай виражається кількістю так званих «дев’яток» доступності.
Наприклад, різниця між 99,9%, 99,99% та 99,999% на перший погляд може здаватися незначною. Проте в реальній експлуатації кожна додаткова «дев’ятка» означає суттєве скорочення допустимого часу простою.
Далі розглянемо розрахунок Кг для умовної ІТ-інфраструктури та побачимо, які саме технічні й організаційні фактори найбільше впливають на її кінцеву доступність.
Приклад ІТ-інфраструктури для розрахунку
Для оцінки надійності спроєктуємо умовну ІТ-інфраструктуру ЦОД умовного банку в Україні (див. Рис. 1).
Мережеве обладнання побудуємо на рішеннях Cisco Systems, серверне — Hewlett Packard Enterprise (HPE).
Вибір мультивендорного рішення в межах цього прикладу обумовлений насамперед тим, що Cisco Systems публікує у відкритому доступі значення MTBF, що спрощує пошук вихідних даних для подальших розрахунків. При цьому мультивендорні конфігурації є цілком поширеними і на практиці.
Отже, бізнес-модель умовного банку передбачає наявність системи зберігання та обробки даних (СЗіОД), побудованої на дубльованій блейд-системі HPE Synergy 12k (SR1, SR2) та системі зберігання даних HPE Alletra 6050 (DB1), підключених через FC-комутатори HPE SN6600B (S3, S4).
Кінцеві сервіси, які працюють на цьому обладнанні, у межах цієї статті не розглядаються.
Обладнання СЗіОД підключається до ядра мережі, побудованого на двох комутаторах Cisco Nexus N9K-C93180YC-FX3 (S1, S2), каналами 100GBASE-SR4.
Ядро мережі, у свою чергу, підключається до обладнання WAN-модуля, реалізованого на маршрутизаторах Cisco ASR-9902-200G-FC (R1, R2) та DWDM-платформах NCS2006 (DWDM1, DWDM2).
Підключення між комутаторами N9K-C93180YC-FX3 (S1, S2), маршрутизаторами ASR-9902-200G-FC (R1, R2) та DWDM-платформами NCS2006 (DWDM1, DWDM2) виконуються дубльованими каналами 100GBASE-SR4.
Таким чином, наведена на Рис. 1 умовна ІТ-інфраструктура вже відповідає базовим вимогам до резервування обладнання та каналів зв’язку, визначеним у ЗнП.
Наступний крок — перевірити, чи забезпечує така архітектура необхідний коефіцієнт готовності на практиці та який внесок у кінцеву надійність системи робить кожен її компонент.

Рис. 1. Приклад довільної ІТ-інфраструктури з резервуванням обладнання та каналів зв’язку
Задля спрощення далі буде виконана лише проєктна оцінка надійності мережевої інфраструктури. Проєктна оцінка надійності виконується із урахуванням наступного:
- Розрахунок проводиться на основі даних MTBF від компанії-вендора або даних MTBF подібного за класом обладнання.
- В розрахунку приймається рівномірне розподілення відмов, періоди підвищеної кількості відмов на початковій та кінцевій стадіях експлуатації умовно виключаються.
- Приймається, що надійність каналів зв’язку настільки висока, що не впливає на розрахунок.
- Приймається, що надійність пасивних елементів та систем забезпечення (електроживлення, кондиціонування тощо) настільки висока, що не впливає на розрахунок.
Сама методика проєктної оцінки надійності наступна:
- Виконується трансляція MTBF (години) в MTBF (роки) для кожної одиниці обладнання.
- Підраховуються інтенсивності відмов протягом року (\(p_1\)) для кожного типу обладнання за формулою (1):
- Встановлюється коефіцієнт резервування (\(K_p\)) для кожного типу обладнання:
- \(K_p = \frac{1}{N}\) — для обладнання без резервування;
- \(K_p = \frac{2}{N}\) — для обладнання із резервуванням 2N.
- Підраховуються інтенсивності відмов протягом року (\(p_r\)) для кожного типу обладнання із урахуванням коефіцієнта резервування (\(K_p\)) за формулами (2), (3).
- При більш високому рівні резервування обладнання застосовується формула (4), яка також враховує довільне значення MTTR.
де:
- \(xN\) – довільний x-рівень резервування;
- \(P\) – інтенсивність відмови компоненту;
- \(MTTR\) – середній час відновлення після відмови.
- Підраховується загальна інтенсивність відмов комплексу обладнання протягом року (\(p_s\)), яка становить суму інтенсивностей відмов (\(p_r\)) для всіх типів обладнання, які входять в комплекс.
- Коефіцієнт готовності (Кг) розраховується за формулою (5):
де:
- \(MTBF\) – середній час між відмовами для комплексу обладнання, розрахований на основі інтенсивності відмов комплексу обладнання протягом року (\(p_s\));
- \(MTTR\) – середній час відновлення після відмови.
- На основі коефіцієнту готовності (Кг) розраховується середній час простою за рік (Tm).
Розрахунок оцінки надійності наведено в Табл. 1. Результуюче значення коефіцієнта готовності (Кг) дорівнює 99,99995%, а середній час простою за рік (Tm) становить всього 15,31 секунд. Саме таке значення можна прийняти у якості відповідних метрик SLA для сервісів обслуговування кінцевих клієнтів. Але, як часто трапляється, тут є важливий нюанс. Як видно із розрахунку, на коефіцієнт готовності суттєво впливає значення MTTR. У цьому випадку MTTR був встановлений на рівні 24 годин, за які несправний компонент має бути відновлено. На практиці MTTR сильно залежить від рівня сервісної підтримки від вендора, наявності актуального складу ЗІП та відповідної кваліфікації адміністративного персоналу, але навіть якщо він буде на рівні 72 годин (що через збільшення вікна вразливості дубльованих систем призведе до квадратичного зростання простою у 9 разів), отримаємо Кг = 99,99956% та Тm ≈ 138 секунд. Все одно п’ять «дев’яток». Навіть за таких умов вимоги ЗнП виконуються повністю.
Табл. 1. Проєктна оцінка надійності мережевої інфраструктури (з резервуванням)
| Обладнання | MTBF, годин |
MTBF, років |
Інтенсивність відмов протягом року (p1) | Коеф. резерв. (Кр) |
Інтенсивність відмов протягом року з урахуванням резервування (pr) |
|---|---|---|---|---|---|
| Розрахунок для NCS 2006: | |||||
| Шасі - NCS 2006 Shelf Assembly | 1 000 000,00 | 114,1552511 | 0,00876 | 1 | 0,0087600000 |
| Блок вентиляторів - NCS2006-FTA | 4 000 000,00 | 456,6210046 | 0,00219 | 1 | 0,0021900000 |
| Модуль - NCS2006-LCD | 500 000,00 | 57,07762557 | 0,01752 | 1 | 0,0175200000 |
| Блок живлення - NCS2006-AC | 300 000,00 | 34,24657534 | 0,0292 | 2 | 0,0000046720 |
| Модуль - NCS2006-ECU-S | 500 000,00 | 57,07762557 | 0,01752 | 1 | 0,0175200000 |
| Контролер - NCS2K-TNCS-2-K9 | 400 000,00 | 45,66210046 | 0,0219 | 2 | 0,0000026280 |
| ROADM-модуль - NCS2K-9-SMR34FS-L | 160 000,00 | 18,26484018 | 0,05475 | 1 | 0,0547500000 |
| Мукспондер - NCS2K-400GXP-L-K9 | 270 000,00 | 30,82191781 | 0,03245 | 1 | 0,0324500000 |
| Кабель AOC - QQSFP-100G-AOC3M | 5 000 000,00 | 570,7762557 | 0,00176 | 1 | 0,0017600000 |
| Кабель AOC - QQSFP-100G-AOC3M | 5 000 000,00 | 570,7762557 | 0,00176 | 1 | 0,0017600000 |
| WDM-модуль - ONS-CFP2-WDM | 500 000,00 | 57,07762557 | 0,01752 | 1 | 0,0175200000 |
| WDM-модуль - ONS-CFP2-WDM | 500 000,00 | 57,07762557 | 0,01752 | 1 | 0,0175200000 |
| 0,1717573000 | |||||
| ТРАНСПОРТНА ПЛАТФОРМА NCS 2006 | 0,1717573000 | 2 | 0,0001616470 | ||
| Розрахунок для ASR-9902-200G-FC: | |||||
| Шасі - ASR-9902-FC | 200 000,00 | 22,83105023 | 0,0438 | 1 | 0,0438000000 |
| Модуль RP - A99-RP-F-FC | 200 000,00 | 22,83105023 | 0,0438 | 2 | 0,0000105120 |
| Блок вентиляторів - ASR-9902-FAN | 200 000,00 | 22,83105023 | 0,0438 | 2 | 0,0000105120 |
| Блок живлення - PWR-1.6KW-AC | 200 000,00 | 22,83105023 | 0,0438 | 2 | 0,0000105120 |
| Кабель AOC - QQSFP-100G-AOC3M | 5 000 000,00 | 570,7762557 | 0,00176 | 2 | 0,0000000170 |
| Кабель AOC - QQSFP-100G-AOC3M | 5 000 000,00 | 570,7762557 | 0,00176 | 2 | 0,0000000170 |
| 0,0438315699 | |||||
| МАРШРУТИЗАТОР ASR-9902-200G-FC | 0,0438315699 | 2 | 0,0000105272 | ||
| Розрахунок для N9K-C93180YC-FX3: | |||||
| Комутатор - N9K-C93180YC-FX3 | 288 760,00 | 32,96347032 | 0,03034 | 1 | 0,0303400000 |
| Блок вентиляторів - NXA-FAN-35CFM-PI | 1 200 000,00 | 136,9863014 | 0,0073 | 2 | 0,0000002920 |
| Блок живлення - NXA-PAC-650W-PI | 200 000,00 | 22,83105023 | 0,0438 | 2 | 0,0000105120 |
| Кабель AOC - QQSFP-100G-AOC3M | 5 000 000,00 | 570,7762557 | 0,00176 | 2 | 0,0000000170 |
| Кабель AOC - QQSFP-100G-AOC3M | 5 000 000,00 | 570,7762557 | 0,00176 | 2 | 0,0000000170 |
| 0,0303508379 | |||||
| КОМУТАТОР N9K-C93180YC-FX3 | 0,0303508379 | 2 | 0,0000050475 | ||
| Імовірність відмови протягом року (ps): | 0,0001772216 | ||||
| Загальний MTBF, років | 5 642,65165 | ||||
| Загальний MTBF, годин | 49 429 628,42 | ||||
| Загальний MTTR, годин | 24 | ||||
| Коефіцієнт готовності (Kг) | 99,99995% | ||||
| Середній час простою за рік (Tm), год | 0,0042533174 | ||||
Аналізуючи значення проєктної оцінки надійності в Табл. 1, бачимо, що мережева інфраструктура, яка проєктується на високонадійному обладнанні із рівнем резервуванням 2N, має надійність на рівні п’яти або шести «дев’яток». Але які значення надійності будуть, коли немає резервування на рівні окремих одиниць обладнання? Виконаємо повторний розрахунок для варіанту ІТ-інфраструктури без резервування, представленого на Рис. 2.

Рис. 2. Приклад довільної ІТ-інфраструктури без резервування на рівні обладнання
Розрахунок оцінки надійності для варіанту без резервування наведено в Табл. 2. Результуюче значення коефіцієнта готовності (Кг) вже дорівнює 99,93266%, а середній час простою за рік (Tm) становить вже 353,91 хвилин. Відповідно, без резервування обладнання виконати заявлені вимоги ЗнП неможливо. Слід врахувати, що навіть такі показники надійності були отримані із резервуванням на рівні внутрішніх компонентів обладнання. Без цього вихідні показники будуть ще гірші.
Табл. 2. Проєктна оцінка надійності мережевої інфраструктури (без резервування)
| Обладнання | MTBF, годин |
MTBF, років |
Інтенсивність відмов протягом року (p1) | Коеф. резерв. (Кр) |
Інтенсивність відмов протягом року з урахуванням резервування (pr) |
|---|---|---|---|---|---|
| Розрахунок для NCS 2006: | |||||
| Шасі - NCS 2006 Shelf Assembly | 1 000 000,00 | 114,1552511 | 0,00876 | 1 | 0,0087600000 |
| Блок вентиляторів - NCS2006-FTA | 4 000 000,00 | 456,6210046 | 0,00219 | 1 | 0,0021900000 |
| Модуль - NCS2006-LCD | 500 000,00 | 57,07762557 | 0,01752 | 1 | 0,0175200000 |
| Блок живлення - NCS2006-AC | 300 000,00 | 34,24657534 | 0,0292 | 2 | 0,0000046720 |
| Модуль - NCS2006-ECU-S | 500 000,00 | 57,07762557 | 0,01752 | 1 | 0,0175200000 |
| Контролер - NCS2K-TNCS-2-K9 | 400 000,00 | 45,66210046 | 0,0219 | 2 | 0,0000026280 |
| ROADM-модуль - NCS2K-9-SMR34FS-L | 160 000,00 | 18,26484018 | 0,05475 | 1 | 0,0547500000 |
| Мукспондер - NCS2K-400GXP-L-K9 | 270 000,00 | 30,82191781 | 0,03245 | 1 | 0,0324500000 |
| Кабель AOC - QQSFP-100G-AOC3M | 5 000 000,00 | 570,7762557 | 0,00176 | 1 | 0,0017600000 |
| Кабель AOC - QQSFP-100G-AOC3M | 5 000 000,00 | 570,7762557 | 0,00176 | 1 | 0,0017600000 |
| WDM-модуль - ONS-CFP2-WDM | 500 000,00 | 57,07762557 | 0,01752 | 1 | 0,0175200000 |
| WDM-модуль - ONS-CFP2-WDM | 500 000,00 | 57,07762557 | 0,01752 | 1 | 0,0175200000 |
| 0,1717573000 | |||||
| ТРАНСПОРТНА ПЛАТФОРМА NCS 2006 | 0,1717573000 | 1 | 0,1717573000 | ||
| Розрахунок для ASR-9902-200G-FC: | |||||
| Шасі - ASR-9902-FC | 200 000,00 | 22,83105023 | 0,0438 | 1 | 0,0438000000 |
| Модуль RP - A99-RP-F-FC | 200 000,00 | 22,83105023 | 0,0438 | 2 | 0,0000105120 |
| Блок вентиляторів - ASR-9902-FAN | 200 000,00 | 22,83105023 | 0,0438 | 2 | 0,0000105120 |
| Блок живлення - PWR-1.6KW-AC | 200 000,00 | 22,83105023 | 0,0438 | 2 | 0,0000105120 |
| Кабель AOC - QQSFP-100G-AOC3M | 5 000 000,00 | 570,7762557 | 0,00176 | 2 | 0,0000000170 |
| 0,0438315530 | |||||
| МАРШРУТИЗАТОР ASR-9902-200G-FC | 0,0438315530 | 1 | 0,0438315530 | ||
| Розрахунок для N9K-C93180YC-FX3: | |||||
| Комутатор - N9K-C93180YC-FX3 | 288 760,00 | 32,96347032 | 0,03034 | 1 | 0,0303400000 |
| Блок вентиляторів - NXA-FAN-35CFM-PI | 1 200 000,00 | 136,9863014 | 0,0073 | 2 | 0,0000002920 |
| Блок живлення - NXA-PAC-650W-PI | 200 000,00 | 22,83105023 | 0,0438 | 2 | 0,0000105120 |
| Кабель AOC - QQSFP-100G-AOC3M | 5 000 000,00 | 570,7762557 | 0,00176 | 2 | 0,0000000170 |
| Кабель AOC - QQSFP-100G-AOC3M | 5 000 000,00 | 570,7762557 | 0,00176 | 2 | 0,0000000170 |
| 0,0303508210 | |||||
| КОМУТАТОР N9K-C93180YC-FX3 | 0,0303508210 | 1 | 0,0303508210 | ||
| Імовірність відмови протягом року (ps): | 0,2459396739 | ||||
| Загальний MTBF, років | 4,06604 | ||||
| Загальний MTBF, годин | 35618,49074 | ||||
| Загальний MTTR, годин | 24 | ||||
| Коефіцієнт готовності (Kг) | 99,93266% | ||||
| Середній час простою за рік (Tm), год | 5,8985776699 | ||||
Порівняння результатів розрахунків надійності з резервуванням (Табл. 1) та без нього (Табл. 2) дає практичне розуміння того, наскільки суттєво архітектурні рішення впливають на загальну відмовостійкість ІТ-інфраструктури.
Такі розрахунки дозволяють перейти від загальних припущень до конкретних цифр і аргументовано обґрунтовувати інвестиції не лише в резервування обладнання та його компонентів, а й у сервісну підтримку виробника, формування актуального складу ЗІП та підготовку адміністративного персоналу. Адже кожен із цих факторів безпосередньо впливає на Mean Time To Repair (MTTR), а отже — і на кінцевий рівень доступності всієї ІТ-інфраструктури.
У цій статті ми розглянули окремий спрощений приклад проєктної оцінки надійності. У реальних ІТ-середовищах кількість компонентів, взаємозалежностей, сценаріїв відмов та вимог до безперервності бізнесу значно більша. Саме тому оцінка надійності має виконуватися комплексно — з урахуванням архітектури, рівнів резервування, сервісної моделі, вимог SLA та особливостей конкретного бізнесу.
LANTEC допомагає спроєктувати, оцінити та оптимізувати ІТ-інфраструктуру таким чином, щоб її надійність була не декларативною, а підтвердженою розрахунками.
Якщо перед вашою компанією стоїть завдання побудови нової ІТ-інфраструктури, модернізації існуючої системи або перевірки її реального рівня відмовостійкості, фахівці LANTEC можуть виконати комплексну оцінку та запропонувати рішення, збалансоване з точки зору надійності, продуктивності та вартості.
Адже надійна ІТ-інфраструктура — це не просто резервне обладнання. Це проєктно підтверджена здатність бізнесу продовжувати роботу навіть тоді, коли окремі компоненти системи виходять з ладу.
Автор статті - Олег Захарченко, головний інженер проєкту компанії Lantec.