Парадокс інновацій: як зменшити кількість інцидентів на 25% та пришвидшити впровадження нових технологій
Парадокс інновацій: як зменшити кількість інцидентів на 25% та пришвидшити впровадження нових технологій
Не потрібно обирати між інноваціями та стабільністю. За правильного підходу до спостережуваності, автоматизації на основі ШІ та операційної дисципліни можна досягти обох цілей.
Кожен керівник ІТ-підрозділу стикається з одним і тим самим парадоксом: потрібно прискорювати інновації, водночас зберігаючи стабільність ІТ-середовища. У власному ІТ-підрозділі Cisco активно впроваджувала системи штучного інтелекту та нові технології, однак паралельно зі швидкістю змін зростала й кількість інцидентів.
ІТ-команді компанії вдалося змінити ситуацію: за один рік кількість серйозних інцидентів скоротилася на 25%, а темпи впровадження інновацій при цьому зросли. Далі розглянемо, як Cisco вдалося досягти такого результату.
Однак кожна нова система може створювати додаткові ризики:
Щоб розв’язати цю проблему, ІТ-підрозділ Cisco зробив основний акцент на спостережуваності (observability). В ІТ-контексті спостережуваність — це здатність розуміти внутрішній стан системи на основі даних, які вона генерує, зокрема журналів, метрик, трасувань та іншої телеметрії. Такий підхід допомагає команді не лише відповісти на запитання «що сталося?», а й зрозуміти, чому це сталося, які компоненти були задіяні та що потрібно зробити для усунення першопричини.
За допомогою рішень Splunk і Cisco ThousandEyes вони агрегують телеметричні дані з глобального ІТ-середовища та перетворюють їх на інформацію, придатну для оперативного аналізу та прийняття рішень.
Splunk — центральна нервова система моніторингу корпоративної ІТ-інфраструктури. Завдяки агрегації журналів, метрик і подій з усієї глобальної інфраструктури Splunk надає ІТ-команді Cisco єдине достовірне джерело інформації. Коли виникає проблема, команда бачить взаємопов’язані сигнали в усій системі замість набору ізольованих сповіщень. Це дає змогу визначати першопричину проблеми за лічені хвилини, а не години.
Cisco ThousandEyes — погляд на роботу сервісів з точки зору кінцевого користувача. ThousandEyes забезпечує детальну видимість мережевих шляхів і продуктивності застосунків, допомагаючи точно визначити, де і чому виникають затримки або погіршення роботи.
Якщо критично важливий застосунок працює неналежним чином, команді експлуатації сервісів більше не потрібно з’ясовувати навмання, де саме виникла проблема — у внутрішній мережі, на стороні зовнішнього постачальника чи в самому застосунку. ІТ-фахівці можуть швидко локалізувати проблему та залучити відповідних експертів для її усунення — часто ще до того, як користувачі створять заявку.
Для цього Cisco використовує три ключові практики.
ІТ-команді компанії вдалося змінити ситуацію: за один рік кількість серйозних інцидентів скоротилася на 25%, а темпи впровадження інновацій при цьому зросли. Далі розглянемо, як Cisco вдалося досягти такого результату.
Ціна інновацій: коли швидкість стає вашим ворогом
Сьогодні більшість компаній інтегрує можливості штучного інтелекту, впроваджує хмарні сервіси та модернізує застосунки з безпрецедентною швидкістю.Однак кожна нова система може створювати додаткові ризики:
- Прогалини у видимості. Разом із новими технологіями з’являлися нові системи сповіщень, кожна з яких працювала ізольовано від інших. Операційна команда отримувала величезний обсяг інформації, але не мала цілісного уявлення про реальний вплив подій на бізнес.
- Нестабільність, спричинена змінами. Що більше змін впроваджувала компанія, то частіше виникали інциденти. У результаті інновації, покликані покращувати роботу ІТ-середовища, самі могли ставати причиною перебоїв.
- Невизначеність, пов’язана із ШІ. Штучний інтелект відкрив нові можливості для підвищення ефективності, але водночас створив нові типи операційних викликів. Постало питання: як контролювати технологію, поведінка якої не завжди є повністю передбачуваною?
Щоб розв’язати цю проблему, ІТ-підрозділ Cisco зробив основний акцент на спостережуваності (observability). В ІТ-контексті спостережуваність — це здатність розуміти внутрішній стан системи на основі даних, які вона генерує, зокрема журналів, метрик, трасувань та іншої телеметрії. Такий підхід допомагає команді не лише відповісти на запитання «що сталося?», а й зрозуміти, чому це сталося, які компоненти були задіяні та що потрібно зробити для усунення першопричини.
Мета: інновації без перебоїв
Замість того щоб уповільнювати темпи інновацій, у Cisco обрали інший шлях — суттєво покращити можливості моніторингу та спостережуваності. ІТ-команда визначила три основні цілі:- Швидше виявляти проблеми — ще до того, як про них повідомлять користувачі.
- Точніше спрямовувати інциденти — одразу передавати їх відповідним експертам без зайвих перепризначень між підрозділами.
- Проактивно усувати проблеми — автоматично вирішувати їх там, де це можливо, та своєчасно інформувати відповідальних фахівців, якщо потрібне їхнє втручання.
Підхід і технології спостережуваності Cisco IT
Стратегія спостережуваності Cisco IT базується на багаторівневому підході із залученням трьох команд. На перших двох рівнях спеціалізовані команди забезпечують наскрізний моніторинг мережі, застосунків, сервісів та інфраструктури.За допомогою рішень Splunk і Cisco ThousandEyes вони агрегують телеметричні дані з глобального ІТ-середовища та перетворюють їх на інформацію, придатну для оперативного аналізу та прийняття рішень.
Splunk — центральна нервова система моніторингу корпоративної ІТ-інфраструктури. Завдяки агрегації журналів, метрик і подій з усієї глобальної інфраструктури Splunk надає ІТ-команді Cisco єдине достовірне джерело інформації. Коли виникає проблема, команда бачить взаємопов’язані сигнали в усій системі замість набору ізольованих сповіщень. Це дає змогу визначати першопричину проблеми за лічені хвилини, а не години.
Cisco ThousandEyes — погляд на роботу сервісів з точки зору кінцевого користувача. ThousandEyes забезпечує детальну видимість мережевих шляхів і продуктивності застосунків, допомагаючи точно визначити, де і чому виникають затримки або погіршення роботи.
Якщо критично важливий застосунок працює неналежним чином, команді експлуатації сервісів більше не потрібно з’ясовувати навмання, де саме виникла проблема — у внутрішній мережі, на стороні зовнішнього постачальника чи в самому застосунку. ІТ-фахівці можуть швидко локалізувати проблему та залучити відповідних експертів для її усунення — часто ще до того, як користувачі створять заявку.
Технології спостережуваності Cisco IT допомагають змінити підхід до управління ІТЩоб ІТ-команда могла ефективніше використовувати дані та аналітичні висновки, отримані за допомогою цих рішень, Cisco також впроваджує автоматизацію на основі штучного інтелекту в різних сценаріях управління інцидентами.
Splunk — центральна система для моніторингу стану корпоративної ІТ-інфраструктури.
Cisco ThousandEyes — детальна видимість цифрового досвіду кінцевого користувача.
- Прогнозування груп призначення. ШІ аналізує описи інцидентів та історичні закономірності, щоб одразу спрямовувати проблему до відповідної команди. Це дає змогу на 19% зменшити кількість перепризначень і скоротити час залучення необхідних експертів.
- Рекомендації щодо вирішення. Зіставляючи поточні проблеми з базою знань, яка містить понад 100 тисяч вирішених інцидентів, ШІ може швидко пропонувати перевірені способи їх усунення.
- Автоматизоване усунення проблем. Системи самовідновлення виконують рутинні завдання, зокрема очищення сховища та скидання сеансів, без втручання людини. Автоматизація на основі ШІ наразі опрацьовує 99,998% із приблизно 4 мільйонів щоденних сповіщень про потенційні проблеми та інциденти.
За межами технологій: роль людського фактора у спостережуваності
Цінність ІТ-команди не обмежується використанням технологій. Фахівці мають швидко виявляти, аналізувати та усувати проблеми, мінімізуючи їхній вплив на роботу бізнесу.Для цього Cisco використовує три ключові практики.
- Інтелектуальне управління змінами. Не всі зміни мають однаковий рівень ризику. ІТ-команда Cisco автоматизувала процес затвердження для 80% стандартних змін із низьким рівнем ризику, водночас зосередивши більше уваги та посиливши моніторинг змін із вищим рівнем ризику.
- Якість і точність даних. Ефективність ШІ безпосередньо залежить від якості даних. Тому особлива увага приділяється актуальності та точності бази даних управління конфігураціями CMDB (Configuration Management Database). CMDB містить інформацію про компоненти ІТ-інфраструктури організації та, що особливо важливо, про взаємозв’язки між ними. ІТ-команда Cisco створила комплексну систему контролю якості даних навколо платформи Enterprise Service Platform (ESP), у якій CMDB слугує єдиним достовірним джерелом інформації про технологічне середовище.
- Автоматизована звітність щодо якості даних і відповідні робочі процеси допомагають регулярно виявляти прогалини, позначати застарілу інформацію та ініціювати її оновлення. Завдяки цьому, коли ШІ визначає групу призначення або пропонує спосіб вирішення інциденту, він спирається на точні й актуальні дані, а не на застарілі записи.
- Ефективна комунікація. У кризовій ситуації чіткість комунікації не менш важлива за швидкість реагування. Технічні фахівці мають пояснювати складні проблеми зрозумілою для бізнесу мовою: які сервіси зазнали впливу, скількох користувачів це торкнулося, які заходи вже вжито та коли очікується відновлення нормальної роботи.
Підсумок: вимірюваний вплив на бізнес
За 18 місяців трансформація підходу до спостережуваності дала результати, які безпосередньо сприяли підвищенню гнучкості бізнесу:- на 25% менше серйозних інцидентів — менше перебоїв у роботі співробітників і клієнтських сервісів;
- на 20% менше інцидентів, пов’язаних зі змінами — можливість швидше впроваджувати інновації з меншим ризиком;
- на 45% скоротився середній час відновлення — для критично важливих сервісів він скоротився з годин до хвилин;
- 80% змін затверджуються автоматично — це допомагає прискорити впровадження та водночас ефективніше контролювати ризики.
Готові трансформувати свої ІТ-операції?
Висновок із досвіду Cisco однозначний: організаціям не обов’язково обирати між інноваціями та стабільністю. За правильного підходу до спостережуваності, автоматизації на основі штучного інтелекту та операційної дисципліни можна досягти обох цілей.Мегатрейд, як офіційний дистриб’ютор Cisco, є авторизованим каналом для придбання обладнання, ПЗ та сервісів Cisco на території України: sales@megatrade.ua, (044) 538-00-06
Технічні консультації для партнерів Мегатрейд: cisco@megatrade.ua
Революція в аналізі якості: чому 100-відсоткова прозорість змінює підхід до управління якістю в контакт-центрах
Дослідження Splunk: агентний ШІ посідає центральне місце у стратегіях CISO на шляху до цифрової стійкості