Перейти до змісту
Інформаційні технологіїML Розробка

AIOps: Виявлення аномалій в ІТ-інфраструктурі — -78% часу простою

ІТ-компанія (NDA)

Завдання

ІТ-компанія страждала від частих незапланованих простоїв — у середньому 4 години на місяць. Ручний моніторинг інфраструктури генерував сотні хибних тривог щодня, що призводило до вигорання чергових інженерів. Визначення першопричини інциденту займало 2–3 години: команда вручну переглядала логи та метрики десятків мікросервісів, а справжня аномалія часто виявлялась із запізненням — вже після відчутного впливу на клієнтів.

Рішення

Розробили ML-систему виявлення аномалій у реальному часі на основі системних метрик (CPU, память, мережа, latency). Ансамбль Isolation Forest (для point-аномалій) та LSTM Autoencoder (для часових патернів) аналізує потоки з Prometheus та Kafka. Кореляційний аналіз між мікросервісами автоматично будує гіпотези першопричини. Система інтегрована з PagerDuty: інженери отримують консолідований alert із контекстом і ранжованими гіпотезами замість потоку сирих метрик. Фільтрація шуму знизила кількість нотифікацій у 9 разів.

Результат

Час простою скоротився на 78% — середньомісячний показник впав із 4 годин до менше ніж 55 хвилин. Аномалії тепер виявляються за 3 хвилини замість 45. Кількість хибних тривог знизилась на 89%, що повернуло команді on-call довіру до сигналів і суттєво зменшило вигорання. ROI системи за перший рік склав 6.1x завдяки скороченню збитків від простоїв та вивільненому часу інженерів.

Технології

PythonIsolation ForestLSTM AutoencoderPrometheusGrafanaKafkaDockerKubernetes

Схожа задача? Поговоримо

Маєте схожу задачу?

Ми вже вирішували виклики у галузі Інформаційні технології. Розкажіть про ваш проєкт — разом знайдемо оптимальне рішення та складемо план дій.

🤖

Хочете подібний результат?

Розкажіть про вашу задачу — проведемо безкоштовну консультацію з ML-архітектором і запропонуємо рішення.