Кейс

Zabbix на 3000 алертов в сутки, который никто не читает

Мониторинг «внедрили». Через полгода чат дежурного — белый шум: ping флап, диск 1%, агент down на выключенных ПК. Реальных отказов в шуме не видно.

  • Сеть клиник, ~40 серверов и сотни ПК, Москва и МО
  • Срок: 10 рабочих дней
  • Стек: Zabbix, Windows/Linux agents, SNMP, Telegram

Исходное состояние

Что было на площадке

Zabbix 6, шаблоны по умолчанию на всё, что ответило на discovery. Ночные бэкапы роняли агентов, SNMP на дешёвых свитчах флапал, и каждый флапок писал в Telegram.

Дежурный поставил mute на чат. Когда реально умер SQL, сообщение утонуло между «ICMP loss 20%» с гостевой Wi‑Fi.

Рамки

Ограничения и задача

  • Нельзя выключить мониторинг «на время наведения порядка» — клиники 24/7.
  • Нет штатного дежурного 24/7: эскалация должна быть редкой и злой, не частой и вежливой.
  • Часть хостов — старые Windows без нормального агента.

Работы

Что сделали

  1. Разделили: бизнес-сервисы (1С, файлы, шлюз, VPN) и «инвентарь». Алерты в мессенджер — только сервис и железо под ними.
  2. Построили зависимости: ICMP свитча глушит хосты за ним. Maintenance windows на backup.
  3. Пороги дисков — по свободному месту в гигабайтах для малых томов, не «1% на 200 ГБ».
  4. Выключили discovery ПК пользователей как источник критичных алертов. ПК — отдельная карта, не пейджер.
  5. Прогнали учебный отказ: остановили тест-ВМ, засекли время до сообщения и до реакции.

Факт

Результат

  • С ~3000 до ~15–25 осмысленных событий в сутки, критичных — единицы в неделю.
  • Чат снова читают. Учебный отказ дошёл за 2 минуты.
  • Появился список «что звонит среди ночи» — короткий, согласованный с руководством.

Практика

Выводы

  • Мониторинг без политики эскалации — генератор спама.
  • Шаблон по умолчанию на discovery — враг. Сначала карта сервисов.
  • Если чат замьючен, у вас нет мониторинга, есть установка Zabbix.

Стек

Технологии в этом кейсе

  • Zabbix
  • SNMP
  • Windows Agent
  • Telegram

Практика

Материалы по теме

Перелинковка

Связанные услуги

Соседние направления, которые обычно закрывают зависимости и усиливают результат выбранной услуги.

Услуга

Мониторинг серверов

Настраиваем наблюдаемость для доступности, ресурсов, сервисов и резервного копирования, исключая поток бесполезных тревог.

Подробнее

Услуга

IT-аутсорсинг

Берём на сопровождение серверы, рабочие места, сети и прикладную инфраструктуру компании. Формируем понятный перечень ответственности и порядок обработки обращений.

Подробнее

Консультация

Разбрать похожую ситуацию

Опишите инфраструктуру и ожидаемый результат. Уточним вводные и предложим следующий практический шаг.