Перейти к содержимому

Мониторинг, который превращает событие в задачу

О том, что сервер встал, узнаём от бухгалтерии; свободное место и состояние копий не смотрит никто. Мониторинг ИТ-инфраструктуры закрывает этот разрыв: за согласованными системами и ресурсами следим круглосуточно, а при отклонении, о котором договорились, система мониторинга сама создаёт заявку с исполнителем — сигнал не остаётся красной точкой на чужом экране.

Первый звонок инженера — около 30 минут в рабочее время. Разбираем вашу ситуацию, без презентации.

  • Наблюдение за согласованными системами — 24/7
  • Доступность, место на дисках, нагрузка, ключевые службы и события
  • При согласованном отклонении заявка создаётся сама
  • Круглосуточное наблюдение — это не круглосуточное решение любых заявок

Когда о проблеме узнают от сотрудников

Диск заполнился, служба не поднялась после перезагрузки, задание копирования падает третью неделю, канал до филиала работает через раз.

Всё это видно заранее — но только если за этим кто-то смотрит.

Что меняется, когда у сигнала есть маршрут

Состояние сервисов видно без ручного обхода, а у сигнала появляется исполнитель.

Около 90% сбоев выявляем до обращения пользователей — это показатель раннего обнаружения, а не обещание предотвратить каждый инцидент. Автоматическая заявка запускает работу, но не заменяет разбор и устранение инженером.

Сейчас
С услугой
Алерты мониторинга падают в очередь заявок и закрываются инженером вручную — по одному, без заявителя и без оценки.

Событие закрывается само при восстановлении, а заявка создаётся только по правилу повторяемости. В кейсе группы компаний это вернуло инженерам около 64 часов в год.

О заполненном диске или упавшей службе узнают, когда работа уже встала.

Пороги настроены так, чтобы сигнал приходил заранее — на росте, а не по факту остановки. У события появляется исполнитель, а не просто отметка на экране.

Уведомления идут на общую почту, которую никто не открывает, и тонут среди рассылок.

Согласованное отклонение создаёт заявку в общей очереди: с номером, приоритетом и ответственным. Путь сигнала проверяем контрольным событием.

Сигналов так много, что важное теряется, и на них перестают реагировать вовсе.

Шумные правила пересматриваем, зависимости настраиваем так, чтобы падение одного узла не порождало десяток одинаковых событий. Тишина здесь ценнее полноты.

Задания резервного копирования падают, но узнают об этом при попытке восстановиться.

Ошибки заданий превращаются в события и заявки. Проверка самого восстановления — отдельная работа, и мы говорим об этом прямо.

Плановые работы вызывают лавину ложных сигналов, и потом их долго разбирают.

Окна плановых работ согласованы заранее: во время обслуживания сигналы не поднимают тревогу, а после него наблюдение включается само.

Руководитель видит отдельные аварии, но не понимает, что повторяется и к чему идёт.

В ежемесячном отчёте видны доступность, перегрузки, повторяющиеся события и места, за которыми пока никто не наблюдает.

Покажем, что имеет смысл поставить под наблюдение в первую очередь. Расскажите, о каких сбоях у вас узнают от сотрудников.

Что наблюдается и по каким правилам

Узлы и сервисы, показатели и пороги, каналы уведомлений, правило создания заявки, окна плановых работ и первые действия по сигналу.

Всё это согласуется до запуска системы мониторинга, а не настраивается «по умолчанию».

01Что наблюдаемСерверы, сеть, приложения и их зависимости — с владельцами и указанием, насколько каждое критично.
02Подключение и проверка сбораПодключаем наблюдение к согласованным узлам и сервисам и убеждаемся, что данные действительно приходят.
03Ресурсы серверов и оборудованияДоступность, производительность процессора и памяти, свободное место на дисках, ключевые службы и состояние оборудования.
04Сеть и приложенияСетевые узлы, каналы и удалённые подключения; мониторинг приложений — доступность 1С, почты, сайта и других сервисов.
05События резервного копированияОшибки заданий копирования становятся событиями; проверку восстановления ведут отдельно.
06Пороги, окна и заявкиПороги, окна плановых работ, получатели уведомлений, правило создания заявки и ответственные.

Как подключаем мониторинг

Внедрение системы мониторинга начинаем с сервисов, без которых бизнес не работает, и их зависимостей.

Снимаем текущие значения, выбираем показатели, пороги и окна плановых работ. После подключения проверяем контрольным событием весь путь: сигнал, уведомление, заявка, исполнитель. Дальше убираем шумные правила, добавляем новые узлы и разбираем повторяющиеся события.

  1. 01

    Определяем, что наблюдать

    Бизнес-сервисы, серверы, сеть, приложения, зависимости, владельцы и критичность каждого.

  2. 02

    Снимаем текущие значения

    Доступы, нагрузка, свободное место, службы, каналы и состояние заданий копирования.

  3. 03

    Настраиваем наблюдение

    Подключаем узлы, задаём показатели, пороги, зависимости, окна плановых работ и панели.

  4. 04

    Проверяем весь путь

    Контрольное событие: сигнал, уведомление, заявка, приоритет и ответственный за реакцию.

  5. 05

    Ведём и пересматриваем

    Убираем шум, добавляем новые узлы, разбираем повторяющиеся события и обновляем пороги.

Что остаётся у компании

Перечень наблюдаемых систем с владельцами, согласованные показатели и пороги, работающие уведомления, автоматические заявки и ежемесячная картина по отклонениям.

Перечень наблюдаемогоСерверы, сеть, приложения и зависимости — с критичностью и владельцами.
Показатели и порогиДля каждого узла записаны показатель, порог, зависимость, период и источник данных.
Правила событийПриоритеты, окна плановых работ, получатели и условия появления сигнала зафиксированы.
Связь с заявкамиСогласованное отклонение создаёт заявку с узлом, показателем, временем и ответственным.
Проверенная доставкаКонтрольные события подтверждают, что уведомление и заявка доходят до человека.
Отчёт по состояниюДоступность, перегрузки, повторяющиеся сигналы и пробелы наблюдения — для разбора.

Сроки и границы

Что означает круглосуточный мониторинг

Система контроля работает 24/7 и охватывает согласованные серверы, системы, ресурсы и события.

Что фиксируем в договоре

  • Реакция до 15 минут на критичный сбой — начало работы, а не устранение.
  • Режим работы инженеров, приоритеты и сроки задаёт договор.

Что согласуем отдельно

  • Круглосуточная обработка любых пользовательских заявок — круглосуточный мониторинг этого не означает.
  • Проверка восстановления из копий — отдельная работа.
  • 24/7наблюдение за согласованными системами
  • до 15 минутреакция на критичную аварию

У каждого согласованного события есть маршрут

Около 90% сбоев выявляются до обращения пользователей — это измеренный показатель, а не обещание для любых систем

Ошибки заданий копирования создают заявки при настроенной связи

Наблюдение помогает заметить отклонение раньше и снижает вероятность аварии, но отсутствия сбоев не гарантирует.

Разбор под капотом

Разбор: путь от сигнала до инженера

Система мониторинга ИТ-инфраструктуры собирает показатели с сервера, сетевого узла или сервиса и сравнивает их с согласованным порогом. Если отклонение попадает в правило, поднимается событие: у него есть узел, показатель, время и критичность. Согласованное событие создаёт заявку — с исполнителем и сроками по договору. Зависимости в мониторинге сети настроены так, чтобы падение канала не превращалось в двадцать одинаковых сигналов. Во время плановых работ действует окно тишины. Дальше событие разбирает инженер: наблюдение показывает отклонение, но чинит человек.

«Наблюдение полезно ровно настолько, насколько понятен маршрут после сигнала.»

Иванов Николай Владимирович — основатель и руководитель Визард-АйТи

Что происходит после сигнала и в какие сроки — задаёт соглашение об уровне сервиса.

Перейти к связанной услуге

Кто работает с событиями

Первая линия принимает автоматическую заявку, проверяет данные и ведёт общение.

Инженер по инфраструктуре настраивает показатели и пороги и разбирает сложные случаи. Сетевой инженер отвечает за наблюдение за сетевыми узлами и каналами. Руководитель сервиса согласует приоритеты, сроки и отчётность. Это роли штатной команды: 20 штатных инженеров, без фриланса и ИТ-субподряда.

Первая линия

Принимает автоматическую заявку, проверяет данные, ведёт общение и назначение исполнителя.

Инженер по инфраструктуре

Настраивает показатели и пороги, разбирает технический контекст и ведёт сложный случай.

Сетевой инженер

Следит за состоянием сетевых узлов и каналов; изменения в сети оформляются отдельно.

Руководитель сервиса

Согласует приоритеты, порядок передачи дальше, сроки, отчётность и пересмотр состава наблюдения.

«Сигнал без ответственного бесполезен: поэтому маршрут события настраиваем раньше, чем сами пороги.»
Иванов Николай Владимирович — основатель и руководитель Визард-АйТи

С какими системами мониторинга работаем

Подключаемся к тому, что уже работает у компании.

Если решения для мониторинга частично настроены своими силами, сначала смотрим их — переделывать с нуля обычно не требуется.

Zabbix
MS Windows Server
Linux
MikroTik
Veeam
Active Directory

Стоимость

Как считается ежемесячный платёж

от 15 000 ₽ в месяц для 5–10 серверов. Ежемесячный платёж зависит от числа узлов и сервисов, глубины показателей, требований к срокам реакции и связи с приёмом заявок. Подготовим предварительное предложение в течение 48 часов после того, как получим достаточно данных о вашей ИТ-инфраструктуре и задачах.

Мониторинг ИТ-инфраструктуры

от 15 000 ₽/мес для 5–10 серверов

Цена указана за наблюдение 5–10 серверов. Итоговая сумма зависит от числа серверов и сервисов, состава и глубины хранения метрик, а также требований к времени реакции и решения (SLA).

Что влияет на цену

  • число серверов
  • состав метрик
  • реакция на события
  • интеграции
Все цены и условия

Материалы о показателях и сроках

Разбор ускорения 1С показывает, как сопоставлять показатели разных слоёв, материал о сроках отделяет реакцию от решения, а статья об автоалертах объясняет, когда событие мониторинга должно стать заявкой.

Правила обработки автоалертов можно скачать ниже.

Связанные материалы блога

Вопросы о мониторинге инфраструктуры

Разбираем то, о чём спрашивают перед запуском ИТ-мониторинга: что именно наблюдается, как согласуются пороги, когда создаётся заявка, как определяется приоритет, от чего зависит реакция инженера, что попадает в отчёт и как читать цену.

Какие системы и показатели наблюдаются?
Те, о которых договорились: серверы и виртуальные машины, сетевые узлы и каналы, ключевые приложения — 1С, почта, сайт, файловые сервисы. По каждому смотрим доступность, свободное место на дисках, нагрузку на процессор и память, работу ключевых служб и другие согласованные параметры. Для отдельных систем можем отслеживать и события безопасности, если это предусмотрено регламентом.
Как согласуются пороги?
Сначала снимаем текущие значения — иначе порог окажется либо бесполезным, либо шумным. Затем выбираем уровень, при котором ещё есть время среагировать: сигнал о месте на диске должен приходить не при полном заполнении, а когда его хватит на несколько дней работы. Пороги пересматриваем: система меняется, и настройки годовой давности начинают врать.
Когда создаётся заявка?
При отклонениях, которые заранее признаны требующими действий. Не каждый сигнал становится заявкой: часть событий информационные, часть гасится зависимостями, часть попадает в окно плановых работ. Правило создания заявки согласуем до запуска — вместе с тем, кто её получает.
Как определяется приоритет?
По влиянию на работу компании: остановка критичной функции, заметная деградация, обычное отклонение или плановая задача. Критичность узла определяется заранее — при описи систем, а не в момент аварии. Приоритет события наследуется от неё и от характера отклонения.
От чего зависит реакция инженера?
От критичности события и от договора. Круглосуточное наблюдение не означает, что ночью кто-то немедленно чинит любую заявку: график работы инженеров, сроки реакции и порядок вызова при аварии записываются отдельно. Работа по ночам и выходным возможна, но только если она в договоре.
Что попадает в отчётность?
Ежемесячный отчёт доступен всем клиентам на сопровождении: доступность наблюдаемых систем, события по приоритетам, повторяющиеся отклонения, перегрузки и предложения — что стоит починить, расширить или взять под наблюдение дополнительно. Внутри разбираем время реакции и решения и повторяющиеся проблемы.
Как считается ежемесячный платёж?
от 15 000 ₽ в месяц для 5–10 серверов. Платёж зависит от числа узлов и сервисов, глубины показателей, требований к срокам реакции и связи с приёмом заявок. Подготовим предварительное предложение в течение 48 часов после того, как получим достаточно данных о вашей ИТ-инфраструктуре и задачах.
Заменит ли наблюдение резервное копирование?
Нет. Мы видим ошибки заданий копирования и превращаем их в заявки, но это не то же самое, что проверенное восстановление. Состав копий, хранение и регулярная проверка восстановления — соседняя услуга, и одна другую не отменяет.
Что если наблюдение уже частично настроено?
Обычно это плюс. Смотрим, что уже собирает ваша система мониторинга, какие пороги заданы и куда уходят уведомления, — и достраиваем недостающее. Переделывать с нуля ради переделки мы не предлагаем.

Смежные услуги направления

Наблюдение опирается на записанные сроки реакции и на резервное копирование, а сами системы — серверы, сеть, почта и телефония — меняются в соседних услугах.

Покажем, что сейчас остаётся без наблюдения

Перечислите серверы, сервисы и площадки, их критичность и текущие оповещения. Подготовим состав наблюдения и расчёт.

Информация о порядке обработки данных приведена в Политике обработки персональных данных.

Первый звонок инженера — около 30 минут в рабочее время. Разбираем вашу ситуацию, без презентации.

Информация о порядке обработки данных приведена в Политике обработки персональных данных.

Первый звонок инженера — около 30 минут в рабочее время. NDA подписываем по первому требованию, обращение ни к чему не обязывает.

Начните вводить запрос

Поиск по услугам, статьям и страницам