Алерты и уведомления

Всё управление — во вкладке «Алерты» карточки клиента.

Базовые алерты и пороги

Работают для каждого клиента автоматически:

АлертУсловие по умолчаниюВажность
HostDownхост недоступен 2 минутыcritical
HighCPUCPU > 85% в течение 5 минутwarning
MemoryLowсвободной памяти < 10% в течение 5 минутwarning
DiskCriticalдиск занят > 90% в течение 2 минутcritical
HighLoadload5 выше 2 × числа ядер 10 минутwarning

Пороги меняются в блоке «Пороги базовых алертов» — новые значения применяются в течение минуты и действуют только на этого клиента.

Свои правила

Форма «Добавить правило»: название, выражение на PromQL, длительность, важность. Примеры выражений:

node_load1 > 4
rate(node_network_receive_bytes_total[5m]) > 100e6
node_systemd_unit_state{name="nginx.service",state="active"} == 0
Правило видит только метрики этого клиента — изоляция применяется на уровне запроса, обойти её выражением нельзя.

Если правило ссылается на метрику, которой в системе ещё никогда не было, первое срабатывание может занять несколько минут (первичная индексация).

Каналы уведомлений

Блок «Каналы уведомлений»: выберите тип и заполните одно поле.

Фильтры «Слать только»: отметьте важности и/или перечислите имена алертов — канал будет получать только совпадающее. Классическая схема: critical → Telegram дежурному, всё → email.

Тишина (silence)

На время плановых работ заглушите алерт: блок «Тишина» → выберите алерт и срок (час/4 часа/сутки/неделя). Тишина останавливает и уведомления, и запись в историю; активные тишины видны списком, снять можно в любой момент. Чужие тишины недоступны.

История срабатываний

Внизу вкладки — лента событий: имя, статус (активен/решён), время. Обновляется автоматически.