Алерты и уведомления
Всё управление — во вкладке «Алерты» карточки клиента.
Базовые алерты и пороги
Работают для каждого клиента автоматически:
| Алерт | Условие по умолчанию | Важность |
|---|---|---|
| HostDown | хост недоступен 2 минуты | critical |
| HighCPU | CPU > 85% в течение 5 минут | warning |
| MemoryLow | свободной памяти < 10% в течение 5 минут | warning |
| DiskCritical | диск занят > 90% в течение 2 минут | critical |
| HighLoad | load5 выше 2 × числа ядер 10 минут | warning |
Пороги меняются в блоке «Пороги базовых алертов» — новые значения применяются в течение минуты и действуют только на этого клиента.
Свои правила
Форма «Добавить правило»: название, выражение на PromQL, длительность, важность. Примеры выражений:
node_load1 > 4
rate(node_network_receive_bytes_total[5m]) > 100e6
node_systemd_unit_state{name="nginx.service",state="active"} == 0
Если правило ссылается на метрику, которой в системе ещё никогда не было, первое срабатывание может занять несколько минут (первичная индексация).
Каналы уведомлений
Блок «Каналы уведомлений»: выберите тип и заполните одно поле.
- Telegram — chat_id чата или группы с ботом платформы;
- Email — адрес получателя;
- Webhook — URL, куда придёт POST с JSON (tenant, alert, status, severity, instance, summary).
Фильтры «Слать только»: отметьте важности и/или перечислите имена алертов — канал будет получать только совпадающее. Классическая схема: critical → Telegram дежурному, всё → email.
Тишина (silence)
На время плановых работ заглушите алерт: блок «Тишина» → выберите алерт и срок (час/4 часа/сутки/неделя). Тишина останавливает и уведомления, и запись в историю; активные тишины видны списком, снять можно в любой момент. Чужие тишины недоступны.
История срабатываний
Внизу вкладки — лента событий: имя, статус (активен/решён), время. Обновляется автоматически.