Files

18 lines
1.3 KiB
Markdown

# Алерты на проблемные контейнеры
**Приоритет:** высокий
wakapi однажды упал на миграциях и несколько дней крутился в restart-loop —
никто не узнал. Docker считал контейнер «running», пока процесс жив. Нужны два
слоя: (1) healthcheck + `start_period` в compose-шаблонах, чтобы Docker видел
реальное состояние (окно `start_period` даёт миграциям отработать); (2) алерты
через Netdata на restart-loop (счётчик перезапусков растёт) и на
`container_health_status != healthy` дольше M минут, канал нотификаций — один
(Telegram/ntfy — выбрать). restart policy оставляем `unless-stopped` (алерт +
ручное решение вместо `on-failure`, который не встаёт после ребута). Опционально
позже — Uptime Kuma для внешнего HTTP-чека по публичным URL.
Полный план: [docs/drafts/alerts.md](../drafts/alerts.md).
Связано: playbook-netdata.yml, compose-шаблоны всех сервисов, project_server_specs.