1.3 KiB
Алерты на проблемные контейнеры
Приоритет: высокий
wakapi однажды упал на миграциях и несколько дней крутился в restart-loop —
никто не узнал. Docker считал контейнер «running», пока процесс жив. Нужны два
слоя: (1) healthcheck + start_period в compose-шаблонах, чтобы Docker видел
реальное состояние (окно start_period даёт миграциям отработать); (2) алерты
через Netdata на restart-loop (счётчик перезапусков растёт) и на
container_health_status != healthy дольше M минут, канал нотификаций — один
(Telegram/ntfy — выбрать). restart policy оставляем unless-stopped (алерт +
ручное решение вместо on-failure, который не встаёт после ребута). Опционально
позже — Uptime Kuma для внешнего HTTP-чека по публичным URL.
Полный план: docs/drafts/alerts.md.
Связано: playbook-netdata.yml, compose-шаблоны всех сервисов, project_server_specs.