Files
pet-project-server/docs/backlog/container-alerts.md
T

1.3 KiB

Алерты на проблемные контейнеры

Приоритет: высокий

wakapi однажды упал на миграциях и несколько дней крутился в restart-loop — никто не узнал. Docker считал контейнер «running», пока процесс жив. Нужны два слоя: (1) healthcheck + start_period в compose-шаблонах, чтобы Docker видел реальное состояние (окно start_period даёт миграциям отработать); (2) алерты через Netdata на restart-loop (счётчик перезапусков растёт) и на container_health_status != healthy дольше M минут, канал нотификаций — один (Telegram/ntfy — выбрать). restart policy оставляем unless-stopped (алерт + ручное решение вместо on-failure, который не встаёт после ребута). Опционально позже — Uptime Kuma для внешнего HTTP-чека по публичным URL.

Полный план: docs/drafts/alerts.md.

Связано: playbook-netdata.yml, compose-шаблоны всех сервисов, project_server_specs.