18 lines
1.3 KiB
Markdown
18 lines
1.3 KiB
Markdown
# Алерты на проблемные контейнеры
|
|
|
|
**Приоритет:** высокий
|
|
|
|
wakapi однажды упал на миграциях и несколько дней крутился в restart-loop —
|
|
никто не узнал. Docker считал контейнер «running», пока процесс жив. Нужны два
|
|
слоя: (1) healthcheck + `start_period` в compose-шаблонах, чтобы Docker видел
|
|
реальное состояние (окно `start_period` даёт миграциям отработать); (2) алерты
|
|
через Netdata на restart-loop (счётчик перезапусков растёт) и на
|
|
`container_health_status != healthy` дольше M минут, канал нотификаций — один
|
|
(Telegram/ntfy — выбрать). restart policy оставляем `unless-stopped` (алерт +
|
|
ручное решение вместо `on-failure`, который не встаёт после ребута). Опционально
|
|
позже — Uptime Kuma для внешнего HTTP-чека по публичным URL.
|
|
|
|
Полный план: [docs/drafts/alerts.md](../drafts/alerts.md).
|
|
|
|
Связано: playbook-netdata.yml, compose-шаблоны всех сервисов, project_server_specs.
|