Files
healthlog/docs/backlog/stats-nablyudaemost.md
T
av 03edf1087d Каталог разрезов и измеренный род агрегации
- род метрики выводится сверкой минутного слоя с часовым: часовое значение
  сходится с суммой минутных — накопительная, со средним — мгновенная, иначе
  `unknown` и свёртка не предлагается вовсе. На живом архиве (123 доставки,
  31 метрика) 7 накопительных, 9 мгновенных, противоречащих часов ноль
- `GET /api/v1/metrics` под токеном чтения отдаёт единицы, слои с границами и
  род вместе с основанием измерения; род нигде не хранится — он функция витрины,
  а витрина функция журнала, устаревать в нём нечему
- миграция 00009: покрывающий индекс, чтобы каталог отвечал по учётным колонкам,
  не разжимая содержимое объектов
2026-08-02 19:23:59 +03:00

4.6 KiB
Raw Blame History

Наблюдаемость: /stats

Приоритет: средний

Тихо сломавшаяся автоматизация — главный эксплуатационный риск коллектора: данные просто перестают приходить, и заметить это можно только по молчанию. Расписание HAE — пожелание, а не гарантия (находка 28), так что молчание случается штатно.

/stats отвечает на «жив ли поток» без чтения логов: последняя доставка по каждой автоматизации, счётчики за сутки, тишина в часах, доля доставок с ошибкой разбора, строки без кода в словаре категориальных значений.

Готово, когда по одному запросу видно, какая из автоматизаций замолчала и когда.

Отдельной строкой — отставание фоновой свёртки: длина очереди (parse_status = 'pending') и возраст самой старой неразобранной доставки. Сегодня об этом говорят только две метки в логе (WARN «доставка ждала свёртки дольше пяти минут» и INFO о размере задолженности при старте), а /healthz статичен и здорового сервиса от сервиса с сотней несвёрнутых тел не отличает. Пришло из задачи «Разнести ответ приёма и свёртку доставки»: там числа намеренно не заводились, чтобы не предрешать форму счётчиков этой задачи.

Длина очереди обязана быть видна и без WARN. После миграции, переводящей доставки в pending, весь исторический бэклог встаёт в очередь перед свежими доставками, а warnLag на это время намеренно подавлен (startupDone) — то есть отставание по конструкции не WARN-ится ровно тогда, когда оно максимально, и бэклог идёт молча при зелёном /healthz. Пришло из дозакрытия находок ревью по слиянию сущностей (проход ops, находка O1); оракула нет — он потребовал бы десятков тысяч доставок.

Активное уведомление — отдельная задача, здесь только факт.

Что добавил каталог рода агрегации. Реальный сценарий поломки измерения — не противоречие свидетельств (его на корпусе не бывает), а их исчезновение: владелец переставил автоматизацию HAE, минутный слой перестал приходить, метрики одна за другой уезжают в unknown, Read API перестаёт агрегировать — и в логах ноль событий. Сюда же вторая половина: пять разных причин непригодности часа (две точки у часового объекта, невыровненная метка, нет числа, мало минутных, неразличимость) схлопнуты в одну разность hours compared, поэтому «HAE переименовал поле точки» неотличимо от «данных мало». Оба сигнала естественно живут в /stats: число метрик по родам и число метрик с compared == 0 при непустом окне.

Корреляция у контура чтения. В записи http request нет ни идентификатора запроса, ни адреса клиента: жалобу потребителя не сопоставить с записью, а выгрузку каталога посторонним — не отличить от планового опроса агента. У приёма корреляция есть (delivery_id), у чтения аналога нет.