Files
dev-skills/av-dev-pipeline/skills/review-pipeline/references/calibration.md
T
avandClaude Opus 5 ea84a4fbb3 стоимость ревью: снят проход независимой реализации и самая дорогая модель
Прогоны стали долгими, а счёт в токенах заметным. Разбор шёл не по находкам, а
по статьям расхода. Две названы прямо: убрать reimpl и убрать fable.

reimpl писал свою реализацию узла, не открывая существующую, и диффил по
решениям. Его счёт определялся объёмом вывода — он один писал код, а не читал
его, — и на прогоне это была самая большая строка. Снят по цене.

Профиль deep от этого не похудел, а исчез: reimpl был единственным, чем он
отличался от wide, и без него у двух имён оказался бы один состав. Ровно от
этой болезни лечилась ступень wide решением JJJ — у профиля обязан быть один
правильный ответ, иначе реестр состава нечем проверять. Ступеней три: quick,
standard, wide.

Вместе с профилем снято всё, что обслуживало только его. Барьер стоимости —
он держал дорогой проход, чтобы тот не писал реализацию против кода, который
через час перепишут; дорогого прохода нет, граф стал плоским во всех профилях,
рёбер осталось два вида вместо трёх. Тест «идентичность, слияние, разбор» —
полторы страницы, служившие единственной цели: выбрать deep не по ощущению;
вместе с ним ушёл проектный перечень мест в docs/review.md и его скелет в
каноне. Стадии перенумерованы: 0 гейт, 1 сверка, 2 враждебный и
эксплуатационный, 3 архитектурный, 4 триаж — дыра на месте третьей читалась бы
как пропущенная стадия.

Снятие записано как сознательное сужение, а не как «класс оказался пустым».
calibration.md требует замера на двух проектах перед удалением прохода; замера
не было, было решение о цене. Поэтому в «Честном пределе» стоит строка: «не
знаю, чего не знаю» больше не достаёт никто. Остаток независимого взгляда дают
профиль design и architecture, но альтернативной реализации, с которой можно
сдиффить решения, у конвейера нет. Класс уходит в границы покрытия каждого
прогона, у проекта — в подраздел «перестали проверять сознательно». Без этой
записи снятие через месяц читается как «проверено и признано лишним».

fable снят с троих: review-triage, review-architecture, doc-code-drift — все на
opus. Основание верхней модели «ошибка распространяется дальше самой находки»
осталось, но оно объясняет, почему двое не опускаются до sonnet, а не почему им
нужна ступень выше opus: разницы в пользу более дорогой модели не показал ни
один прогон, а время и счёт она множила. Палитра схлопнулась до двух цветов,
красного в репозитории больше нет, frontmatter.py теперь отвергнет модель вне
sonnet и opus.

Версия канона не поднята сознательно. Проектам всё равно надо снести перечень
мест для deep из docs/review.md, поэтому пункт вписан в «Что сделать проекту»
записи «Версия 4» — её ещё не гонял ни один проект, оба ждут в TODO.

Тема 33 в DECISIONS.md, следствия 127-129.

Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
2026-08-06 19:02:15 +03:00

8.6 KiB
Raw Blame History

Калибровка проходов

Без измерения набор проходов растёт монотонно и вырождается в театр: каждый кажется полезным, потому что иногда что-то говорит. Калибровка отвечает на единственный вопрос — ловит ли проход дефект своего класса.

Процедура (инъекция дефекта)

  1. Взять реальный коммит из истории (git log --oneline), лучше архивированный change с непустым диффом.
  2. Внести в него один дефект того класса, который проход обязан ловить по своему charter'у. Дефект должен быть правдоподобным — таким, какой реально пишет модель, а не карикатурой (panic("TODO") не считается).
  3. Прогнать только этот проход на подготовленном диффе — три раза, каждый в чистом контексте.
  4. Зафиксировать: нашёл n/3, число находок всего, число ложных.
  5. Вердикт:
Результат Вердикт Что делаем
нашёл 3/3 или 2/3, ложных немного keep ничего
нашёл 1/3 или 0/3 retune правим charter — сужаем вход, убираем чек-лист, добавляем оракул
retune уже был дважды подряд drop удаляем проход
находит, но ложных больше трети от всех находок retune триаж съедает больше, чем экономит проход

Вердикты образуют храповик со счётчиком — его-то таблица и не показывает:

stateDiagram-v2
    state "проход в профиле" as live
    state "retune №1 — правка charter'а" as r1
    state "retune №2 — последняя попытка" as r2
    state "проход удалён" as dead

    [*] --> live: заведён и откалиброван ДО включения
    live --> r1: 1/3, 0/3 или ложных больше трети
    r1 --> live: замер keep — счётчик сброшен
    r1 --> r2: снова не ловит
    r2 --> live: замер keep — счётчик сброшен
    r2 --> dead: снова не ловит — это театр

Схема — сводка к таблице вердиктов выше: она добавляет только счётчик, и при расхождении прав таблица.

retune не более двух раз подряд. Проход, не находящий дефект своего класса в 2 из 3 прогонов после двух правок промпта, — это театр. Удалять, а не бесконечно править формулировки: каждая итерация правки промпта стоит дороже, чем отсутствие прохода.

Существующий проход не удаляется без замера. Сначала калибровка, потом решение — иначе удаляется то, что работало, а остаётся то, что громче. Обратный пример уже был: проход про идиоматичность стоял в списке на удаление как «вкусовщина», а замер показал, что он зарабатывает экспериментами против поведения библиотеки и драйвера, — и находка, воспроизведённая числом, отменила решение, принятое по ощущению.

Состав проходов принадлежит плагину, а не проекту

Проходы общие. Проект не может удалить проход — он может не звать его, и тогда это идёт строкой «не запускался» в границы покрытия, как любой другой пропуск. Молча сузить состав нельзя: пропуск прохода не отличим от прохода без находок.

Отсюда два следствия:

  • правка charter'а — правка для всех проектов. Прежде чем сужать формулировку под свою боль, проверь, не место ли ей в документах проекта: предмет проверки живёт там, метод — в charter'е;
  • удаление прохода из плагина требует замера на двух проектах, а не на одном: класс, не всплывший здесь, мог быть единственным работающим там.

Пробы дефектов по проходам

Проба — заготовка инъекции. Список пополняется из журнала проскочивших дефектов (см. review-journal.md): реальный проскочивший дефект — лучшая проба, какая вообще возможна, потому что синтетические смещены в сторону тех, которые уже умеешь придумывать.

Проход Класс дефекта для инъекции Заготовка пробы
review-gate отсутствующая верификация убрать тест на изменённую ветку, оставить код рабочим
review-specs поведение вне спеки добавить незаказанный фолбэк-дефолт на пустом входе
review-code нарушение прозаической конвенции увести штатный отказ мимо единой точки трансляции ошибки
review-rubric нарушенное свойство узла у клиента внешнего сервиса убрать таймаут и протяжку context
review-architecture второй способ завести вторую точку генерации id мимо единой
review-adversary построенный путь принять внешний идентификатор без разбора до запроса в хранилище
review-ops деградация окружения убрать обработку недоступности внешней зависимости в фоновом цикле
review-triage шум подать 20 находок, из них 15 вкусовщина и 3 дубля — проверить потолок и дедуп

Метрик сверх этого не заводим. Precision, корреляция между проходами, стоимость прогона в токенах — всё это красиво звучит и никем не считается вручную; набор показателей, который не собирают, создаёт впечатление измеряемости и тем вреден. Работает ровно один механизм: инъекция дефекта и вердикт. Если корреляция двух проходов действительно бросается в глаза — это видно по полю Найдено проходом в триажированных отчётах и без отдельной метрики.

Когда калибровать

  • при заведении нового прохода — до включения в профиль по умолчанию;
  • при правке charter'а существующего — иначе непонятно, правка помогла или нет;
  • при появлении записи в журнале проскочивших дефектов — калибруем тот проход, который должен был поймать;
  • планово — нет. Календарная калибровка ради галочки сама превращается в театр.