- чистка стоит на каждой точке входа значения метабазы в план — сборка матча,
копия кандидата для ревью, набор закреплённых значений источника и его
чтение: гарантия, поставленная только на запись, обходится данными,
сохранёнными прежними версиями
- название, непригодное как имя каталога (пустое или без единой буквы и
цифры), не подставляется — раздача уходит в review с названной причиной
- гейт подтверждения матча не сдвинут: сравнение с планом идёт по значениям
провайдера, чистится только копия, уходящая дальше
Кейс «Harold and the Purple Crayon»: LLM отдал title с кириллической
буквой-двойником, сырое название ушло в запрос TVDB дословно (не нашлось),
а гейт нормализации кир/лат двойники не сворачивал — двойной промах, пустой
список кандидатов, ручной ввод id.
- recognition: санитайзинг человекочитаемых полей плана (title/original_title/
provider_hint) на границе разбора, до валидации: strip control/zero-width,
collapse пробелов, потокенная свёртка homoglyph-двойников по курируемой
кир↔лат таблице. files[].src не трогаем (обязаны биться с торрентом).
- metadata-match: тот же fold в normalize (гейт) как defense-in-depth;
безгодовой второй проход сверки как fallback при известном годе и промахе
первого — восстанавливает off-by-one авто-матчи и пополняет кандидатов
review. В fallback требуем известный год кандидата (год-unknown → review,
не авто); гейт год ±1 и инвариант авто-матча не двигаются.
Спеки recognition/metadata-match обновлены, change заархивирован.
Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com>