- модель адресует файл номером строки нашего списка вместо копии пути: ответ
на 180 файлов вместо ~15k токенов стоит ~2.5k, усечение сотней снято,
max_files и max_tokens ушли в [recognition], correction-ретрай больше не
переприсылает список
- негодный элемент ответа отбрасывается поимённой причиной, обрыв генерации и
отказ по размеру запроса названы своими причинами, покрытие плана блокирует
авто только при непокрытом видеофайле
- раскладка показывает все файлы раздачи со строками «не в плане» и полным
порядком сортировки; снимок списка файлов лёг рядом с планом (миграция 0012)
Кейс «Harold and the Purple Crayon»: LLM отдал title с кириллической
буквой-двойником, сырое название ушло в запрос TVDB дословно (не нашлось),
а гейт нормализации кир/лат двойники не сворачивал — двойной промах, пустой
список кандидатов, ручной ввод id.
- recognition: санитайзинг человекочитаемых полей плана (title/original_title/
provider_hint) на границе разбора, до валидации: strip control/zero-width,
collapse пробелов, потокенная свёртка homoglyph-двойников по курируемой
кир↔лат таблице. files[].src не трогаем (обязаны биться с торрентом).
- metadata-match: тот же fold в normalize (гейт) как defense-in-depth;
безгодовой второй проход сверки как fallback при известном годе и промахе
первого — восстанавливает off-by-one авто-матчи и пополняет кандидатов
review. В fallback требуем известный год кандидата (год-unknown → review,
не авто); гейт год ±1 и инвариант авто-матча не двигаются.
Спеки recognition/metadata-match обновлены, change заархивирован.
Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com>