- каталог задач: PLAN.md → ROADMAP.md с каноническими секциями, все 44 записи получили тип, заголовки приведены к форме своего типа - расхождения, найденные судьями канона: исключения инварианта «источник неприкосновенен», инвариант про один активный infohash, UTC в logging.md, поведение из architecture.md заменено ссылками на спеки - триггеры профиля ревью переписаны под умолчание standard
11 lines
1.3 KiB
Markdown
11 lines
1.3 KiB
Markdown
# 🧹 Завести eval-харнес распознавания: корпус кейсов и метрику точности
|
|
|
|
- **Тип:** chore
|
|
- **Категория:** Инфраструктура
|
|
- **Зачем:** смена модели или правка промпта распознавания сейчас вслепую — нет корпуса кейсов и метрики точности, регрессии не видно
|
|
- **Теги:** goal:recognition-accuracy
|
|
|
|
Распознавание — ядро продукта, но смена модели или правка промпта сейчас вслепую: регрессий не видно. Нужен корпус размеченных кейсов (русские релизы, аниме, сезон-паки, репаки, спецвыпуски) и прогон распознавания по нему с метрикой точности (тип/название/год/нумерация). Тогда можно сравнивать LLM-провайдеры и версии промпта по числам. Прогон — отдельной командой (jellybit eval или тестом), на фикстурах, без реального qBittorrent.
|
|
|
|
Связано: specs/recognition.md (конвейер, модель уверенности), пакет recognize.
|