diet: распознавание и сведение переведены на bothub/gemini-3.8-flash

- обе секции llm ходят в одну модель вместо разных, комментарии
  переписаны под именование моделей через Bifrost
- обновлены секреты в group_vars/all/secrets.yml
This commit is contained in:
av
2026-09-11 09:57:17 +03:00
parent 4ec0ea11b6
commit e281082a66
2 changed files with 274 additions and 275 deletions
+7 -8
View File
@@ -42,11 +42,12 @@ base_url = "http://bifrost_app:8080/openai"
api_key = ""
[llm.recognition]
# Снимки читает vision-модель через bothub — кандидат по умолчанию из замера
# на живых фотографиях (docs/research/2026-08-31-vision-recognition.md
# в репозитории приложения): точность не хуже моделей в девяносто раз дороже.
# Снимки читает vision-модель. Имя здесь — АЛИАС Bifrost, а не модель провайдера:
# правило routing_rules в files/bifrost/config.template.json разворачивает его
# в конкретную пару провайдер+модель и держит за ней цепочку фолбэков на случай,
# когда основная модель у агрегатора временно недоступна. Менять модель — там.
type = "openai-compat"
model = "bothub/gemini-3.1-flash-lite"
model = "bothub/gemini-3.8-flash"
# Умолчание в минуту обрывает первый за долгое время вызов: 65,9 с 6 сентября
# 2026, тогда как следующие за ним укладывались в 6–10 с. Ждал не шлюз и не наш
@@ -58,12 +59,10 @@ model = "bothub/gemini-3.1-flash-lite"
# наружу этим не лечится.
timeout = "2m"
# Сведение позиций. Тоже алиас Bifrost — см. комментарий выше.
[llm.composition]
# Сведение позиций. Модель медленнее соседки по шлюзу, зато честно говорит
# «не знаю» о незнакомом продукте вместо выдуманного КБЖУ. Разбор фоновый,
# человек ответа у экрана не ждёт, поэтому ожидание здесь дешевле выдумки.
type = "openai-compat"
model = "bothub/deepseek-v4-flash"
model = "bothub/gemini-3.8-flash"
# Замер давал этой модели 19–70 секунд на ответ, то есть умолчание в минуту
# обрывало бы её самые долгие ответы, засчитывая их временной неудачей.