vLLM Semantic Router

Роутер, который направляет каждый запрос к оптимальной модели из пула

github.com ↗
 Публичный пост

Что это

vLLM Semantic Router — открытый проект под эгидой vLLM, который ставится между клиентом и набором LLM (локальных, приватных или облачных вроде GPT, Claude, Gemini, DeepSeek, Qwen, Llama, Mistral) и решает, какой именно модели отдать конкретный запрос. Решение принимается по сигналам: домен запроса, риск jailbreak-атаки, наличие персональных данных, вероятность галлюцинации, история диалога — всего заявлено около 16 типов сигналов и порядка 12 стратегий маршрутизации (правила, эвристики по задержке, ML-классификация, reinforcement learning). Есть встроенное семантическое кэширование ответов с настройками порога схожести и TTL по категориям запросов, а также слой безопасности: обнаружение jailbreak, детекция PII, проверка фактической точности до выполнения запроса.

Для участника клуба это способ собрать за одной точкой входа сразу пул моделей и не думать вручную, какую модель вызывать под задачу: рутинные и простые промпты (черновой текст, парафраз, шаблонные ответы) роутер отправит в дешёвую/быструю модель, а сложные рассуждения или код — в более мощную. В связке с n8n или собственным API-слоем это снижает счёт за токены и добавляет единый рубеж безопасности (фильтр джейлбрейков и утечек данных) перед тем, как запрос вообще попадёт в модель.

Проект активно развивается: на середину 2026 года вышли релизы 0.1 (Iris, январь 2026) и 0.2 (Athena, март 2026), в репозитории около 4.8 тысяч звёзд и 731 форк. Установка — через официальный install-скрипт (curl | bash) или pip на Windows, дальше доступны CLI и локальный дашборд.

Возможности

  • Маршрутизация запроса между несколькими LLM (локальные, приватные, облачные) по сигналам домена, стоимости, задержки и приватности
  • Около 16 типов сигналов для анализа запроса: классификация домена, детекция jailbreak, риск утечки PII, оценка галлюцинаций
  • Порядка 12 стратегий выбора модели: правила, эвристики по latency, ML-классификация, reinforcement learning
  • Семантическое кэширование ответов с настраиваемым порогом схожести и TTL по категориям запросов
  • Встроенная защита: обнаружение jailbreak-попыток и утечек чувствительных данных до отправки запроса в модель
  • Работает как Envoy External Processor между клиентом и бэкендами моделей
  • Открытый исходный код на Go, Python, TypeScript, Rust; лицензия Apache-2.0
  • Установка одной командой (install.sh), CLI и локальный дашборд для мониторинга и экспериментов

Цена: Полностью открытый проект (Apache-2.0), платных тарифов нет; расходы возникают только на стороне подключаемых LLM-провайдеров

Откомментируйте первым 👇

😎

Автор поста открыл его для большого интернета, но комментирование и движухи доступны только участникам Клуба

Что вообще здесь происходит?


Войти  или  Вступить в Клуб