vLLM Semantic Router
Роутер, который направляет каждый запрос к оптимальной модели из пула
Что это
vLLM Semantic Router — открытый проект под эгидой vLLM, который ставится между клиентом и набором LLM (локальных, приватных или облачных вроде GPT, Claude, Gemini, DeepSeek, Qwen, Llama, Mistral) и решает, какой именно модели отдать конкретный запрос. Решение принимается по сигналам: домен запроса, риск jailbreak-атаки, наличие персональных данных, вероятность галлюцинации, история диалога — всего заявлено около 16 типов сигналов и порядка 12 стратегий маршрутизации (правила, эвристики по задержке, ML-классификация, reinforcement learning). Есть встроенное семантическое кэширование ответов с настройками порога схожести и TTL по категориям запросов, а также слой безопасности: обнаружение jailbreak, детекция PII, проверка фактической точности до выполнения запроса.
Для участника клуба это способ собрать за одной точкой входа сразу пул моделей и не думать вручную, какую модель вызывать под задачу: рутинные и простые промпты (черновой текст, парафраз, шаблонные ответы) роутер отправит в дешёвую/быструю модель, а сложные рассуждения или код — в более мощную. В связке с n8n или собственным API-слоем это снижает счёт за токены и добавляет единый рубеж безопасности (фильтр джейлбрейков и утечек данных) перед тем, как запрос вообще попадёт в модель.
Проект активно развивается: на середину 2026 года вышли релизы 0.1 (Iris, январь 2026) и 0.2 (Athena, март 2026), в репозитории около 4.8 тысяч звёзд и 731 форк. Установка — через официальный install-скрипт (curl | bash) или pip на Windows, дальше доступны CLI и локальный дашборд.
Возможности
- Маршрутизация запроса между несколькими LLM (локальные, приватные, облачные) по сигналам домена, стоимости, задержки и приватности
- Около 16 типов сигналов для анализа запроса: классификация домена, детекция jailbreak, риск утечки PII, оценка галлюцинаций
- Порядка 12 стратегий выбора модели: правила, эвристики по latency, ML-классификация, reinforcement learning
- Семантическое кэширование ответов с настраиваемым порогом схожести и TTL по категориям запросов
- Встроенная защита: обнаружение jailbreak-попыток и утечек чувствительных данных до отправки запроса в модель
- Работает как Envoy External Processor между клиентом и бэкендами моделей
- Открытый исходный код на Go, Python, TypeScript, Rust; лицензия Apache-2.0
- Установка одной командой (install.sh), CLI и локальный дашборд для мониторинга и экспериментов
Цена: Полностью открытый проект (Apache-2.0), платных тарифов нет; расходы возникают только на стороне подключаемых LLM-провайдеров