DeepSpec (DSpark)
открытый набор инструментов DeepSeek для ускорения вывода LLM через спекулятивное декодирование
Что это
DeepSpec — это открытая кодовая база от DeepSeek AI для обучения, подготовки данных и оценки моделей-черновиков, применяемых в технике спекулятивного декодирования: небольшая модель предугадывает несколько токенов вперёд, а основная модель проверяет их пакетом, что снижает задержку генерации. В проект включены три алгоритма-черновика — DSpark, DFlash и Eagle3, с готовыми чекпоинтами под целевые модели Qwen3 (4B, 8B, 14B) и Gemma-4-12B-it. Есть пайплайны для подготовки промптов и кэша ответов целевой модели, обучения черновиков и оценки на бенчмарках (GSM8K, MATH500, HumanEval, MBPP, LiveCodeBench, MT-Bench и др.).
По заявлению DeepSeek, в проде на DeepSeek-V4 такой подход ускоряет генерацию на 60-85% по сравнению с базовым MTP-1. Для участника клуба это интересно не как готовый сервис, а как инженерный инструмент: если кто-то самостоятельно хостит открытые модели (например, через vLLM или собственную инференс-инфраструктуру) для ботов, агентов или пайплайнов контента, DeepSpec даёт рецепт и код, как обучить черновик-модель под свою целевую модель и заметно снизить латентность и стоимость вывода. Для типичного вайб-кодера без своего GPU-кластера практической пользы немного — это скорее материал для тех, кто занимается self-hosted инференсом.
Возможности
- три алгоритма-черновика для спекулятивного декодирования: DSpark, DFlash, Eagle3
- готовые предобученные чекпоинты под Qwen3-4B/8B/14B и Gemma-4-12B-it
- пайплайн подготовки данных: сбор промптов, регенерация ответов целевой модели, кэширование
- код для обучения черновик-моделей на выходах целевой модели
- инструменты оценки на бенчмарках GSM8K, MATH500, HumanEval, MBPP, LiveCodeBench, MT-Bench, AlpacaEval, Arena-Hard
- заявленное ускорение генерации на 60-85% по сравнению с MTP-1 (по данным на DeepSeek-V4)
- открытый исходный код под MIT License с указанием сторонних компонентов в NOTICE
- требует CUDA-совместимые GPU (по умолчанию расчёт на 8 GPU на одном узле)
Цена: полностью открытый код под MIT License, без коммерческих тарифов; расходы только на собственную GPU-инфраструктуру