27 июня 2026 года DeepSeek выпустила и открыла исходный код DSpark — фреймворк спекулятивного декодирования (speculative decoding) для своей флагманской серии моделей DeepSeek-V4. Решение ускоряет генерацию токенов на 60–85% на Flash-варианте и на 57–78% на Pro-варианте без потери качества выходных данных.
Вместе с DSpark компания также опубликовала DeepSpec — полный код для обучения и оценки draft-моделей, используемых в схеме спекулятивного декодирования. Оба репозитория доступны на GitHub DeepSeek.
Как работает DSpark
Спекулятивное декодирование — это техника, при которой лёгкая draft-модель генерирует несколько токенов-кандидатов, а основная модель проверяет их за один проход. Если draft-модель угадала правильно — токены принимаются без повторного вычисления, что даёт многократный прирост скорости.
Ключевые особенности DSpark:
- Lossless-ускорение — выходные данные DSpark идентичны стандартному авторегрессионному декодированию, что подтверждено тестами на идентичность распределений
- Интеграция с V4 — DSpark использует существующие веса DeepSeek-V4-Flash и DeepSeek-V4-Pro, не требуя дообучения основной модели
- Повышение throughput — в производственных тестах пропускная способность выросла на 51% при сохранении качества
- Совместимость с batch-обработкой — ускорение сохраняется и в многопользовательских сценариях
DeepSpec: код для воспроизведения
Вместе с DSpark DeepSeek открыла DeepSpec — полный стек для обучения draft-моделей. Разработчики могут дообучить DraftModel под свои задачи, используя код, контрольные точки и конфигурации из репозитория. Доступны готовые чекпоинты DSpark для DeepSeek-V4-Flash и DeepSeek-V4-Pro.
Проект создан совместно с Пекинским университетом (Peking University). Это не первая коллаборация DeepSeek с академическими кругами: ранее компания совместно с университетами выпускала оптимизации для инференса и исследовательские работы по архитектуре MoE.
Контекст и конкуренция
DSpark продолжает серию оптимизаций инференса от DeepSeek: ранее компания выпустила MTP-1 (Multi-Token Prediction), Eagle-3 и DFlash. По заявлению DeepSeek, DSpark превосходит все предыдущие решения по совокупности скорости и качества.
В индустрии спекулятивное декодирование активно развивают и другие игроки: Google использует собственную реализацию в Gemini, Anthropic применяет аналогичную технику в Claude, а Google DeepMind недавно опубликовала исследование по ускорению генерации через self-speculative decoding. Однако DSpark — первое открытое решение такого уровня для MoE-архитектуры, которое можно самостоятельно развернуть и дообучить.
Что это значит для бизнеса
Для компаний, использующих DeepSeek-V4 через API или в собственной инфраструктуре, DSpark означает:
- Снижение затрат на инференс — те же вычислительные ресурсы обрабатывают на 60–85% больше запросов пользователей
- Улучшение UX — время первого токена (TTFT) сокращается, что критично для чат-приложений и агентов реального времени
- Open-source стратегия — код можно адаптировать под собственные модели или конфигурации, а не полагаться на проприетарные оптимизации вендора
- Развёртывание в изолированных средах — DSpark работает без внешних зависимостей, что важно для on-premise и air-gapped установок
С открытием DSpark и DeepSpec DeepSeek укрепляет позиции в сегменте open-weight моделей, предлагая не только сами модели, но и готовую инфраструктуру для их эффективной эксплуатации.