Получить КП

DeepSeek открыла исходный код DSpark: ускорение инференса V4 до 85% через спекулятивное декодирование

DeepSeek открыла исходный код DSpark: ускорение инференса V4 до 85% через спекулятивное декодирование

27 июня 2026 года DeepSeek выпустила и открыла исходный код DSpark — фреймворк спекулятивного декодирования (speculative decoding) для своей флагманской серии моделей DeepSeek-V4. Решение ускоряет генерацию токенов на 60–85% на Flash-варианте и на 57–78% на Pro-варианте без потери качества выходных данных.

Вместе с DSpark компания также опубликовала DeepSpec — полный код для обучения и оценки draft-моделей, используемых в схеме спекулятивного декодирования. Оба репозитория доступны на GitHub DeepSeek.

Как работает DSpark

Спекулятивное декодирование — это техника, при которой лёгкая draft-модель генерирует несколько токенов-кандидатов, а основная модель проверяет их за один проход. Если draft-модель угадала правильно — токены принимаются без повторного вычисления, что даёт многократный прирост скорости.

Ключевые особенности DSpark:

  • Lossless-ускорение — выходные данные DSpark идентичны стандартному авторегрессионному декодированию, что подтверждено тестами на идентичность распределений
  • Интеграция с V4 — DSpark использует существующие веса DeepSeek-V4-Flash и DeepSeek-V4-Pro, не требуя дообучения основной модели
  • Повышение throughput — в производственных тестах пропускная способность выросла на 51% при сохранении качества
  • Совместимость с batch-обработкой — ускорение сохраняется и в многопользовательских сценариях

DeepSpec: код для воспроизведения

Вместе с DSpark DeepSeek открыла DeepSpec — полный стек для обучения draft-моделей. Разработчики могут дообучить DraftModel под свои задачи, используя код, контрольные точки и конфигурации из репозитория. Доступны готовые чекпоинты DSpark для DeepSeek-V4-Flash и DeepSeek-V4-Pro.

Проект создан совместно с Пекинским университетом (Peking University). Это не первая коллаборация DeepSeek с академическими кругами: ранее компания совместно с университетами выпускала оптимизации для инференса и исследовательские работы по архитектуре MoE.

Контекст и конкуренция

DSpark продолжает серию оптимизаций инференса от DeepSeek: ранее компания выпустила MTP-1 (Multi-Token Prediction), Eagle-3 и DFlash. По заявлению DeepSeek, DSpark превосходит все предыдущие решения по совокупности скорости и качества.

В индустрии спекулятивное декодирование активно развивают и другие игроки: Google использует собственную реализацию в Gemini, Anthropic применяет аналогичную технику в Claude, а Google DeepMind недавно опубликовала исследование по ускорению генерации через self-speculative decoding. Однако DSpark — первое открытое решение такого уровня для MoE-архитектуры, которое можно самостоятельно развернуть и дообучить.

Что это значит для бизнеса

Для компаний, использующих DeepSeek-V4 через API или в собственной инфраструктуре, DSpark означает:

  • Снижение затрат на инференс — те же вычислительные ресурсы обрабатывают на 60–85% больше запросов пользователей
  • Улучшение UX — время первого токена (TTFT) сокращается, что критично для чат-приложений и агентов реального времени
  • Open-source стратегия — код можно адаптировать под собственные модели или конфигурации, а не полагаться на проприетарные оптимизации вендора
  • Развёртывание в изолированных средах — DSpark работает без внешних зависимостей, что важно для on-premise и air-gapped установок

С открытием DSpark и DeepSpec DeepSeek укрепляет позиции в сегменте open-weight моделей, предлагая не только сами модели, но и готовую инфраструктуру для их эффективной эксплуатации.