Получить КП

NVIDIA выпустила Nemotron-Labs-TwoTower — open-weight диффузионную LLM с ускорением 2,42×

NVIDIA выпустила Nemotron-Labs-TwoTower — open-weight диффузионную LLM с ускорением 2,42×

Согласно официальному блогу NVIDIA и модели на Hugging Face, 2 июля 2026 года NVIDIA Research выпустила Nemotron-Labs-TwoTower — open-weight диффузионную языковую модель на базе предобученного автокорреляционного бэкбоуна Nemotron-3-Nano-30B-A3B. Как сообщает разработчик, архитектура использует две копии одной и той же 52-слойной гибридной сети Mamba-2/attention/MoE, разделив функции: замороженная башня контекста обрабатывает промпт, а обучаемая диффузионная башня записывает токены целыми блоками вместо одного токена за раз.

Как это работает

По данным NVIDIA, TwoTower решает ключевое ограничение автокорреляционных LLM — последовательное декодирование одного токена за раз. Модель клонирует предобученные веса Nemotron-3-Nano дважды:

  • AR/Context Tower (заморожена) — обрабатывает чистый промпт и уже зафиксированные токены, экспортируя KV-кеш и Mamba-2-состояния на каждом слое
  • Diffusion/Denoiser Tower (обучаема) — генерирует блок токенов за раз через mask-диффузию: инициализирует 16 позиций как [MASK], затем за 16 шагов денойзинга фиксирует токены с порогом уверенности 0,8

При стандартных настройках (блок 16 токенов, 16 шагов денойзинга, BF16 на 2× H100) модель выдаёт 98,7% агрегированного benchmark-качества базовой AR-модели при 2,42× приросте пропускной способности генерации.

Ключевые характеристики

  • Архитектура: Two-Tower Block-Diffusion (Mamba-2/Attention/MoE, 52 слоя на башню)
  • Параметры: ~60 млрд суммарно (30+30), активных ~3 млрд на токен (128 экспертов, 6 активных на токен)
  • Контекст: до 128K токенов
  • Лицензия: NVIDIA Open Model License — коммерческое использование разрешено

Обучен только денойзер на ~2,1 трлн токенов; AR-башня остаётся замороженной, что исключает катастрофическое забывание.

Производительность по бенчмаркам

Данные из model card на Hugging Face показывают, что TwoTower почти не теряет качество на задачах знания и чтения, но кодовые и математические задачи проседают сильнее: HumanEval теряет ~3,7 пункта, MATH-500 — ~3,8. Для production-нагрузок с интенсивным циклом кодинга NVIDIA рекомендует предварительное тестирование на своём репозитории.

Доступность и запуск

Веса доступны на Hugging Face под именем nvidia/Nemotron-Labs-TwoTower-30B-A3B-Base-BF16. Поддерживаются:

  • Transformers — с trust_remote_code=True, размещение башен на двух GPU
  • vLLM — OpenAI-совместимый API на порту 8000
  • SGLang — с поддержкой Docker (docker model run)

Для полного диффузионного режима требуется 2 GPU с 80 ГБ VRAM. Возможен AR-only режим на одной H100/A100.

Значение для рынка

Выпуск Nemotron-Labs-TwoTower — знаковое событие для open-source сегмента AI. Это одна из первых production-ready диффузионных LLM от крупного вендора, которая не требует обучения с нуля, а адаптирует существующую предобученную модель через дообучение. Для компаний, строящих агентные системы с высокой частотой инференс-вызовов, ускорение 2,42× на генерации токенов означает снижение latency и стоимости в циклах с большим числом коротких шагов. При этом TwoTower — исследовательский релиз; production-интеграция с vLLM и SGLang ещё требует доработок.

Lisa AI — оптовый поставщик корпоративного API-доступа к нейросетям в РФ — предоставляет прямой доступ к 100+ LLM для юридических лиц. Оплата по счёту с НДС, закрывающие документы, запуск за 1–3 дня. Оставьте заявку на lisa-ai.ru.