Согласно официальному блогу NVIDIA и модели на Hugging Face, 2 июля 2026 года NVIDIA Research выпустила Nemotron-Labs-TwoTower — open-weight диффузионную языковую модель на базе предобученного автокорреляционного бэкбоуна Nemotron-3-Nano-30B-A3B. Как сообщает разработчик, архитектура использует две копии одной и той же 52-слойной гибридной сети Mamba-2/attention/MoE, разделив функции: замороженная башня контекста обрабатывает промпт, а обучаемая диффузионная башня записывает токены целыми блоками вместо одного токена за раз.
Как это работает
По данным NVIDIA, TwoTower решает ключевое ограничение автокорреляционных LLM — последовательное декодирование одного токена за раз. Модель клонирует предобученные веса Nemotron-3-Nano дважды:
- AR/Context Tower (заморожена) — обрабатывает чистый промпт и уже зафиксированные токены, экспортируя KV-кеш и Mamba-2-состояния на каждом слое
- Diffusion/Denoiser Tower (обучаема) — генерирует блок токенов за раз через mask-диффузию: инициализирует 16 позиций как [MASK], затем за 16 шагов денойзинга фиксирует токены с порогом уверенности 0,8
При стандартных настройках (блок 16 токенов, 16 шагов денойзинга, BF16 на 2× H100) модель выдаёт 98,7% агрегированного benchmark-качества базовой AR-модели при 2,42× приросте пропускной способности генерации.
Ключевые характеристики
- Архитектура: Two-Tower Block-Diffusion (Mamba-2/Attention/MoE, 52 слоя на башню)
- Параметры: ~60 млрд суммарно (30+30), активных ~3 млрд на токен (128 экспертов, 6 активных на токен)
- Контекст: до 128K токенов
- Лицензия: NVIDIA Open Model License — коммерческое использование разрешено
Обучен только денойзер на ~2,1 трлн токенов; AR-башня остаётся замороженной, что исключает катастрофическое забывание.
Производительность по бенчмаркам
Данные из model card на Hugging Face показывают, что TwoTower почти не теряет качество на задачах знания и чтения, но кодовые и математические задачи проседают сильнее: HumanEval теряет ~3,7 пункта, MATH-500 — ~3,8. Для production-нагрузок с интенсивным циклом кодинга NVIDIA рекомендует предварительное тестирование на своём репозитории.
Доступность и запуск
Веса доступны на Hugging Face под именем nvidia/Nemotron-Labs-TwoTower-30B-A3B-Base-BF16. Поддерживаются:
- Transformers — с trust_remote_code=True, размещение башен на двух GPU
- vLLM — OpenAI-совместимый API на порту 8000
- SGLang — с поддержкой Docker (docker model run)
Для полного диффузионного режима требуется 2 GPU с 80 ГБ VRAM. Возможен AR-only режим на одной H100/A100.
Значение для рынка
Выпуск Nemotron-Labs-TwoTower — знаковое событие для open-source сегмента AI. Это одна из первых production-ready диффузионных LLM от крупного вендора, которая не требует обучения с нуля, а адаптирует существующую предобученную модель через дообучение. Для компаний, строящих агентные системы с высокой частотой инференс-вызовов, ускорение 2,42× на генерации токенов означает снижение latency и стоимости в циклах с большим числом коротких шагов. При этом TwoTower — исследовательский релиз; production-интеграция с vLLM и SGLang ещё требует доработок.
Lisa AI — оптовый поставщик корпоративного API-доступа к нейросетям в РФ — предоставляет прямой доступ к 100+ LLM для юридических лиц. Оплата по счёту с НДС, закрывающие документы, запуск за 1–3 дня. Оставьте заявку на lisa-ai.ru.