Разбираем новый релиз от NVIDIA: как модель Nemotron 3.5 Lightning с архитектурой MoE и гибридным Mamba-Transformer меняет правила игры для высоконагруженных AI-агентов.

11 августа 2026 года NVIDIA совершила мощный камбэк в сегмент open-source решений, представив Nemotron 3.5 Lightning. Это не просто очередное обновление линейки, а стратегический сдвиг в сторону создания высокопроизводительного 'слоя исполнения' (execution layer) для автономных AI-агентов. В то время как индустрия гонится за гигантскими параметрами, NVIDIA делает ставку на невероятную плотность интеллекта и скорость работы.
Nemotron 3.5 Lightning задуман как идеальный партнер для тяжелых оркестраторов, таких как Nemotron 3 Ultra. Если флагманские модели отвечают за планирование и сложные рассуждения, то Lightning берет на себя рутинную, но критически важную работу в режиме 'always-on', обеспечивая минимальную задержку и максимальную пропускную способность.
Техническая начинка модели впечатляет инженеров. Nemotron 3.5 Lightning использует архитектуру Mixture-of-Experts (MoE), где общее количество параметров составляет 31.6B, но при этом в каждый момент времени активируется всего 3.6B параметров. Это позволяет достичь феноменальной скорости генерации, сохраняя при этом глубокие знания, характерные для гораздо более крупных моделей.
Одной из ключевых особенностей является сохранение гибридной архитектуры Mamba-Transformer, унаследованной от Nemotron 3 Nano. Такое сочетание позволяет эффективно обрабатывать сверхдлинные контексты, минимизируя квадратичную сложность внимания Transformer за счет линейной масштабируемости механизмов Mamba. Это критически важно для работы с контекстным окном в 1 миллион токенов.
Результаты на Intelligence Index заставляют пересмотреть взгляды на эффективность малых моделей. Nemotron 3.5 Lightning набрал 24 балла, что на 9 пунктов выше, чем у его предшественника (15 баллов). Для сравнения: этот результат идентичен показателям OpenAI gpt-oss-120b, при том что Lightning использует в четыре раза меньше параметров. Единственная модель, опережающая его в этом рейтинге — это Nemotron 3 Super, которая в 4 раза больше по размеру.
Особого внимания заслуживает прогресс в агентских задачах. На бенчмарке GDPval-AA v2 модель показала прирост ELO на +334 пункта, обойдя как gpt-oss-120b, так и Nemotron 3 Super. В задачах работы с терминалом (Terminal-Bench v2.1) точность подскочила с 7% до невероятных 24%. Это делает модель одним из лучших инструментов для автоматизации DevOps и системного администрирования.
NVIDIA поставляется модель вместе с практически безпотерьным квантованием NVFP4. Это позволяет запускать модель на потребительском оборудовании (ноутбуках и десктопах с GPU NVIDIA) без значительной деградации интеллекта. Тесты показывают, что веса в формате NVFP4 сохраняют тот же балл 24 на Intelligence Index, что и полноразмерная модель.
Такая оптимизация в сочетании с архитектурой MoE превращает Nemotron 3.5 Lightning в идеальный инструмент для edge-вычислений и локального развертывания в корпоративных средах, где важна приватность данных и низкая стоимость владения.
Модель не существует в вакууме. NVIDIA представила библиотеку NVIDIA NeMo Switchyard, которая работает как интеллектуальный роутер. Switchyard анализирует входящую задачу и автоматически направляет ее на наиболее подходящую модель: легкую Lightning для простых запросов или тяжелую Ultra для сложных рассуждений. Это позволяет снизить затраты на токены до трети от стандартных сценариев.
Для обеспечения безопасности и управления 'всегда включенными' (always-on) агентами используется стек NVIDIA NemoClaw. Он поддерживает такие инструменты, как OpenClaw и Hermes Agent, обеспечивая надежный контроль над жизненным циклом автономных систем.
Благодаря своей архитектуре и скорости, Nemotron 3.5 Lightning находит применение в нескольких ключевых областях. Во-первых, это создание высоконагруженных AI-агентов, которые должны реагировать мгновенно. Во-вторых, это задачи RAG (Retrieval-Augmented Generation) с огромными объемами данных благодаря окну в 1 млн токенов.
Также модель идеально подходит для автоматизации кодинга, написания скриптов и управления терминалом, что подтверждается результатами бенчмарков. Это надежный 'рабочий муравей' для любой современной AI-инфраструктуры.
Разработчики могут получить доступ к весам модели на Hugging Face (версия NVFP4). Для тех, кто предпочитает облачное решение, модель уже доступна через эндпоинты DeepInfra, демонстрируя впечатляющую скорость в 670 токенов в секунду. Для интеграции в корпоративные системы рекомендуется использовать стек NeMo для максимальной оптимизации затрат и производительности.
API Pricing — Context: 1M tokens