Découvrez Nemotron 3.5 Lightning, le nouveau modèle open-weights de NVIDIA qui redéfinit l'efficacité des agents autonomes avec une architecture hybride Mamba-Transformer.

Le paysage de l'IA générative franchit une nouvelle étape cruciale avec la sortie de NVIDIA Nemotron 3.5 Lightning, le 11 août 2026. Alors que l'industrie s'est longtemps concentrée sur la course aux paramètres toujours plus massifs, NVIDIA change de paradigme en proposant un modèle conçu spécifiquement pour l'exécution à haute fréquence par des agents autonomes.
Ce modèle marque le retour de NVIDIA sur le terrain de l'open-source avec une licence permissive OpenMDW-1.1, permettant une utilisation commerciale sans restrictions matérielles majeures. Contrairement aux modèles d'orchestration massifs comme Nemotron 3 Ultra, la version Lightning est pensée pour être la couche d'exécution 'always-on', capable de traiter des volumes de tokens colossaux avec une latence minimale.
Sous le capot, Nemotron 3.5 Lightning repose sur une architecture Mixture-of-Experts (MoE) extrêmement optimisée. Avec un total de 31,6 milliards de paramètres, le modèle ne mobilise que 3,6 milliards de paramètres actifs par token. Cette conception permet de conserver une intelligence de haut niveau tout en réduisant drastiquement le coût computationnel par inférence.
L'innovation majeure réside dans la conservation de l'architecture hybride Mamba-Transformer héritée du Nemotron 3 Nano. Cette combinaison permet de bénéficier de la capacité de raisonnement des Transformers tout en exploitant l'efficacité de traitement séquentiel de Mamba, idéal pour gérer de très longues séquences sans l'explosion quadratique de la complexité.
Les résultats de NVIDIA sont sans appel : Nemotron 3.5 Lightning atteint un score de 24 sur l'Artificial Analysis Intelligence Index, marquant un bond de +9 points par rapport au Nemotron 3 Nano (15). Pour mettre cela en perspective, ce modèle égale les performances de l'OpenAI gpt-oss-120b avec environ quatre fois moins de paramètres totaux.
Le gain est encore plus spectaculaire sur les tâches agentiques. Sur le benchmark GDPval-AA v2, le modèle enregistre une progression de +334 ELO, surpassant à la fois le gpt-oss-120b et le Nemotron 3 Super. Sur Terminal-Bench v2.1, il passe de 7% à 24%, prouvant sa capacité à manipuler des environnements complexes et des interfaces de ligne de commande.
NVIDIA a intégré une quantification NVFP4 (Near-Lossless) directement dans le déploiement. Cette technique permet de réduire l'empreinte mémoire sans sacrifier l'intelligence : les poids quantifiés en NVFP4 conservent un score de 24 sur l'Intelligence Index. Cela signifie que vous pouvez faire tourner des modèles extrêmement intelligents sur du matériel grand public ou des serveurs optimisés.
La vitesse d'inférence est un autre pilier de ce modèle. Lors des tests sur l'endpoint DeepInfra, les poids finaux NVFP4 ont affiché une vitesse médiane de près de 670 tokens par seconde. Cette vélocité est indispensable pour les applications de chat en temps réel et les boucles de raisonnement d'agents qui doivent itérer rapidement.
Nemotron 3.5 Lightning n'est pas seulement un modèle isolé, c'est une pièce d'un écosystème plus vaste. Il est conçu pour fonctionner en tandem avec la nouvelle bibliothèque NVIDIA NeMo Switchyard. Ce routeur intelligent analyse la complexité de chaque tâche et redirige l'appel vers le modèle le plus approprié, optimisant ainsi les coûts et la latence.
Les développeurs peuvent l'intégrer dans des architectures d'agents complexes via les harnesses OpenClaw et Hermes Agent, soutenus par la stack de sécurité et de gestion NVIDIA NemoClaw. C'est l'outil idéal pour le RAG (Retrieval-Augmented Generation) à grande échelle, le codage assisté et l'automatisation de workflows métier complexes.
Le modèle est disponible dès maintenant sur Hugging Face sous le format NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4. Pour les entreprises souhaitant une intégration rapide, les endpoints de serveurs managés commencent à proposer le support du modèle.
Pour les ingénieurs souhaitant tester l'architecture hybride, nous recommandons d'utiliser le SDK NeMo Gym pour reproduire les benchmarks de NVIDIA et d'explorer la bibliothèque NeMo Switchyard pour orchestrer vos premiers agents multi-modèles.