Descubre cómo el nuevo modelo MoE de NVIDIA redefine la eficiencia en agentes autónomos con una velocidad de 670 tokens/s y arquitectura híbrida.

El 11 de agosto de 2026 marca un hito en el ecosistema de modelos abiertos. NVIDIA ha lanzado oficialmente Nemotron 3.5 Lightning, el primer modelo de código abierto de la compañía desde que Jensen Huang subrayó la importancia de la democratización del software de IA. Este no es simplemente un modelo más en la biblioteca de Hugging Face; es una pieza de ingeniería diseñada específicamente para resolver el cuello de botella de la ejecución de agentes autónomos.
Para los desarrolladores que construyen sistemas de IA que deben operar de forma constante (always-on), el dilema siempre ha sido la latencia frente a la inteligencia. Nemotron 3.5 Lightning llega para romper este paradigma, posicionándose como la capa de ejecución de alto volumen que complementa a los orquestadores de frontera como Nemotron 3 Ultra.
Nemotron 3.5 Lightning utiliza un diseño de Mixture-of-Experts (MoE) altamente optimizado. Con un total de 31.6 mil millones de parámetros, el modelo solo activa 3.6 mil millones por token, lo que permite una eficiencia computacional sin precedentes. Esta arquitectura permite que el modelo sea lo suficientemente ligero como para ejecutarse en una única GPU de un ordenador de escritorio o portátil, sin sacrificar la capacidad de razonamiento.
Uno de los aspectos técnicos más interesantes es que retiene la arquitectura híbrida Mamba-Transformer heredada de su predecesor, Nemotron 3 Nano. Esta combinación permite gestionar ventanas de contexto masivas de hasta 1 millón de tokens, manteniendo una eficiencia lineal en el procesamiento de secuencias largas, algo crítico para tareas de RAG (Retrieval-Augmented Generation) y análisis de documentos extensos.
Los números hablan por sí solos. En el Artificial Analysis Intelligence Index, Nemotron 3.5 Lightning ha alcanzado una puntuación de 24, lo que representa un salto masivo de +9 puntos respecto al Nemotron 3 Nano (15). Para poner esto en perspectiva, este modelo iguala la inteligencia de OpenAI gpt-oss-120b utilizando aproximadamente una cuarta parte de sus parámetros totales. Solo el Nemotron 3 Super lo supera, pero este último es 4 veces más grande.
En el ámbito de la capacidad agentica, los avances son disruptivos. En el benchmark GDPval-AA v2, el modelo ha ganado +334 puntos ELO, superando tanto a gpt-oss-120b como a Nemotron 3 Super. Además, en Terminal-Bench v2.1, su capacidad para interactuar con entornos de comandos saltó de un modesto 7% en la versión anterior a un impresionante 24%, consolidándolo como un modelo de razonamiento de texto puro excepcional.
La velocidad es el núcleo de la serie 'Lightning'. En pruebas realizadas mediante endpoints de DeepInfra utilizando los pesos finales cuantizados en NVFP4, el modelo alcanzó una velocidad media de salida de casi 670 tokens por segundo. Esta velocidad es vital para aplicaciones de chat en tiempo real y para agentes que deben procesar múltiples pasos de razonamiento en milisegundos.
NVIDIA ha implementado una cuantización NVFP4 casi sin pérdida (near-lossless). Lo más sorprendente es que incluso con esta reducción de precisión para maximizar la velocidad, los pesos NVFP4 mantienen una puntuación de 24 en el Intelligence Index, demostrando que la optimización de hardware y software de NVIDIA está en un nivel de madurez superior.
Nemotron 3.5 Lightning no está diseñado para ser un orquestador generalista, sino el 'músculo' de la ejecución. Su arquitectura lo hace ideal para tareas de alta frecuencia: codificación, razonamiento lógico rápido, ejecución de comandos en terminal y agentes de soporte técnico. Se integra perfectamente en un flujo de trabajo donde un modelo más grande decide la estrategia y Lightning ejecuta las acciones.
Para gestionar esto, NVIDIA introduce la librería NeMo Switchyard, que actúa como un enrutador inteligente. Switchyard puede redirigir tareas entre diferentes modelos para optimizar costes y latencia. Además, el modelo es compatible con los harnesses OpenClaw y Hermes Agent a través del stack de seguridad y gestión NemoClaw, garantizando que los agentes siempre activos sean seguros y manejables en entornos de producción.
Los desarrolladores pueden acceder a Nemotron 3.5 Lightning de varias formas. La opción más rápida es a través de los endpoints de DeepInfra para pruebas de velocidad extrema. Para despliegues locales o en servidores propios, los pesos están disponibles en Hugging Face bajo la licencia OpenMDW-1.1.
Si buscas una integración profesional, se recomienda utilizar el SDK de NeMo para aprovechar las capacidades de enrutamiento de Switchyard y la gestión de seguridad de NemoClaw, permitiendo crear sistemas de agentes que sean tanto escalables como económicamente sostenibles.
API Pricing — Context: 1M tokens