NVIDIA Nemotron 3.5 Lightning: el modelo de IA abierta que quiere democratizar los agentes inteligentes

Última actualización: agosto 13, 2026
Autor: ForoPC
  • NVIDIA lanza Nemotron 3.5 Lightning, un modelo de IA de código abierto con 30.000 millones de parámetros y arquitectura MoE, optimizado para tareas de agentes.
  • La herramienta NeMo Switchyard promete reducir los costes de ejecución de agentes hasta un 67% mediante enrutamiento inteligente entre modelos.
  • El movimiento refuerza la estrategia de NVIDIA de impulsar la venta de GPUs a través de la IA gratuita y de código abierto.
  • Empresas como CrowdStrike, LangChain o Ramp ya han integrado estas tecnologías en sus flujos de trabajo.

NVIDIA Nemotron 3.5 Lightning modelo de IA

El gigante de los semiconductores ha vuelto a mover ficha en el tablero de la inteligencia artificial. NVIDIA Nemotron 3.5 Lightning llega como un modelo de pesos abiertos, gratuito y pensado para que cualquier empresa pueda descargarlo, modificarlo y ejecutarlo sin pedir permiso ni pagar licencias. La jugada no es casual: la compañía busca que la adopción masiva de agentes de IA termine impulsando la venta de sus GPUs, su verdadero negocio.

Junto al modelo, la firma ha presentado NeMo Switchyard, una biblioteca de código abierto que actúa como un enrutador inteligente. Su función es decidir qué modelo de IA debe encargarse de cada tarea, buscando el equilibrio perfecto entre precisión, velocidad y coste. La combinación de ambas herramientas promete cambiar las reglas del juego en el desarrollo de sistemas multiagente, especialmente en entornos empresariales donde cada milisegundo y cada euro cuentan.

Gemma 4
Related article:
Gemma 4: la apuesta de Google por la IA abierta y local que ya puede funcionar en tu móvil

Un modelo ligero pero con un rendimiento que sorprende

Nemotron 3.5 Lightning utiliza una arquitectura de mezcla de expertos (MoE) con 30.000 millones de parámetros totales, aunque solo activa 3.000 millones por token. Esto permite reducir drásticamente los requisitos computacionales y la latencia, algo fundamental para tareas de alto volumen que requieren respuestas inmediatas. El modelo está diseñado para ejecutar labores específicas como revisión de código, monitorización de alertas de seguridad, uso de herramientas o atención de consultas técnicas, en lugar de mantener conversaciones de propósito general.

  Los nuevos AirPods con cámaras e inteligencia artificial: así quiere Apple que Siri vea lo que tú ves

Según los datos aportados por la compañía, este modelo genera respuestas hasta cuatro veces más rápido que otros modelos abiertos de su categoría y completa tareas aproximadamente un 30% más rápido. En las pruebas internas, alcanza un 86% de precisión en PinchBench, un benchmark especializado en tareas agénticas. Además, incorpora técnicas como speculative decoding y predicción de múltiples tokens, junto con DSpark y DFlash para acelerar la inferencia en diferentes escenarios.

La compañía asegura que el modelo puede ejecutarse sin problemas en una sola GPU de un PC convencional, siempre que cuente con la potencia necesaria. Es compatible con equipos GeForce RTX, NVIDIA DGX Spark, DGX Station e incluso NVIDIA Jetson, lo que abre la puerta a la ejecución de IA local sin depender de la nube. Esto resulta especialmente atractivo para empresas que manejan datos sensibles y prefieren no enviar información confidencial a servidores externos.

NVIDIA NeMo Switchyard enrutamiento inteligente

NeMo Switchyard: el enrutador que recorta la factura de la IA

La segunda pieza del anuncio es NeMo Switchyard, una biblioteca de código abierto disponible en GitHub que actúa como un sistema de enrutamiento inteligente. El software analiza cada petición y la dirige automáticamente al modelo más adecuado, de modo que las consultas sencillas se resuelven con modelos locales o más pequeños, mientras que las tareas complejas se derivan a modelos de mayor tamaño. Este enfoque evita el gasto innecesario de recurrir siempre al modelo más potente y caro disponible.

AMD Instinct MI450
Related article:
AMD y Anthropic sellan una alianza histórica para desplegar 2 GW de GPU Instinct MI450

Los resultados de las pruebas internas son contundentes. La herramienta logra igualar el rendimiento de los modelos más punteros reduciendo los costes a aproximadamente un tercio de lo que supondría utilizar los modelos de Anthropic por sí solo. Ese ahorro del 67% puede hacer viables proyectos de agentes que hoy se descartan por presupuesto, y todo el cómputo seguirá corriendo sobre GPUs de NVIDIA, lo que refuerza la estrategia comercial de la compañía.

Varias empresas ya han comenzado a integrar NeMo Switchyard en sus flujos de trabajo. Boomi logró una precisión del 100% en el enrutamiento de dominios, enviando el 59% del tráfico a un modelo optimizado cinco veces más rápido. LangChain consiguió una reducción del 74% en el coste de 145 tareas de agentes de múltiples turnos, enrutando solo el 7% de las llamadas a un modelo de vanguardia. Ramp igualó el rendimiento de un modelo puntero reduciendo los costes en un 58%. Estos casos demuestran que la orquestación inteligente de modelos es tan importante como el propio modelo.

  Todo lo que se sabe de GPT-5.5-Cyber de OpenAI y su impacto en la ciberseguridad

La estrategia de NVIDIA: regalar software para vender hardware

NVIDIA obtiene la mayor parte de sus ingresos del hardware que ejecuta los modelos de IA, no de los propios modelos. Al ofrecer gratis un modelo abierto y competente, la compañía apuesta a que una IA más económica y accesible atraiga a más desarrolladores y empresas a crear agentes, sabiendo que cada uno de esos agentes necesitará ejecutarse en una GPU, preferiblemente de NVIDIA. El CEO Jensen Huang lo ha dejado claro: «la IA gratuita debería ser excelente para el hardware».

Nvidia GPU
Related article:
NVIDIA y Noetra construyen la mayor fábrica de IA física de Japón

Este movimiento llega en un momento de intenso debate sobre la regulación de los modelos de IA de código abierto. Huang ha defendido públicamente los pesos abiertos y ha advertido contra «restricciones prematuras» que puedan frenar la innovación. La preocupación en Washington se intensificó tras la llegada de Kimi K3 de Moonshot AI, un modelo chino que ha reducido la brecha con los modelos estadounidenses más potentes. La destilación, técnica utilizada para entrenar modelos más pequeños con los resultados de uno mayor, ha sido señalada como un posible riesgo para la seguridad nacional.

Meta también ha entrado en esta carrera. Un día antes del anuncio de NVIDIA, la compañía de Mark Zuckerberg lanzaba Muse Spark, su propio modelo especializado en programación, acompañado de una defensa explícita de la IA de código abierto. La competencia entre gigantes tecnológicos por dominar el ecosistema de modelos abiertos es cada vez más intensa, y NVIDIA no necesita ganar en calidad de modelo, sino en adopción masiva que alimente su ecosistema de aceleración.

  Cómo borrar conversaciones en ChatGPT y controlar tu historial

En el contexto europeo y español, este movimiento podría acelerar proyectos en centros de datos como los de AWS en Aragón o los de Google Cloud en Madrid, donde la demanda de cómputo para IA ya tensiona la capacidad. La posibilidad de ejecutar modelos de IA en local, sin depender de APIs cerradas, resulta especialmente atractiva para sectores regulados como la banca, la sanidad o la administración pública, que manejan datos sensibles y necesitan garantizar la privacidad.

Suministro de CPU para servidores en China
Related article:
Intel y AMD negocian contratos de suministro de CPU para servidores en China ante la demanda de IA

El modelo ya está disponible en Hugging Face, ModelScope, OpenRouter y la propia web de NVIDIA mediante microservicios NIM. Las empresas pueden descargarlo, modificarlo y adaptarlo a sus necesidades concretas utilizando la plataforma NVIDIA NeMo, con datos y flujos de trabajo propios. La combinación de Nemotron 3.5 Lightning y NeMo Switchyard ofrece un mayor control sobre cómo se implementa la IA, dónde se ejecuta y con qué eficiencia funciona, tanto en PC como en estaciones de trabajo, centros de datos y la nube.

La apuesta de NVIDIA por los modelos abiertos no está exenta de riesgos. La creciente disponibilidad de chips alternativos de AMD, Intel o los ASIC de grandes nubes podría diluir la ventaja competitiva de la compañía. Si modelos como Nemotron 3.5 Lightning corren con eficiencia en otros sustratos, la gratuidad del software no garantiza la venta del silicio. La verdadera prueba será ver si las empresas confían sus datos sensibles a un modelo que pueden inspeccionar y ajustar, o prefieren APIs cerradas que no expongan su información. La respuesta definirá no solo el futuro de NVIDIA, sino el mapa de la IA corporativa en los próximos años.

IA Astra
Related article:
Astra, el nuevo modelo de IA de OpenAI: logros matemáticos y pausa por ciberseguridad