---
title: "NVIDIA lanza Nemotron 3.5 Lightning y NeMo Switchyard para hacer la IA agéntica más rápida y eficiente"
description: "NVIDIA liberó un modelo abierto de 30 mil millones de parámetros y una librería open source de ruteo entre modelos. En las pruebas de LangChain, enrutar solo el 7% de las llamadas a un modelo frontera bajó el costo 74%."
slug: "nvidia-nemo-switchyard-nemotron-3-5-lightning-74-menos-costo-agentes-26-08-12"
canonical: "https://www.revenuehublatam.com/noticias/ia-ventas/nvidia-nemo-switchyard-nemotron-3-5-lightning-74-menos-costo-agentes-26-08-12"
language: "es"
section: "Noticias"
category: "IA en Ventas"
published: "2026-08-12T10:20:00+00:00"
updated: "2026-08-12T10:20:00+00:00"
tags: ["NVIDIA", "agentes de IA", "modelos abiertos", "costos de IA", "ruteo de modelos"]
keywords: ["NeMo Switchyard", "Nemotron 3.5 Lightning", "costo agentes de IA", "ruteo de modelos IA", "NVIDIA agentes", "Claude Opus 4.8", "LangChain benchmark", "IA en Chile y Latinoamerica"]
source_name: "NVIDIA Blog"
source_url: "https://blogs.nvidia.com/blog/nemotron-lightning-switchyard-rtx-dgx/"
publisher: "Revenue Hub Latam"
publisher_url: "https://www.revenuehublatam.com"
---

# NVIDIA lanza Nemotron 3.5 Lightning y NeMo Switchyard para hacer la IA agéntica más rápida y eficiente

> NVIDIA lanzó el 11 de agosto de 2026 dos piezas para abaratar los agentes de IA: Nemotron 3.5 Lightning, un modelo abierto de 30 mil millones de parámetros con solo 3 mil millones activos, y NeMo Switchyard, una librería open source que decide qué modelo atiende cada paso de un agente. En el benchmark de LangChain sobre 145 tareas agénticas, enrutar apenas el 7% de las llamadas a Claude Opus 4.8 y el resto a Nemotron bajó el costo total 74%, con seis puntos menos de precisión.

NVIDIA anunció el 11 de agosto de 2026 dos piezas pensadas para el mismo problema: los agentes de IA hacen muchísimas llamadas a modelos y casi todos los equipos mandan todas al mismo modelo caro. La compañía liberó **Nemotron 3.5 Lightning**, un modelo abierto de 30 mil millones de parámetros con arquitectura mixture-of-experts y solo 3 mil millones de parámetros activos, y **NeMo Switchyard**, una librería open source de ruteo que decide qué modelo atiende cada paso de un flujo agéntico.

## ¿Qué anunció NVIDIA exactamente?

Nemotron 3.5 Lightning está construido para tareas específicas de alto volumen dentro de sistemas multiagente: revisión de código, uso de herramientas, monitoreo de alertas de seguridad o respuestas a consultas de facturación. Según NVIDIA, entrega hasta 4 veces más velocidad de salida y completa tareas agénticas 30% más rápido que otros modelos de su clase. Al ser abierto y personalizable, se puede post-entrenar con datos, herramientas y flujos propios de cada organización.

NeMo Switchyard, por su parte, es una librería de ruteo que dirige cada consulta al modelo más capaz y eficiente para ese paso, sin obligar a reescribir la aplicación. Se puede correr como proxy al que el agente apunta o como middleware dentro del propio proceso del agente. Ofrece tres enfoques de ruteo: un clasificador LLM (con modos de capacidad y escalamiento), un stage router heurístico que no agrega llamadas extra, y un enfoque experimental que lee activaciones del modelo en prefill.

Los benchmarks internos de NVIDIA muestran que Switchyard mantiene precisión de nivel frontera mientras reduce el costo de completar tareas a casi un tercio del que implica usar Claude Opus 4.8 en solitario.

## ¿Cuánto cuesta realmente operar un agente de IA?

La medición más útil no la publicó NVIDIA sino LangChain, que corrió su suite de evaluación Deep Agents (145 tareas agénticas multipaso, con 6,3 llamadas a modelo en promedio cada una) a través de Switchyard en modo escalamiento. Los resultados:

-   **Opus 4.8 solo:** 86,0% de precisión, US$11,45 por corrida, US$0,092 por tarea completada.
-   **Opus + Nemotron 3.5 Lightning ruteados:** 80,0% de precisión, US$3,00 por corrida, US$0,026 por tarea completada.
-   **Nemotron 3.5 Lightning solo:** 77,7% de precisión, US$0,72 por corrida, US$0,006 por tarea completada.

El hallazgo central es el desbalance entre dónde ocurren las llamadas y dónde se va la plata: Nemotron atendió el 93% de las llamadas con el 10,4% del gasto, mientras Opus atendió el 7% de las llamadas con el 68,4% del gasto. Dicho de otra forma, los últimos seis puntos de precisión costaron 3,5 veces más por tarea completada.

Hay un costo escondido que conviene tener presente: el modelo juez que decide cuándo escalar se llevó el 21,2% del gasto en el escenario ruteado. LangChain también advierte que el ruteo baja el promedio pero amplía el rango: entre sus cinco corridas, el tráfico enviado al modelo frontera osciló entre 4,1% y 9,1%, y el costo por corrida entre US$2,16 y US$3,61 sin que cambiara nada más que las decisiones del router.

## ¿Cuándo conviene enrutar y cuándo no?

LangChain propone una fórmula simple para decidir antes de construir nada: **descarga mínima = costo del juez dividido por (costo del modelo caro menos costo del modelo barato)**. En su caso el juez costó US$0,64 por corrida contra una brecha de precio de US$10,73, así que necesitaban descargar 5,9% de los turnos y terminaron descargando 93%.

La misma fórmula sirve para descartar el ruteo. Si los dos modelos tienen precios parecidos, el ahorro por turno descargado es chico y la fórmula pide enviar más del 100% de los turnos al modelo barato, lo que es imposible. La excepción es alojar el modelo barato por cuenta propia, donde el costo de inferencia se acerca a cero.

Tampoco conviene si la latencia es crítica (el juez agrega una segunda llamada de unos 700 milisegundos por turno) o si las tareas son cortas, porque el escalamiento necesita trayectorias de varios turnos para tener algo que leer.

## ¿Qué empresas ya lo están usando?

NVIDIA reportó resultados de varios socios que ya integraron Switchyard:

-   **Ramp:** igualó el desempeño de un modelo frontera recortando costos 58% y tiempo de ejecución 33% en Ramp SWE-Bench.
-   **Cognition:** integró el stage router en Devin Desktop y redujo el costo medio 28% frente a enviar todo a un solo modelo frontera.
-   **Boomi:** logró 100% de precisión en ruteo por dominio, envió 59% del tráfico a un modelo afinado 5 veces más rápido y bajó 21% la latencia en turnos tardíos.
-   **Classmethod:** 27% de reducción de costos manteniendo calidad en sus cargas internas.

Kong ya entrega ruteo con Switchyard de forma nativa en su AI Gateway y LiteLLM lo está sumando como plug-in en su capa de proxy. Nemotron 3.5 Lightning está disponible en Hugging Face, ModelScope, OpenRouter y build.nvidia.com; Switchyard está en GitHub bajo licencia abierta.

## Análisis de Revenue Hub

Para un líder comercial en Chile o Latinoamérica, la noticia relevante no es el modelo sino la cifra: el 7%. Si solo 7 de cada 100 llamadas de un agente necesitan de verdad el modelo más caro, entonces la mayoría de los pilotos de agentes de ventas y servicio que hoy se están costeando en la región están sobredimensionados por diseño, no por volumen. El problema no es que la IA sea cara, es que se está comprando capacidad frontera para tareas que no la requieren.

Esto cambia la conversación de presupuesto. Hasta ahora el debate era «cuántas licencias de agente compramos». La pregunta correcta pasa a ser «qué porcentaje de nuestro tráfico agéntico necesita el modelo caro, y quién lo está midiendo». Un equipo que no puede responder eso está firmando un cheque en blanco por consumo. Y con la brecha de precio que muestra el benchmark (una llamada a Opus costó unas 87 veces más que una a Nemotron), el margen de error es enorme.

La advertencia honesta: el ruteo no es gratis. Cuesta seis puntos de precisión en esa prueba, agrega latencia y el modelo juez se come un quinto del gasto. Para un agente que responde consultas de facturación, seis puntos son tolerables. Para uno que califica oportunidades o promete precios a un cliente, probablemente no. La decisión no es técnica, es de tolerancia al error por caso de uso, y esa la toma el negocio. Si quieres profundizar en cómo se estructura esa decisión, revisa nuestras [noticias de IA aplicada a ventas](/noticias/ia-ventas) y el [blog de Revenue Hub](/blog).

## Preguntas frecuentes

### ¿Qué es NVIDIA NeMo Switchyard?

Es una librería open source de ruteo de modelos para agentes de IA, lanzada por NVIDIA el 11 de agosto de 2026. Dirige automáticamente cada paso del flujo de un agente al modelo más capaz y eficiente para esa tarea, sin obligar a reescribir la aplicación. Se puede usar como proxy o como middleware dentro del proceso del agente, y está disponible en GitHub.

### ¿Cuánto ahorra el ruteo entre modelos de IA?

En el benchmark de LangChain sobre 145 tareas agénticas, enrutar entre Nemotron 3.5 Lightning y Claude Opus 4.8 bajó el costo total 74% frente a usar Opus solo, con una caída de 6 puntos de precisión. El costo por corrida pasó de US$11,45 a US$3,00. Los benchmarks internos de NVIDIA reportan una reducción a casi un tercio del costo.

### ¿Qué es Nemotron 3.5 Lightning y para qué sirve?

Es un modelo abierto de NVIDIA con 30 mil millones de parámetros en arquitectura mixture-of-experts y solo 3 mil millones activos. Está diseñado para tareas específicas de alto volumen dentro de sistemas multiagente, como revisión de código, uso de herramientas o respuestas de facturación. Entrega hasta 4 veces más velocidad de salida y completa tareas 30% más rápido que otros modelos de su clase.

### ¿Nemotron 3.5 Lightning vs Claude Opus 4.8: cuál conviene?

Depende de la tolerancia al error. En la prueba de LangChain, Opus 4.8 alcanzó 86,0% de precisión a US$0,092 por tarea completada y Nemotron 3.5 Lightning 77,7% a US$0,006. La configuración ruteada quedó en 80,0% a US$0,026. Si el caso de uso admite unos puntos menos de precisión, el modelo abierto o el ruteo son mucho más baratos.

### ¿Cuándo NO conviene usar un router de modelos?

No conviene si los dos modelos tienen precios parecidos, porque el ahorro por turno descargado no alcanza a pagar el modelo juez. Tampoco si la aplicación es sensible a la latencia, ya que el juez agrega una segunda llamada de unos 700 milisegundos por turno, ni si las tareas son cortas, porque el escalamiento necesita trayectorias de varios turnos.

### ¿Qué porcentaje de las llamadas de un agente necesita un modelo frontera?

En la medición de LangChain fue el 7%, y ese 7% concentró el 68,4% del gasto total. El 93% restante lo atendió un modelo de 30 mil millones de parámetros con solo el 10,4% del gasto. El dato varió entre 4,1% y 9,1% según la corrida, por lo que conviene presupuestar contra el techo del rango.

### ¿Cómo afecta esto a las empresas de Chile y Latinoamérica que están probando agentes de IA?

Baja la barrera de costo para operar agentes de ventas y servicio en la región. Muchos pilotos en Chile y Latinoamérica se costean asumiendo que todas las llamadas van al modelo más caro, lo que sobredimensiona el presupuesto. Medir qué porcentaje del tráfico realmente necesita capacidad frontera es el primer paso antes de escalar.

### ¿Dónde se puede descargar Nemotron 3.5 Lightning?

Está disponible en Hugging Face, ModelScope, OpenRouter y build.nvidia.com como microservicio NVIDIA NIM, además de a través de socios cloud de NVIDIA, plataformas de post-entrenamiento y proveedores de inferencia. NeMo Switchyard se distribuye por separado en GitHub y llegará pronto a plataformas de socios.

---

Fuente original: [NVIDIA Blog](https://blogs.nvidia.com/blog/nemotron-lightning-switchyard-rtx-dgx/) (blogs.nvidia.com)
