Nvidia: desde los modelos grandes de "entrenamiento único" hacia los agentes de "mejora post-entrenamiento", la demanda de potencia de cómputo está cambiando
Nvidia está revolucionando la lógica de monetización de la computación. Su nueva plataforma Vera Rubin introduce por primera vez el indicador de "inteligencia por dólar", apostando al auge de la inteligencia artificial con agentes inteligentes. La demanda de entrenamiento post-modelo se convierte en una necesidad constante, y el consumo de GPU solo representa un cuarto del de la generación anterior. Los grandes actores ya están en fila para migrar, abriendo una nueva ola de crecimiento en el mercado de la computación.
Nvidia está ampliando la propuesta de valor central de su próxima generación de la plataforma Vera Rubin desde el costo de inferencia hasta la eficiencia en el entrenamiento de modelos, apostando por el indicador "inteligencia por dólar", que prevé que la demanda de cómputo para el post-entrenamiento se convertirá en el núcleo en la era de la AI de agentes.
Nvidia explica en su blog oficial que, con el auge de la Agentic AI, el post-entrenamiento de modelos ha evolucionado de ser una etapa final única a convertirse en una carga de trabajo central en constante ciclo. A diferencia de los modelos generativos tradicionales, los modelos de agentes requieren planificar, utilizar herramientas y corregirse de manera autónoma durante su ejecución, en ambientes que pueden cambiar cada semana; esto hace que la demanda de cómputo para el post-entrenamiento se acumule continuamente. Nvidia afirma que la plataforma Vera Rubin fue diseñada específicamente para esta carga de trabajo colaborativa, permitiendo entrenar modelos de máxima escala con solo una cuarta parte de la cantidad de GPUs que requiere la generación Blackwell.
Esta declaración se relaciona directamente con la lógica de ventas de cómputo de Nvidia: el ciclo de post-entrenamiento nunca termina, lo que significa que la necesidad de clústeres de GPU por parte de los clientes pasará de ser por proyecto a transformarse en un requerimiento constante, ampliando el tamaño potencial del mercado. Empresas como Prime Intellect, Perplexity y Together AI, entre otras, que ya operan cargas de post-entrenamiento en plataformas de Nvidia, han anunciado planes de migrar o expandirse hacia Vera Rubin.
El post-entrenamiento se convierte en el motor clave de cómputo en la era de los agentes
Nvidia expone sistemáticamente en su blog la importancia estratégica del post-entrenamiento. La fase de pre-entrenamiento otorga al modelo fluidez lingüística, mientras que la verdadera "inteligencia"—incluyendo escribir código, planificar tareas multietapas, usar herramientas de búsqueda y recuperarse de errores—se forma durante el post-entrenamiento.

El post-entrenamiento utiliza técnicas de aprendizaje por refuerzo (RL): el modelo genera intentos para tareas (propagación hacia adelante), estos intentos reciben una puntuación y luego se actualizan los pesos del modelo (propagación hacia atrás), mejorando gradualmente tras millones de iteraciones. Según Nvidia, este proceso requiere un consumo masivo de cómputo, generando miles de rollouts en ambientes paralelos mientras mantiene aceleradores funcionando a plena carga.
Nvidia posiciona la "inteligencia por dólar" como un indicador superior al "costo por token": el primero mide la eficiencia operativa en fábricas de inferencia, el segundo evalúa si la inversión necesaria para construir y mantener un modelo digno de ser desplegado es rentable. Ambos se relacionan—reducir el costo por token disminuye también el costo de construir la inteligencia del modelo, mientras que mayor inteligencia de modelo eleva el valor de servicio por cada token.
Nemotron Ultra ofrece benchmark verificable de post-entrenamiento
Para respaldar lo anterior, Nvidia reveló detalles del post-entrenamiento para su modelo de pesos abiertos Nemotron 3 Ultra. Este modelo cuenta con 550 mil millones de parámetros, arquitectura de mezclas de expertos (MoE) y realiza su post-entrenamiento en el marco NeMo RL.
En la benchmark de programación real SWE-bench Verified, Nemotron 3 Ultra logró una puntuación de 71,7%; es decir, en defectos presentes en proyectos open source, siete de cada diez puede generar soluciones de reparación válidas que superan las pruebas internas del proyecto. Nvidia señala que este resultado es verificable y el esquema de post-entrenamiento se encuentra totalmente abierto.

Nvidia también indica que la plataforma Blackwell ya ha hecho viable económicamente el post-entrenamiento frecuente requerido en la era de agentes gracias a la reducción de costos por ejecución, y que Vera Rubin llevará la tendencia aún más lejos—permitiendo más rollouts, ambientes paralelos y ciclos de post-entrenamiento ininterrumpidos.
Clientes destacados validan la capacidad de la plataforma y la migración empieza a tomar forma
Varias empresas que ya operan cargas de post-entrenamiento en la plataforma Nvidia han divulgado especificaciones técnicas, junto con intenciones de migrar a Vera Rubin.
Prime Intellect mantiene el post-entrenamiento de modelos open source punta en la plataforma Blackwell y utiliza NVIDIA Dynamo para la orquestación de inferencia. La empresa ya integró infraestructura sandbox con CPUs NVIDIA Vera, y en pruebas comparativas con arquitecturas x86, el throughput promedio de Vera CPU fue un 30% superior en cargas de trabajo RL sandbox reales. Prime Intellect planea expandir el entorno RL y acelerar el ciclo de entrenamiento a inferencia con Vera Rubin.
La pila de post-entrenamiento RL de Perplexity corre asincrónicamente en cientos de GPUs Nvidia; su motor de transferencia de pesos basado en RDMA permite sincronizar modelos de billones de parámetros entre nodos de entrenamiento e inferencia en solo dos segundos. El modelo Qwen3 235B post-entrenado luego fue desplegado en el sistema NVIDIA GB200 NVL72.
Together AI ofrece capacidades de post-entrenamiento como servicio, abarcando fine-tuning supervisado, aprendizaje por refuerzo y optimización directa de preferencia, entregados vía API y SDK; actualmente corre en la plataforma Nvidia y señala estar explorando la integración con Vera Rubin.
Descargo de responsabilidad: El contenido de este artículo refleja únicamente la opinión del autor y no representa en modo alguno a la plataforma. Este artículo no se pretende servir de referencia para tomar decisiones de inversión.
También te puede gustar
La venta de bonos a largo plazo estadounidenses se intensifica bajo la presión de altos precios del petróleo y tensiones fiscales, y el rendimiento a 30 años alcanza su nivel más alto en casi 20 años.
El rendimiento de los bonos del Tesoro estadounidense subió de manera generalizada el lunes, ya que el nuevo aumento del precio internacional del petróleo avivó las preocupaciones de los inversores sobre la persistencia de la inflación, el aumento del déficit fiscal de Estados Unidos y el incremento en la oferta de deuda gubernamental.

Acciones estadounidenses durante la noche | China, Japón y Reino Unido redujeron sus tenencias de bonos estadounidenses en junio. Los tres principales índices cerraron a la baja. SanDisk (SNDK.US) subió casi un 9%.
Al cierre, el índice Dow Jones cayó 272,39 puntos, una baja del 0,51%, situándose en 53.460,02 puntos; el índice S&P 500 bajó 40,39 puntos, una caída del 0,52%, cerrando en 7.745,37 puntos; y el índice compuesto Nasdaq perdió 84,25 puntos, una baja de 0,32%, finalizando en 26.644,91 puntos.

El rendimiento de los bonos del Tesoro estadounidense a 30 años alcanza el nivel más alto desde 2007, mientras que la emisión de bonos de grado de inversión en Estados Unidos en agosto marca un récord histórico para el mismo período.
El lunes, el rendimiento de los bonos del Tesoro estadounidense a 30 años superó momentáneamente el 5,31%. Las empresas han emitido deuda a gran escala para respaldar el auge de la IA, exacerbando el desequilibrio de oferta y demanda en el mercado de bonos de largo plazo. En agosto, la emisión de bonos estadounidenses de grado de inversión alcanzó los 145.200 millones de dólares, superando el récord mensual anterior de 136.000 millones de dólares establecido en agosto de 2020. Al mismo tiempo, el déficit fiscal anual del gobierno estadounidense, que ronda los 2 billones de dólares, sigue impulsando la oferta de bonos del Tesoro.

