Léelo en tu idiomaEspañolEnglish

El stack de NVIDIA sin marketing: qué estás comprando de verdad

Esquema de los componentes de un rack de IA de NVIDIA traducidos a piezas comprensibles (imagen generada con IA)

Hace unos años me mandaron a las oficinas de la empresa en España a analizar un servicio de telepresencia que llevaba tiempo sin cuajar. Yo iba con la idea de encontrar cómo mejorarlo. Leí el caso de negocio, revisé los números, hablé con quien lo operaba, y llegué a una conclusión incómoda: ese servicio había que cerrarlo. Lo escribí en un informe formal, con mi nombre, sabiendo que a nadie le iba a gustar.

Cuento esto porque es exactamente el músculo que hace falta para leer un catálogo de NVIDIA. No el de entender la tecnología —eso se estudia—, sino el de separar lo que un fabricante te está vendiendo de lo que tú realmente necesitas. Y el catálogo de infraestructura de IA está lleno de nombres en mayúsculas que suenan a lo mismo y no lo son.

Este es el segundo artículo de la serie sobre centros de datos de IA. En el primero vimos por qué una GPU cambia el edificio completo, con la imagen del chef y los cocineros. Hoy vamos al catálogo.

🔑 Lo esencial en 20 segundos

  • HGX es la placa con ocho GPUs que los fabricantes usan para armar sus servidores. DGX es el servidor ya armado por NVIDIA. NVL72 es un rack entero, no un servidor.
  • NVLink es la barra por donde los cocineros se pasan los ingredientes dentro de la cocina. NVSwitch decide quién le pasa a quién.
  • BlueField no calcula: se encarga de la red, el almacenamiento y la seguridad para que las GPUs no pierdan el tiempo en eso.
  • Al salir del rack hay dos caminos —InfiniBand o Ethernet— y esa es la decisión más cara del proyecto. Le toca el próximo artículo.

Tres nombres que la gente confunde todo el tiempo

Si solo te quedas con una cosa de este artículo, que sea esta. En las conversaciones de pasillo se usan DGX, HGX y NVL72 como sinónimos, y son tres cosas de tamaños distintos.

NombreQué es en realidadCuándo te importa
HGXUna placa base con ocho GPUs conectadas entre sí. No es un servidor: es la pieza que Dell, HPE, Lenovo o Supermicro montan dentro del suyoCuando comparas servidores de distintas marcas. Por dentro llevan la misma placa; lo que cambia es todo lo demás
DGXEl servidor ya armado por NVIDIA, con su placa de ocho GPUs, sus CPUs y su soporte. Llave en manoCuando quieres un solo responsable y no armar nada. Pagas por eso
NVL72Un rack completo: 72 GPUs y 36 CPUs repartidas en 18 nodos de cómputo, más nueve bandejas de conmutación en medioCuando vas a entrenar en serio. No se compra de a pedazos

Diferencias entre plataformas y composición del rack: página oficial de NVIDIA para GB200 NVL72, comparativa de despliegues Blackwell de Exxact y el análisis del rack de 120 kW de The Register.

La misma placa, cuatro marcas: ahí está tu palanca

Esta es la parte que a mí más me sirve y que casi nunca se explica. HGX no es un producto que compres: es la pieza que NVIDIA le vende a los fabricantes de servidores. Los que arman alrededor de ella son los de siempre — Dell, HPE, Lenovo y Supermicro son los cuatro nombres que vas a ver en cualquier licitación, y detrás hay fabricantes por contrato como Foxconn, Quanta, Inventec o Wistron que también montan sistemas con la arquitectura de referencia.

Y aquí está el detalle que cambia una negociación: ninguno de ellos puede modificar la placa. El número de GPUs, la memoria, el cableado de NVLink y la disposición de NVSwitch los fija NVIDIA y son idénticos en todas las marcas.

Es idéntico en todas las marcasEs donde cada fabricante decide
Número de GPUs y su memoriaEl chasis y cuántas unidades de rack ocupa
El cableado de NVLinkEl enfriamiento: aire, líquido o mixto
La disposición de NVSwitchLa entrega de energía y las fuentes
El rendimiento bruto de cómputoLa red, el almacenamiento, la gestión y el soporte

Lee esa tabla dos veces, porque tiene una consecuencia comercial directa. Si el cómputo es el mismo, no estás comparando potencia: estás comparando enfriamiento, energía, soporte y precio. Cuando un vendedor te argumenta que su servidor “rinde más” en la parte de GPU, o te está hablando de otra cosa, o te está vendiendo humo.

Yo esto lo aprendí armando ofertas de servicio con equipo de varias marcas: en el momento en que identificas qué parte es un componente común y qué parte es valor propio del fabricante, la conversación cambia de tono. Dejas de discutir especificaciones y empiezas a discutir lo que de verdad se puede negociar.

Fabricantes que integran HGX y qué pueden y no pueden modificar: comunicado de NVIDIA sobre sus socios fabricantes, comparativa DGX contra HGX de Civo y AM Compute sobre las plataformas HGX, DGX y MGX.

La confusión no es inocente, y aquí va la parte de Producto: si tu proveedor te cotiza “un DGX” y tú creías estar comprando capacidad de entrenamiento a escala, hay un malentendido de un orden de magnitud. Ocho GPUs no son setenta y dos. Vale la pena escribir en el pliego cuántas GPUs, en cuántos nodos y con qué interconexión, en lugar del nombre comercial.

Lo que pasa dentro del rack: la barra de la cocina

Volvamos a la imagen del primer artículo. Los cocineros pican a toda velocidad, pero si están repartidos entre varias cocinas, lo que decide la cena es qué tan rápido se pasan los ingredientes.

NVLink es esa barra. Es la conexión directa entre GPUs, dedicada, mucho más rápida que la red normal. En la generación actual del rack de 72 GPUs, NVIDIA declara 130 TB/s de comunicación entre GPUs. No es una cifra que uno pueda intuir: es de otro planeta comparada con la red de un centro de datos tradicional.

La barra central por donde los cocineros se pasan los ingredientes dentro de la misma cocina (imagen generada con IA)
NVLink es la barra por donde se pasan los ingredientes dentro de la cocina. NVSwitch decide quién le pasa a quién. (generada con IA)

NVSwitch es el que organiza la barra. Sin él, cada GPU solo podría hablar con sus vecinas inmediatas. Con él, las 72 se comportan casi como si fueran una sola GPU gigante con una sola memoria compartida. Por eso en las hojas de datos aparece la memoria del rack sumada: no es marketing, es que el software realmente la puede usar así.

Y aquí está la razón por la que el rack se vende como una unidad y no como piezas. Esas nueve bandejas de conmutación en el centro, con su cableado, son lo que hace que 72 GPUs sean un solo cerebro y no 72 cerebros separados. No es algo que puedas agregar después.

BlueField: la pieza que nadie sabe explicar

De todo el catálogo, esta es la que más veces he visto mal contada. Una DPU no es una GPU pequeña ni una tarjeta de red con esteroides.

Es un procesador dedicado a hacer el trabajo administrativo de la infraestructura: mover datos por la red, hablar con el almacenamiento, cifrar, aplicar reglas de seguridad, aislar inquilinos distintos. Cosas que alguien tiene que hacer y que, si las hace la CPU, le roban tiempo al trabajo real.

La analogía de la cocina aguanta: BlueField es el que recibe la mercancía, la revisa y la acomoda. No cocina. Pero si no está, los cocineros tienen que dejar el cuchillo cada rato para ir a recibir cajas.

En el rack de 72 GPUs, NVIDIA incluye BlueField-3 precisamente para eso: red de nube, almacenamiento desagregado, seguridad de confianza cero y poder repartir el mismo hardware entre varios clientes. Si tu proyecto es un servicio administrado con varios inquilinos, esta pieza deja de ser un detalle técnico y se vuelve parte del modelo de negocio.

Al salir del rack hay dos caminos

Dentro del rack manda NVLink y no hay discusión. El problema aparece cuando el trabajo no cabe en un rack y hay que conectar varios.

Dos caminos para salir del rack: una red dedicada y una red de propósito general (imagen generada con IA)
Al salir del rack hay dos caminos, y elegir mal cuesta caro. Ese es el tema del próximo artículo. (generada con IA)

Ahí NVIDIA ofrece dos familias, y no son intercambiables:

CaminoQué esLa lógica detrás
Quantum (InfiniBand)Una red dedicada, diseñada desde el principio para este tipo de tráficoRendimiento máximo y comportamiento predecible, con un ecosistema y un personal más especializado
Spectrum-X (Ethernet)Ethernet, el de siempre, afinado para que se comporte como una red sin pérdidasAprovechas el Ethernet que tu equipo ya sabe operar, a cambio de una afinación fina que no es trivial

No voy a decidir eso hoy, porque merece su propio artículo y porque la respuesta honesta es “depende”. Lo que sí quiero dejar plantado: esa decisión no es del área de redes, es del proyecto completo. Cambia el costo, cambia a quién necesitas contratar y cambia qué tan predecible va a ser el rendimiento el día que el clúster esté lleno.

Lo que no es hardware y ata mucho más

Hasta aquí hablamos de fierro. Pero si alguien te dice que el stack de NVIDIA son las placas y los switches, se está dejando fuera la parte que de verdad decide.

Debajo de todo está CUDA, la capa de software con la que se programan estas GPUs, y encima librerías como NCCL, que es la que coordina cómo se reparten el trabajo y se sincronizan miles de GPUs. Sin eso, el hardware es un montón de silicio carísimo.

Y aquí está el punto que a mí me interesa: el hardware se puede cambiar de marca con relativo dolor. El software con el que tu equipo aprendió a trabajar, no. Años de código, de recetas, de gente formada. Eso es lo que hace que una decisión de infraestructura de IA se sienta reversible en el papel e irreversible en la práctica.

Lo he vivido en mi terreno. Cuando toda la telemetría de una operación está escrita en el lenguaje de un solo proveedor, la renovación del contrato deja de ser una negociación. Por eso en observabilidad se peleó tanto por tener un estándar abierto — y por eso, cuando alguien te presenta un proyecto de IA, vale la pena preguntar dónde está el candado de software y no solo el del rack.

No estoy diciendo que sea malo. Estoy diciendo que debería estar en la conversación, y casi nunca lo está.

Qué exigirle a quien te lo vende

Esta es la parte que no viene en ninguna hoja de datos. Sale de años de leer casos de negocio y de haber tenido que recomendar cerrar uno.

Lo que hay que pedirPor qué
Número de GPUs, nodos e interconexión, no el nombre comercial“Un DGX” y “un NVL72” se diferencian en un orden de magnitud. El nombre no es una especificación
Quién integra y quién respondeCon HGX de por medio hay al menos tres actores: NVIDIA, el fabricante del servidor y el integrador. El día de la falla eso importa más que cualquier cifra
Si la propuesta sigue una arquitectura de referencia publicadaSalirse de ella no está prohibido, pero deja de estar probado. Y quien se salga debería explicar por qué
La lista de lo que NO está incluidoEnfriamiento, acometida eléctrica, obra civil, red externa. Casi siempre lo caro está aquí, y casi nunca en la cotización inicial
Qué tan atado quedasCuánto del diseño depende de un solo fabricante y qué costaría cambiar de opinión en tres años

Esa última pregunta es la que más incomoda y la que más ahorra. En observabilidad la aprendí a la mala: cuando toda tu telemetría vive en el formato de un solo proveedor, no tienes conversación de renovación, tienes una factura. Con la infraestructura de IA pasa igual, pero con cifras mucho más grandes.

Lo que sigue

Ya sabes qué es cada nombre. Lo que falta es cómo se comunican todas esas piezas, que es donde se decide el rendimiento:

  • Cómo se hablan las GPUs, la semana que viene: RDMA, InfiniBand y RoCE. Ahí se resuelve el “dos caminos” que dejé abierto arriba, y es el artículo donde yo tengo más cicatrices.
  • Cómo se conecta todo: la topología del clúster, y por qué dos instalaciones con las mismas GPUs pueden rendir muy distinto.
  • El software que entrena y el que vigila: CUDA, los frameworks, y qué ofrece NVIDIA para gobernar la infraestructura completa.
  • Energía y enfriamiento: el límite físico, más adelante en la serie.

Y si quieres la parte de operación, la de vigilar que estas GPUs estén trabajando y no calentándose de balde, eso ya está escrito en cómo se observa una GPU de verdad.

Preguntas frecuentes

¿Cuál es la diferencia entre DGX y HGX?

HGX es la placa base con ocho GPUs interconectadas que NVIDIA vende a los fabricantes —Dell, HPE, Lenovo y Supermicro son los principales—; ellos la montan dentro de sus propios servidores, sin poder modificar la placa. DGX es el servidor completo armado y soportado por NVIDIA. Comprando HGX eliges al fabricante y negocias mejor; comprando DGX tienes un solo responsable y pagas ese servicio.

¿Qué es NVLink y en qué se diferencia de la red normal?

NVLink es una conexión directa y dedicada entre GPUs, mucho más rápida que la red del centro de datos. En el rack de 72 GPUs, NVIDIA declara 130 TB/s de comunicación entre GPUs. La red convencional conecta servidores entre sí; NVLink conecta procesadores para que trabajen como uno.

¿Para qué sirve una DPU como BlueField?

Para quitarle a la CPU el trabajo de infraestructura: mover datos por la red, hablar con el almacenamiento, cifrar y aplicar seguridad. En entornos con varios inquilinos también aísla a cada uno. No calcula: administra, para que las GPUs no pierdan tiempo en eso.

¿Necesito InfiniBand o me sirve Ethernet?

Depende del tamaño del clúster, de qué tan predecible necesitas el rendimiento y de qué sabe operar tu equipo. InfiniBand es una red dedicada al problema; Spectrum-X es Ethernet afinado para comportarse como una red sin pérdidas. Es una decisión de proyecto, no solo de redes, y merece su propio análisis.

¿Puedo mezclar equipos de distintos fabricantes?

En la parte de cómputo, hasta cierto punto sí, porque varios fabricantes montan la misma placa HGX. En la interconexión y el enfriamiento del rack la libertad es mucho menor: el diseño viene integrado. Lo importante no es si se puede, es quién responde cuando algo falla en la frontera entre dos proveedores.

Lo que me llevo de esto

Un catálogo bien hecho está diseñado para que compres la línea de arriba. No es una crítica a NVIDIA: es cómo funciona cualquier fabricante, y lo he visto desde adentro armando ofertas de servicio.

La defensa no es saberse los nombres de memoria. Es traducir cada nombre a una decisión y a una consecuencia, y preguntar qué no está incluido hasta que la respuesta deje de sorprenderte. Eso no es trabajo de ingeniería. Es trabajo de Producto, y por eso me toca a mí.

La próxima semana entramos a la red, que es donde yo tengo más cicatrices: RDMA, InfiniBand y RoCE. Y por qué, en el fondo, todo eso es calidad de servicio con otro nombre. ⚡

Que los sistemas estén con ustedes. ✦

Imagen destacada generada con inteligencia artificial.

Ethel Méndez
Creado por

Ethel Méndez

Senior Product Manager en observabilidad y redes B2B, con 20 años de campo, NOC y servicios administrados en LATAM. Escribo lo que aprendí operando sistemas de verdad, no en un curso.

🎬 ¿Te late otra faceta? También produzco Mujeres que hicieron historia, una serie en video sobre mujeres olvidadas.

Suscríbete y no te pierdas ninguna historia 📬

Historias de observabilidad, producto y mujeres que hicieron historia — directo en tu correo. Sin spam. ✦

Discover more from Producto y Observabilidad

Subscribe now to keep reading and get access to the full archive.

Continue reading