Artículos de Observabilidad
Guías, explicaciones y aprendizajes prácticos para entender observabilidad sin perderse entre dashboards, alertas y herramientas.

Mission Control: el software con el que NVIDIA propone verlo todo
Leí la página comercial y la guía de administración, y no dicen lo mismo sobre energía y enfriamiento. Lo que sí es…

El software que entrena: CUDA, NCCL y el candado que no se ve
Puedes migrar todo el código de tu modelo a otro fabricante y seguir amarrado en el momento en que ejecutes entrenamiento distribuido.…

Cómo se conecta todo: la topología de un clúster de IA
No es una red, son seis. Y la de las GPUs se arma por rails, con 1:1 obligatorio y 224 switches para…

Cómo se hablan las GPUs: RDMA, InfiniBand y RoCE explicados desde la trinchera
RoCE necesita Ethernet sin pérdidas, y eso se consigue con colas de prioridad y control de congestión. O sea: calidad de servicio,…

El stack de NVIDIA sin marketing: qué estás comprando de verdad
El catálogo de NVIDIA parece diseñado para que no entiendas qué estás comprando. Aquí está traducido a decisiones: qué es cada nombre,…

Qué es una GPU y por qué un centro de datos de IA no se parece al que ya conoces
Un chef sabe hacer de todo; los cocineros solo pican, pero son miles a la vez. Con esa diferencia empieza todo lo…

Bill shock de observabilidad: por qué tu factura de Datadog se dispara con IA (y cómo contenerla)
La factura de observabilidad no crece con tu tráfico, crece con la telemetría, y la IA genera muchísima más. Tres palancas de…

Cómo se observa una GPU de verdad: DCGM, OpenTelemetry y el auge de las AI factories
El nodo del NOC ahora es una GPU. Aprende qué métricas predicen fallas y cómo llevar la telemetría de DCGM a OpenTelemetry…

OpenTelemetry: cómo las trazas distribuidas te salvan la guardia en microservicios
Una petición cruza varios sistemas, todo se ve "verde" y aun así algo se rompe en un salto. De eso tratan las…

OpenTelemetry explicado sin drama: qué es, para qué sirve y por qué importa
Qué es, para qué sirve y por qué se está volviendo una pieza clave en arquitecturas modernas de observabilidad, explicado sin jerga…

Métricas, logs y trazas: las tres señales para entender un sistema
La base para saber qué está pasando, dónde ocurre el problema y cómo se conecta con la experiencia del usuario: las tres…

Datadog reduce el MTTR en equipos SRE
Una guía técnica sobre cómo Datadog acorta cada fase del MTTR para que los equipos de SRE detecten, diagnostiquen y resuelvan incidentes…

Observabilidad: ¿Nube o On-Premise?
Explora las diferencias clave entre implementar observabilidad en la nube versus on-premise, incluyendo sus ventajas y desventajas.

¿Qué es observabilidad y por qué no es solo monitoreo?
Una explicación clara para entender qué es observabilidad, cómo se diferencia del monitoreo y por qué ayuda a tomar mejores decisiones sobre…