Skip to content
StackPractices

observability

Recursos prácticos sobre observability para ingenieros de software.

46 resultados

Entendiendo Sistemas en Producción

No puedes arreglar lo que no puedes ver. La observabilidad combina métricas, logs y traces en una imagen coherente de la salud del sistema. Es la diferencia entre combatir incendios reactivamente y planificar capacidad proactivamente.

Estos recursos cubren logging estructurado con JSON, colección de métricas con Prometheus, diseño de dashboards en Grafana, tracing distribuido con OpenTelemetry y estrategias de alertado. Aprende a reducir el tiempo medio de detección y resolución en entornos de producción.

intermediate

Centraliza Logs de Contenedores con Fluentd y Docker

Recolecta, filtra y reenvía logs de contenedores Docker a Elasticsearch, S3 o stdout usando Fluentd como driver de logging o sidecar.

beginner

Dashboards de Observabilidad con Grafana y Prometheus

Construye dashboards interactivos en Grafana que visualizan metricas Prometheus con paneles, variables y alerts para observabilidad completa de servicios

intermediate

Metricas y Alertas con Prometheus

Instrumenta aplicaciones e infraestructura con metricas Prometheus, configura reglas de alerting y recording rules para monitoreo eficiente de salud de servicios

intermediate

Expón Métricas Personalizadas de Aplicación con Python y

Construye un exporter personalizado de métricas Prometheus en Python usando prometheus_client para counters, gauges, histograms y summaries.

intermediate

Tracing Distribuido

Tracea requests a través de microservicios distribuidos con OpenTelemetry, Jaeger y Zipkin para debuguear latencia y optimizar performance.

intermediate

Health Checks Personalizados con Spring Boot Actuator

Cómo implementar health indicators personalizados con Spring Boot Actuator, incluyendo checks de base de datos, Redis, APIs externas y Kubernetes readiness probes.

intermediate

Exponer Métricas con Micrometer y Prometheus

Cómo exponer métricas personalizadas de aplicación usando Micrometer y Prometheus en Spring Boot, incluyendo counters, gauges, timers e histograms.

intermediate

Agregación de Logs

Centraliza logs de servicios distribuidos con ELK, Fluentd y Loki para búsqueda, alertado y troubleshooting en producción.

intermediate

Metrics Collection

Recolecta, agrega y expone métricas de aplicación e infraestructura con Prometheus, StatsD y OpenTelemetry para monitoreo y alertado.

intermediate

Logging de Alta Performance con pino

Cómo usar pino para logging estructurado JSON rápido en Node.js, incluyendo niveles de log, child loggers, transports e integración con Express y Fastify.

intermediate

Error Tracking con Sentry en Express

Cómo integrar Sentry para error tracking en aplicaciones Node.js Express, incluyendo error handlers, performance monitoring, release tracking y source maps.

intermediate

Rotar Logs Diariamente con Winston

Cómo configurar rotación diaria de logs en Node.js usando winston y winston-daily-rotate-file, incluyendo límites de tamaño, retención, compresión y combinación de transports.

intermediate

Monitoreo de APIs con Prometheus

Monitorea rendimiento y salud de APIs con métricas Prometheus, collectors personalizados y reglas de alertamiento.

advanced

Distributed Tracing con OpenTelemetry

Cómo implementar distributed tracing en Python con OpenTelemetry SDK, incluyendo spans, propagación de context, auto-instrumentación y export a Jaeger.

intermediate

Exponer Métricas de Negocio con Prometheus

Cómo exponer métricas de negocio personalizadas en Python usando prometheus_client, incluyendo counters, gauges, histograms, summaries e integración con Flask.

intermediate

Logging Estructurado JSON con structlog

Cómo emitir logs estructurados JSON en Python usando structlog, incluyendo context binding, niveles de log, processors e integración con standard logging.

intermediate

Monitoreo de Usuarios Reales (RUM)

Monitorea experiencias reales de usuarios con Core Web Vitals, session replay y análisis de performance para identificar cuellos de botella del mundo real.

intermediate

Logging Estructurado

Implementa logging estructurado con salida JSON, correlation IDs y agregación de logs para observabilidad en producción.

beginner

Patron de Monitoreo de Endpoints de Salud

Expone endpoints de salud ligeros para que orquestadores, balanceadores de carga y herramientas de monitoreo verifiquen la disponibilidad del servicio.

advanced

Circuit Breaker con Monitoring

Cómo exponer circuit breaker state como metrics para observability. Cubre Prometheus integration, alerting rules, dashboards, y state transitions.

intermediate

Patrón Correlation ID

Cómo propagar correlation IDs a través de service boundaries para end-to-end request tracing. Cubre HTTP headers, message queues, e integración con logging.

advanced

Patrón Distributed Tracing

Cómo propagar trace context a través de service boundaries con OpenTelemetry. Cubre span creation, context propagation, sampling, y trace analysis.

intermediate

Patrón Health Check: Exponer Liveness y Readiness Probes

Cómo implementar liveness y readiness probes para container orchestration. Cubre Kubernetes probes, dependency checks, graceful degradation, y probe endpoints.

intermediate

Patrón Metrics Aggregation

Cómo collect, tag, y aggregate business metrics para observability. Cubre Prometheus, OpenTelemetry, custom metrics, histograms, y dashboarding.

intermediate

Patrón Structured Logging

Cómo emitir structured JSON logs con campos consistentes para searchability. Cubre Python structlog, Winston, Serilog, log levels, y log aggregation.

beginner

Documento de Estandares de Logging

Una plantilla de documento para definir convenciones de logging estructurado, niveles de log, retencion y requisitos de observabilidad en servicios.

beginner

Plantilla de Politica de Monitoreo y Alertas

Una plantilla de politica que define como se configuran, enrutan, escalan y revisan las alertas en servicios e infraestructura.

intermediate

Plantilla de Revision de Incidentes Postmortem

Una plantilla de postmortem sin culpa para analizar incidentes, identificar causas raiz y documentar lecciones para prevenir recurrencia.

intermediate

Plantilla de Objetivo de Nivel de Servicio (SLO)

Una plantilla para definir objetivos de confiabilidad, presupuestos de error y metodos de medicion para servicios y sistemas.

advanced

Referencia Detallada de Monitoring y Alerting

Construir un production monitoring stack. Cubre Prometheus, Grafana, AlertManager, metrics instrumentation, alert rules, runbooks, SLI/SLO/SLA, distributed tracing con Jaeger, log aggregation y on-call best practices con ejemplos practicos de configuracion.

intermediate

Observabilidad — Referencia Detallada de Metricas, Logs y Traces

Guia practica de observabilidad: los tres pilares (metricas, logs, traces), implementacion con Prometheus, Grafana, Loki, Tempo/Jaeger, y construccion de alertas basadas en SLO.

intermediate

OpenTelemetry

Guia practica de OpenTelemetry: instrumentacion, collectors, exporters, y conectar OTLP a backends como Jaeger, Prometheus y Grafana.

intermediate

Site Reliability Engineering

Guia practica de SRE: definir SLIs, SLOs y SLAs, gestionar presupuestos de error, reducir toil, rotaciones de guardia y construir una cultura de confiabilidad.

advanced

Referencia Detallada de Apache Kafka en Producción

Ejecutar Apache Kafka en produccion con confianza. Cubre particiones, replicacion, consumer groups, monitoreo, tuning de performance y mejores practicas operativas para pipelines de streaming de alto throughput.

intermediate

Gestión de Alertas: Alertas en Guardia que Funcionan

Guía práctica sobre gestión de alertas: reducir fatiga de alertas, definir niveles de severidad, políticas de escalamiento, diseño de rotaciones de guardia y construir una cultura de alertas sostenible.

advanced

Distributed Tracing: OpenTelemetry, Jaeger, Zipkin

Dominá distributed tracing con OpenTelemetry, Jaeger y Zipkin. Trace propagation entre servicios, span context, sampling strategies y debugging en producción.

advanced

Referencia Detallada de Observabilidad con el Grafana Stack

Configura metrics, logs y traces con Grafana, Prometheus, Loki y Tempo. Cubre instrumentación, dashboards, alerting y distributed tracing para sistemas en producción.

advanced

Prometheus y Grafana: Metrics, Dashboards, Alerting

Dominá Prometheus metrics collection y Grafana dashboards. Cubre metric types, PromQL, service instrumentation, alerting rules y deployment en producción.

intermediate

Referencia Detallada de Sentry: Error Tracking, Triage y Resolution

Dominá Sentry para error tracking en producción. Cubre SDK integration en Python, Node.js, Java, release tracking, source maps, performance monitoring y alerting.

intermediate

Structured Logging: JSON Logs, Correlation IDs, Aggregation

Dominá structured logging con JSON format, correlation IDs, log levels y aggregation. Cubre Python structlog, Node.js pino, Java SLF4J, stacks ELK y Loki.

intermediate

Trazas Distribuidas: Flujo de Peticiones en Microservicios

Guía práctica sobre trazas distribuidas: instrumentación de aplicaciones, propagación de trazas, estrategias de muestreo y diagnóstico de latencia en arquitecturas de microservicios con OpenTelemetry, Jaeger y Zipkin.

intermediate

Respuesta a Incidentes

Guía práctica sobre respuesta a incidentes: declarar incidentes, construir una estructura de comando de incidentes, protocolos de comunicación y reducir el tiempo medio de resolución con procesos estructurados.

intermediate

Agregación de Logs

Guía práctica sobre agregación de logs: logs estructurados, estrategias de envío, políticas de retención y construcción de pipelines de logs consultables con ELK, Loki y soluciones nativas de la nube.

intermediate

Métricas y Dashboards

Guía práctica sobre métricas y dashboards: instrumentación de aplicaciones, elección de tipos de métricas, construcción de dashboards efectivos y creación de pipelines de alertas con Prometheus, Grafana y Datadog.

intermediate

Postmortems Sin Culpa: Aprendiendo de Incidentes Sin Culpar

Guía práctica sobre postmortems sin culpa: capturar timelines, identificar causas raíz, escribir seguimientos útiles y construir una cultura de mejora continua a partir de interrupciones.

advanced

Referencia Detallada de AWS Lambda en Producción

Ejecutar AWS Lambda en produccion con confianza. Cubre optimizacion de cold starts, layers, patrones de deployment, observabilidad con X-Ray, security hardening, connection pooling y cost tuning.