observability
Recursos prácticos sobre observability para ingenieros de software.
46 resultados
Entendiendo Sistemas en Producción
No puedes arreglar lo que no puedes ver. La observabilidad combina métricas, logs y traces en una imagen coherente de la salud del sistema. Es la diferencia entre combatir incendios reactivamente y planificar capacidad proactivamente.
Estos recursos cubren logging estructurado con JSON, colección de métricas con Prometheus, diseño de dashboards en Grafana, tracing distribuido con OpenTelemetry y estrategias de alertado. Aprende a reducir el tiempo medio de detección y resolución en entornos de producción.
Patrón Correlation ID
Cómo propagar correlation IDs a través de service boundaries para end-to-end request tracing. Cubre...
Patrón Distributed Tracing
Cómo propagar trace context a través de service boundaries con OpenTelemetry. Cubre span creation,...
Patrón Health Check: Exponer Liveness y Readiness Probes
Cómo implementar liveness y readiness probes para container orchestration. Cubre Kubernetes probes,...
Patrón Metrics Aggregation
Cómo collect, tag, y aggregate business metrics para observability. Cubre Prometheus,...
Patrón Structured Logging
Cómo emitir structured JSON logs con campos consistentes para searchability. Cubre Python...
Documento de Estandares de Logging
Una plantilla de documento para definir convenciones de logging estructurado, niveles de log,...
Plantilla de Politica de Monitoreo y Alertas
Una plantilla de politica que define como se configuran, enrutan, escalan y revisan las alertas en...
Plantilla de Revision de Incidentes Postmortem
Una plantilla de postmortem sin culpa para analizar incidentes, identificar causas raiz y...
Plantilla de Objetivo de Nivel de Servicio (SLO)
Una plantilla para definir objetivos de confiabilidad, presupuestos de error y metodos de medicion...
Monitoring y Alerting
Construir un production monitoring stack. Cubre Prometheus, Grafana, AlertManager, metrics...
Observabilidad — Referencia Detallada de Metricas, Logs y Traces
Guia practica de observabilidad: los tres pilares (metricas, logs, traces), implementacion con...
OpenTelemetry
Guia practica de OpenTelemetry: instrumentacion, collectors, exporters, y conectar OTLP a backends...
Site Reliability Engineering
Guia practica de SRE: definir SLIs, SLOs y SLAs, gestionar presupuestos de error, reducir toil,...
Apache Kafka en Producción
Ejecutar Apache Kafka en produccion con confianza. Cubre particiones, replicacion, consumer groups,...
Gestión de Alertas: Alertas en Guardia que Funcionan
Guía práctica sobre gestión de alertas: reducir fatiga de alertas, definir niveles de severidad,...
Distributed Tracing: OpenTelemetry, Jaeger, Zipkin
Dominá distributed tracing con OpenTelemetry, Jaeger y Zipkin. Trace propagation entre servicios,...
Observabilidad con el Grafana Stack
Configura metrics, logs y traces con Grafana, Prometheus, Loki y Tempo. Cubre instrumentación,...
Prometheus y Grafana: Metrics, Dashboards, Alerting
Dominá Prometheus metrics collection y Grafana dashboards. Cubre metric types, PromQL, service...
Sentry: Error Tracking, Triage y Resolution
Dominá Sentry para error tracking en producción. Cubre SDK integration en Python, Node.js, Java,...
Structured Logging: JSON Logs, Correlation IDs, Aggregation
Dominá structured logging con JSON format, correlation IDs, log levels y aggregation. Cubre Python...
No se encontraron resultados.