observability

Recursos prácticos sobre observability para ingenieros de software.

46 resultados

Entendiendo Sistemas en Producción

No puedes arreglar lo que no puedes ver. La observabilidad combina métricas, logs y traces en una imagen coherente de la salud del sistema. Es la diferencia entre combatir incendios reactivamente y planificar capacidad proactivamente.

Estos recursos cubren logging estructurado con JSON, colección de métricas con Prometheus, diseño de dashboards en Grafana, tracing distribuido con OpenTelemetry y estrategias de alertado. Aprende a reducir el tiempo medio de detección y resolución en entornos de producción.

intermediate

Patrón Correlation ID

Cómo propagar correlation IDs a través de service boundaries para end-to-end request tracing. Cubre...

advanced

Patrón Distributed Tracing

Cómo propagar trace context a través de service boundaries con OpenTelemetry. Cubre span creation,...

intermediate

Patrón Health Check: Exponer Liveness y Readiness Probes

Cómo implementar liveness y readiness probes para container orchestration. Cubre Kubernetes probes,...

intermediate

Patrón Metrics Aggregation

Cómo collect, tag, y aggregate business metrics para observability. Cubre Prometheus,...

intermediate

Patrón Structured Logging

Cómo emitir structured JSON logs con campos consistentes para searchability. Cubre Python...

beginner

Documento de Estandares de Logging

Una plantilla de documento para definir convenciones de logging estructurado, niveles de log,...

beginner

Plantilla de Politica de Monitoreo y Alertas

Una plantilla de politica que define como se configuran, enrutan, escalan y revisan las alertas en...

intermediate

Plantilla de Revision de Incidentes Postmortem

Una plantilla de postmortem sin culpa para analizar incidentes, identificar causas raiz y...

intermediate

Plantilla de Objetivo de Nivel de Servicio (SLO)

Una plantilla para definir objetivos de confiabilidad, presupuestos de error y metodos de medicion...

advanced

Monitoring y Alerting

Construir un production monitoring stack. Cubre Prometheus, Grafana, AlertManager, metrics...

intermediate

Observabilidad — Referencia Detallada de Metricas, Logs y Traces

Guia practica de observabilidad: los tres pilares (metricas, logs, traces), implementacion con...

intermediate

OpenTelemetry

Guia practica de OpenTelemetry: instrumentacion, collectors, exporters, y conectar OTLP a backends...

intermediate

Site Reliability Engineering

Guia practica de SRE: definir SLIs, SLOs y SLAs, gestionar presupuestos de error, reducir toil,...

advanced

Apache Kafka en Producción

Ejecutar Apache Kafka en produccion con confianza. Cubre particiones, replicacion, consumer groups,...

intermediate

Gestión de Alertas: Alertas en Guardia que Funcionan

Guía práctica sobre gestión de alertas: reducir fatiga de alertas, definir niveles de severidad,...

advanced

Distributed Tracing: OpenTelemetry, Jaeger, Zipkin

Dominá distributed tracing con OpenTelemetry, Jaeger y Zipkin. Trace propagation entre servicios,...

advanced

Observabilidad con el Grafana Stack

Configura metrics, logs y traces con Grafana, Prometheus, Loki y Tempo. Cubre instrumentación,...

advanced

Prometheus y Grafana: Metrics, Dashboards, Alerting

Dominá Prometheus metrics collection y Grafana dashboards. Cubre metric types, PromQL, service...

intermediate

Sentry: Error Tracking, Triage y Resolution

Dominá Sentry para error tracking en producción. Cubre SDK integration en Python, Node.js, Java,...

guide sentry error-tracking monitoring
intermediate

Structured Logging: JSON Logs, Correlation IDs, Aggregation

Dominá structured logging con JSON format, correlation IDs, log levels y aggregation. Cubre Python...

guide structured-logging json-logs correlation-id

No se encontraron resultados.