Skip to content
StackPractices

Etiqueta: sre

Explora 13 recursos prácticos de ingeniería de software etiquetados con "sre". Descubre recetas de código, patrones de diseño, plantillas de documentación y guías detalladas para ayudarte a construir, desplegar y mantener soluciones listas para producción con sre.

Runbook de Respuesta a Incidentes de LLM

Runbook operacional para incidentes de LLM en produccion: eventos de hallucination, model outages, cost spikes, safety failures y calidad degradada. Incluye severity levels, escalation paths, diagnosticos y recovery.

Plantilla de Definicion de SLA

Plantilla para definir y documentar Acuerdos de Nivel de Servicio incluyendo objetivos de uptime, tiempos de respuesta, presupuestos de error y procedimientos de escalamiento.

Plantilla de Comunicacion de Incidentes

Una plantilla para notificar a stakeholders durante interrupciones de produccion con mensajes pre-redactados para cada nivel de severidad y tipo de audiencia.

Plantilla de Linea de Tiempo de Incidentes

Una plantilla para reconstruir la secuencia exacta de eventos durante investigaciones de incidentes para identificar brechas de deteccion y retrasos en respuesta.

Plantilla de Entrega de Guardia (On-Call Handoff)

Una plantilla para transferir contexto operacional entre turnos de guardia incluyendo incidentes activos, alertas en curso y estado de salud del sistema.

Plantilla de Revision de Incidentes Postmortem

Una plantilla de postmortem sin culpa para analizar incidentes, identificar causas raiz y documentar lecciones para prevenir recurrencia.

Plantilla de Runbook de Alertas

Un runbook estandarizado para responder alertas: triage, diagnosis, mitigation, resolution y post-incident steps con escalation paths.

Plantilla de Postmortem de Incidentes

Una plantilla de postmortem blameless para documentar incidentes: timeline, impact, root cause, contributing factors y action items con owners.

Plantilla de Runbook

Una plantilla reutilizable para runbooks operacionales: respuesta a incidentes, procedimientos de deployment y tareas rutinarias.

Plantilla de Documento SLO (Service Level Objective)

Plantilla de documento SLO que define targets de confiabilidad, presupuestos de error y políticas de escalación para servicios y plataformas.

Chaos Engineering

Guia practica de chaos engineering: construye sistemas resilientes inyectando fallos intencionalmente. Aprende los cinco principios, Litmus, Gremlin y Chaos Mesh.

Guía de Logging, Monitoreo y Observabilidad

Guía para construir sistemas observables con logging estructurado, métricas y tracing distribuido.

Site Reliability Engineering

Guia practica de SRE: definir SLIs, SLOs y SLAs, gestionar presupuestos de error, reducir toil, rotaciones de guardia y construir una cultura de confiabilidad.