Etiqueta: sre
Explora 13 recursos prácticos de ingeniería de software etiquetados con "sre". Descubre recetas de código, patrones de diseño, plantillas de documentación y guías detalladas para ayudarte a construir, desplegar y mantener soluciones listas para producción con sre.
Runbook de Respuesta a Incidentes de LLM
Runbook operacional para incidentes de LLM en produccion: eventos de hallucination, model outages, cost spikes, safety failures y calidad degradada. Incluye severity levels, escalation paths, diagnosticos y recovery.
Plantilla de Definicion de SLA
Plantilla para definir y documentar Acuerdos de Nivel de Servicio incluyendo objetivos de uptime, tiempos de respuesta, presupuestos de error y procedimientos de escalamiento.
Plantilla de Comunicacion de Incidentes
Una plantilla para notificar a stakeholders durante interrupciones de produccion con mensajes pre-redactados para cada nivel de severidad y tipo de audiencia.
Plantilla de Linea de Tiempo de Incidentes
Una plantilla para reconstruir la secuencia exacta de eventos durante investigaciones de incidentes para identificar brechas de deteccion y retrasos en respuesta.
Plantilla de Entrega de Guardia (On-Call Handoff)
Una plantilla para transferir contexto operacional entre turnos de guardia incluyendo incidentes activos, alertas en curso y estado de salud del sistema.
Plantilla de Revision de Incidentes Postmortem
Una plantilla de postmortem sin culpa para analizar incidentes, identificar causas raiz y documentar lecciones para prevenir recurrencia.
Plantilla de Runbook de Alertas
Un runbook estandarizado para responder alertas: triage, diagnosis, mitigation, resolution y post-incident steps con escalation paths.
Plantilla de Postmortem de Incidentes
Una plantilla de postmortem blameless para documentar incidentes: timeline, impact, root cause, contributing factors y action items con owners.
Plantilla de Runbook
Una plantilla reutilizable para runbooks operacionales: respuesta a incidentes, procedimientos de deployment y tareas rutinarias.
Plantilla de Documento SLO (Service Level Objective)
Plantilla de documento SLO que define targets de confiabilidad, presupuestos de error y políticas de escalación para servicios y plataformas.
Chaos Engineering
Guia practica de chaos engineering: construye sistemas resilientes inyectando fallos intencionalmente. Aprende los cinco principios, Litmus, Gremlin y Chaos Mesh.
Guía de Logging, Monitoreo y Observabilidad
Guía para construir sistemas observables con logging estructurado, métricas y tracing distribuido.
Site Reliability Engineering
Guia practica de SRE: definir SLIs, SLOs y SLAs, gestionar presupuestos de error, reducir toil, rotaciones de guardia y construir una cultura de confiabilidad.