Etiqueta: on-call
Explora 9 recursos prácticos de ingeniería de software etiquetados con "on-call". Descubre recetas de código, patrones de diseño, plantillas de documentación y guías detalladas para ayudarte a construir, desplegar y mantener soluciones listas para producción con on-call.
On-Call y Preparacion para Incidentes
El on-call es la practica de tener ingenieros disponibles para responder a incidentes de produccion. Un on-call efectivo requiere runbooks, rutas de escalamiento, triage de alertas y un equilibrio saludable con cronogramas sostenibles.
Los recursos a continuacion cubren rotaciones de on-call, respuesta a incidentes, fatiga de alertas, runbooks y postmortems. Cada guia te ayuda a construir practicas de on-call que protegen el servicio y el equipo.
Cada recurso incluye explicaciones claras, ejemplos de codigo y advertencias sobre errores comunes. Usa estos materiales para tomar decisiones informadas, evitar problemas en produccion y acelerar tu flujo de trabajo. Si estas empezando, lee primero los articulos marcados como principiante; si ya tienes experiencia, ve directo a los patrones avanzados y las guias de arquitectura.
Runbook de Respuesta a Incidentes de LLM
Runbook operacional para incidentes de LLM en produccion: eventos de hallucination, model outages,...
Plantilla de Política de Escalamiento
Una plantilla para definir niveles de severidad de incidentes y rutas de escalamiento de guardia.
Plantilla de Entrega de Guardia (On-Call Handoff)
Una plantilla para transferir contexto operacional entre turnos de guardia incluyendo incidentes...
Plantilla de Runbook de Guardia
Una plantilla que documenta alertas comunes y procedimientos de respuesta paso a paso para...
Plantilla de Documento de Ownership de Servicio
Una plantilla para definir quien es dueno de un servicio, que hace, como operarlo, y donde...
Plantilla de Runbook de Alertas
Un runbook estandarizado para responder alertas: triage, diagnosis, mitigation, resolution y...
Playbook de Guardias e Incidentes (On-Call)
Playbook práctico para ingenieros on-call: triage, escalamiento, comunicación y postmortems. Reduce...
Ingenieria de confiabilidad del sitio (SRE)
Guia practica de SRE: definir SLIs, SLOs y SLAs, gestionar presupuestos de error, reducir toil,...
Gestión de Alertas: Alertas en Guardia que Funcionan
Guía práctica sobre gestión de alertas: reducir fatiga de alertas, definir niveles de severidad,...