Etiqueta: runbook
Explora 19 recursos prácticos de ingeniería de software etiquetados con "runbook". Descubre recetas de código, patrones de diseño, plantillas de documentación y guías detalladas para ayudarte a construir, desplegar y mantener soluciones listas para producción con runbook.
Runbook de Respuesta a Incidentes de LLM
Runbook operacional para incidentes de LLM en produccion: eventos de hallucination, model outages, cost spikes, safety failures y calidad degradada. Incluye severity levels, escalation paths, diagnosticos y recovery.
Runbook de Cache Warmup
Runbook para warmear caches despues de deployment, restart o incident: identificar hot keys, preload strategies, progressive warmup, health checks y rollback procedures con ejemplos de codigo y automation scripts.
Plantilla de Runbook para Jobs ETL
Un runbook para operar, monitorear y troubleshootear jobs ETL: startup, shutdown, health checks, common failures, diagnostics y recovery.
Plantilla de Prueba de Verificacion de Backups
Una plantilla para planificar y documentar pruebas de verificacion de backups, asegurando que los procedimientos de restauracion funcionen antes de una emergencia.
Plantilla de Runbook de Migracion de Datos
Una plantilla de runbook para migrar datos entre sistemas de forma segura incluyendo verificaciones pre-migracion, procedimientos de rollback y validacion post-migracion.
Runbook para Actualización de Dependencias
Un runbook paso a paso para actualizar las dependencias del proyecto de forma segura.
Plan de Prueba de Recuperacion ante Desastres
Una plantilla para planificar y ejecutar pruebas de recuperacion ante desastres incluyendo validacion de failover, verificacion de integridad de datos y medicion de tiempo de recuperacion.
Plantilla de Entrega de Guardia (On-Call Handoff)
Una plantilla para transferir contexto operacional entre turnos de guardia incluyendo incidentes activos, alertas en curso y estado de salud del sistema.
Plantilla de Runbook de Guardia
Una plantilla que documenta alertas comunes y procedimientos de respuesta paso a paso para ingenieros de guardia.
Runbook de Failover de Base de Datos
Un runbook paso a paso para ejecutar procedimientos de failover de base de datos de forma segura con tiempo de inactividad y perdida de datos minimos.
Plantilla de Documento de Ownership de Servicio
Una plantilla para definir quien es dueno de un servicio, que hace, como operarlo, y donde encontrar informacion critica cuando las cosas salen mal.
Runbook de Dead Letter Queue
Runbook para handlear y replayear dead letter queue messages en Kafka y RabbitMQ: DLQ setup, inspection procedures, root cause analysis, replay strategies, monitoring alerts y automation scripts para failed message recovery.
Plantilla de Runbook de Alertas
Un runbook estandarizado para responder alertas: triage, diagnosis, mitigation, resolution y post-incident steps con escalation paths.
Runbook de Rotación de Claves de Cifrado
Un runbook para rotación de claves de cifrado cubriendo tipos de clave, schedules de rotación, migración dual-key sin downtime, verificación y rollback.
Runbook de Cold Start Serverless
Runbook para diagnosticar y mitigar cold starts en funciones serverless: causas, medicion, estrategias de optimizacion (provisioned concurrency, warmers, initialization tuning) y monitoreo con ejemplos de codigo para AWS Lambda, Azure y GCP.
Plantilla de Runbook de Migración de Base de Datos
Plantilla de runbook de migración de base de datos para ejecutar cambios de esquema de forma segura con procedimientos de rollback, pasos de verificación y planes de comunicación.
Plantilla de Runbook
Una plantilla reutilizable para runbooks operacionales: respuesta a incidentes, procedimientos de deployment y tareas rutinarias.
Respuesta a Incidentes
Guía práctica sobre respuesta a incidentes: declarar incidentes, construir una estructura de comando de incidentes, protocolos de comunicación y reducir el tiempo medio de resolución con procesos estructurados.
Recuperación ante Desastres
Guía práctica para la planificación de recuperación ante desastres: definición de RTO y RPO, estrategias de backup, failover multi-región y construcción de runbooks de recuperación que minimizan downtime.