Skip to content
StackPractices

Etiqueta: data

Explora 35 recursos prácticos de ingeniería de software etiquetados con "data". Descubre recetas de código, patrones de diseño, plantillas de documentación y guías detalladas para ayudarte a construir, desplegar y mantener soluciones listas para producción con data.

Patrones de Procesamiento por Lotes

Diseña pipelines robustos de procesamiento por lotes para grandes datasets con retry, idempotencia y observabilidad.

Caching y Memoización

Cómo cachear computaciones costosas y respuestas de API usando caches en memoria, LRU y distribuidos en Python, JavaScript y Java.

Validar y Sanitizar Datos de Input de Usuario

Cómo validar, sanitizar y restringir datos de input de usuario en el boundary de aplicación usando schemas, type checking y librerías de validación.

Formateo de Fechas

Cómo parsear, formatear y manipular fechas a través de timezones usando Python, JavaScript y Java.

Deep Clone de Objetos en JavaScript

Cómo crear copias profundas de objetos y arrays en JavaScript correctamente, manejando referencias circulares, Dates, Maps, Sets y clases custom.

Deep Clone de Objetos en JavaScript: Mas alla de JSON.parse

Compara estrategias de deep clone incluyendo JSON.parse, structuredClone, recursion manual y librerias para copiar objetos anidados con referencias circulares

Aplanar y Reconstruir Objetos Anidados

Cómo convertir objetos anidados en pares clave-valor planos y reconstruirlos, con soporte de notación por puntos, corchetes y separadores custom.

Manejo de Dinero y Moneda

Cómo representar, analizar, formatear y calcular valores monetarios con precisión entre monedas.

Parsear JSON

Cómo parsear cadenas JSON a estructuras de datos nativas en varios lenguajes de programación.

Programar y Monitorear DAGs con Apache Airflow

Cómo definir, programar y monitorear Directed Acyclic Graphs en Apache Airflow con operators, sensors, XCom y dependencias de tareas.

Operaciones Paralelas de DataFrame con Dask

Cómo usar Dask para operaciones paralelas de DataFrame en datasets más grandes que la memoria, cubriendo lazy evaluation, particiones, computations custom y scheduling distribuido.

Validar Schemas de DataFrame con Pandera

Cómo validar schemas de DataFrame de pandas y Polars con Pandera, cubriendo tipos de columnas, constraints, checks custom, hypothesis testing y herencia de schemas.

Transformar Datos en el Warehouse con dbt

Cómo usar dbt para transformaciones de datos basadas en SQL con models, tests, materializations, macros e incremental loading en un data warehouse.

Construir un Pipeline ETL con pandas y Parquet

Cómo construir un pipeline extract-transform-load usando pandas para procesamiento de datos y Parquet para almacenamiento columnar con coerción de tipos y validación.

Operaciones de DataFrame de Alto Rendimiento con Polars

Cómo usar Polars para operaciones rápidas de DataFrame con lazy evaluation, expression API, streaming e interop con pandas para datasets grandes.

Agregaciones a Gran Escala con PySpark

Cómo realizar agregaciones group-by en datasets grandes con PySpark, cubriendo window functions, UDFs, broadcast joins y tuning de performance.

Expresiones Regulares

Cómo usar expresiones regulares para matching de patrones, validación y extracción de texto en Python, JavaScript y Java.

Ordenar un Array

Cómo ordenar arrays y listas en orden ascendente, descendente y personalizado en varios lenguajes.

CTEs Recursivas para Consultas de Datos Jerárquicos

Cómo consultar datos jerárquicos con Common Table Expressions recursivas en SQL, cubriendo tree traversal, org charts, árboles de categorías y detección de ciclos.

Codificacion y Decodificacion de URLs

Domina la codificacion de URLs en JavaScript y otros lenguajes con encodeURI, encodeURIComponent, manejo de plus-safe, cumplimiento RFC 3986 y casos edge de decodificacion

URL Encoding

Cómo codificar y decodificar URLs, parámetros de query y segmentos de path de forma segura en Python, JavaScript y Java.

Generacion de UUID: v4, v7 y Comparacion con ULID

Compara UUID v4, v7, ULID y nanoid para generar identificadores unicos con diferentes tradeoffs en aleatoriedad, ordenamiento, rendimiento y localidad de indices de base de datos

Generación de UUID

Cómo generar identificadores únicos universales (UUIDs) para claves de base de datos, tokens de sesión y nombrado de recursos en Python, JavaScript y Java.

Exportar Datos a CSV/Excel

Cómo exportar datos estructurados a archivos CSV y Excel de forma eficiente.

Patrón Batch-to-Streaming Bridge

Cómo bridgear batch y streaming pipelines con un data lake. Cubre Lambda architecture, Kafka Connect S3 sink, schema alignment, y unified serving layer.

Patrón CDC: Stream Database Changes a Downstream

Cómo streamear database changes a downstream consumers con CDC. Cubre log-based CDC, Debezium, Kafka Connect, outbox pattern, y consumer reconciliation.

Patrón Data Lineage Tracking

Cómo trackear data origin y transformations end-to-end. Cubre column-level lineage, OpenLineage, Marquez, metadata injection, y impact analysis.

Patrón ETL Extract-Transform-Load

Cómo construir ETL pipelines con extract, transform, y load stages. Cubre staging tables, incremental extraction, idempotent loads, y orchestration.

Patrón Idempotent Load

Cómo re-run data loads safely sin duplicates. Cubre deduplication keys, MERGE upserts, load IDs, partition overwrite, y transactional loads.

Patrón Schema Registry Evolution

Cómo manejar schema versions para streaming pipelines con un schema registry. Cubre Avro, backward compatibility, forward compatibility, y consumer migration.

Plantilla de Política de Gobernanza de Datos

Una plantilla para clasificación, retención, control de acceso, privacidad y cumplimiento de datos cubriendo GDPR, CCPA y SOC 2.

Plantilla de Documento de Diseño de Data Pipeline

Una plantilla para documentar sources, transforms, sinks, scheduling, error handling y monitoring de data pipelines con schema definitions.

Plantilla de Reglas de Calidad de Datos

Una plantilla para definir reglas de validación por dataset y columna: completeness, consistency, accuracy, timeliness y uniqueness checks.

Plantilla de Runbook para Jobs ETL

Un runbook para operar, monitorear y troubleshootear jobs ETL: startup, shutdown, health checks, common failures, diagnostics y recovery.

Plantilla de Clasificación de Datos

Plantilla para clasificar datos como públicos, internos, confidenciales o restringidos con reglas de manejo.