Skip to content
StackPractices

data

Recursos prácticos sobre data para ingenieros de software.

87 resultados

Entendiendo el Procesamiento de Datos en Ingeniería de Software

Toda aplicación eventualmente trabaja con datos — analizando entrada de usuario, serializando objetos para APIs, validando envíos de formularios o transformando registros entre formatos. Manejar datos correctamente es lo que separa scripts frágiles de sistemas listos para producción.

Esta colección cubre recetas y patrones prácticos para trabajar con JSON, CSV, XML, YAML y formatos personalizados. Encontrarás soluciones listas para copiar para tareas comunes como aplanar objetos anidados, sanitizar entrada de usuario, generar slugs y formatear fechas en Python, Java y JavaScript.

intermediate

Patrones de Procesamiento por Lotes

Diseña pipelines robustos de procesamiento por lotes para grandes datasets con retry, idempotencia y observabilidad.

intermediate

Caching y Memoización

Cómo cachear computaciones costosas y respuestas de API usando caches en memoria, LRU y distribuidos en Python, JavaScript y Java.

beginner

Convertir CSV a JSON

Cómo convertir datos CSV a formato JSON en Python, Java y JavaScript.

beginner

Convertir JSON a CSV

Cómo convertir datos JSON a formato CSV en Python, Java y JavaScript.

beginner

Validar y Sanitizar Datos de Input de Usuario

Cómo validar, sanitizar y restringir datos de input de usuario en el boundary de aplicación usando schemas, type checking y librerías de validación.

beginner

Formateo de Fechas

Cómo parsear, formatear y manipular fechas a través de timezones usando Python, JavaScript y Java.

intermediate

Deep Clone de Objetos en JavaScript

Cómo crear copias profundas de objetos y arrays en JavaScript correctamente, manejando referencias circulares, Dates, Maps, Sets y clases custom.

beginner

Deep Clone de Objetos en JavaScript: Mas alla de JSON.parse

Compara estrategias de deep clone incluyendo JSON.parse, structuredClone, recursion manual y librerias para copiar objetos anidados con referencias circulares

beginner

Comparar Objetos JSON

Cómo comparar dos objetos JSON y encontrar diferencias en Python, Java y JavaScript.

intermediate

Aplanar y Reconstruir Objetos Anidados

Cómo convertir objetos anidados en pares clave-valor planos y reconstruirlos, con soporte de notación por puntos, corchetes y separadores custom.

beginner

Formatear Números de Teléfono

Cómo formatear y validar números de teléfono en Python, Java y JavaScript.

intermediate

Generar Reportes PDF con Python

Cómo crear documentos PDF con estilos a partir de datos usando ReportLab y fpdf2 en Python.

beginner

Generar Slugs URL

Cómo generar slugs limpios y amigables para URLs desde strings en múltiples lenguajes.

intermediate

Merge de Archivos JSON en JavaScript

Cómo combinar múltiples archivos JSON con estrategias de resolución de conflictos usando Node.js.

beginner

Fusionar Archivos JSON

Cómo fusionar múltiples archivos JSON en un solo objeto o array en Python, Java y JavaScript.

intermediate

Manejo de Dinero y Moneda

Cómo representar, analizar, formatear y calcular valores monetarios con precisión entre monedas.

beginner

Analizar Argumentos de Línea de Comandos

Cómo analizar argumentos de línea de comandos en aplicaciones CLI de Python, Java y Node.js.

beginner

Analizar Archivos CSV

Cómo analizar archivos CSV en Python, Java y JavaScript con ejemplos de código prácticos.

beginner

Leer Archivos CSV con Python y Pandas

Cómo leer, filtrar y transformar archivos CSV grandes usando Python pandas y el módulo csv.

beginner

Analizar Archivos Excel

Cómo leer y escribir archivos Excel (.xlsx) en Python, Java y JavaScript.

beginner

Parsear JSON

Cómo parsear cadenas JSON a estructuras de datos nativas en varios lenguajes de programación.

intermediate

Analizar Archivos de Log

Cómo analizar archivos de log de servidores usando Python, Java y JavaScript.

beginner

Analizar Archivos Markdown

Cómo analizar Markdown a HTML y extraer datos estructurados en Python, Java y JavaScript.

beginner

Analizar Archivos PDF

Cómo extraer texto y metadata de archivos PDF en Python, Java y JavaScript.

beginner

Analizar Archivos TOML

Cómo analizar archivos de configuración TOML en Python, Java y JavaScript.

beginner

Analizar Archivos XML

Cómo analizar documentos XML en Python, Java y JavaScript con ejemplos de código prácticos.

beginner

Analizar Archivos YAML

Cómo analizar archivos de configuración YAML en Python, Java y JavaScript.

advanced

Programar y Monitorear DAGs con Apache Airflow

Cómo definir, programar y monitorear Directed Acyclic Graphs en Apache Airflow con operators, sensors, XCom y dependencias de tareas.

advanced

Operaciones Paralelas de DataFrame con Dask

Cómo usar Dask para operaciones paralelas de DataFrame en datasets más grandes que la memoria, cubriendo lazy evaluation, particiones, computations custom y scheduling distribuido.

intermediate

Validar Schemas de DataFrame con Pandera

Cómo validar schemas de DataFrame de pandas y Polars con Pandera, cubriendo tipos de columnas, constraints, checks custom, hypothesis testing y herencia de schemas.

intermediate

Transformar Datos en el Warehouse con dbt

Cómo usar dbt para transformaciones de datos basadas en SQL con models, tests, materializations, macros e incremental loading en un data warehouse.

intermediate

Leer y Escribir Archivos Excel con Python

Cómo leer, escribir y formatear hojas de cálculo Excel usando openpyxl y pandas en Python.

beginner

Generar Códigos QR con Python

Crea códigos QR para URLs, texto y tarjetas de contacto usando la librería qrcode en Python.

intermediate

Construir un Pipeline ETL con pandas y Parquet

Cómo construir un pipeline extract-transform-load usando pandas para procesamiento de datos y Parquet para almacenamiento columnar con coerción de tipos y validación.

intermediate

Operaciones de DataFrame de Alto Rendimiento con Polars

Cómo usar Polars para operaciones rápidas de DataFrame con lazy evaluation, expression API, streaming e interop con pandas para datasets grandes.

advanced

Agregaciones a Gran Escala con PySpark

Cómo realizar agregaciones group-by en datasets grandes con PySpark, cubriendo window functions, UDFs, broadcast joins y tuning de performance.

intermediate

Extrae Datos de Páginas HTML con Python y BeautifulSoup

Parsea HTML y extrae datos usando BeautifulSoup. Cubre selectores CSS, navegación DOM, tablas, paginación y scraping respetuoso con rate limiting.

beginner

Expresiones Regulares

Cómo usar expresiones regulares para matching de patrones, validación y extracción de texto en Python, JavaScript y Java.

beginner

Serializar y Deserializar Datos

Cómo serializar y deserializar datos en JSON, XML y YAML en Python, Java y JavaScript.

beginner

Ordenar un Array

Cómo ordenar arrays y listas en orden ascendente, descendente y personalizado en varios lenguajes.

advanced

CTEs Recursivas para Consultas de Datos Jerárquicos

Cómo consultar datos jerárquicos con Common Table Expressions recursivas en SQL, cubriendo tree traversal, org charts, árboles de categorías y detección de ciclos.

beginner

Truncar Texto

Cómo truncar texto con ellipsis y límites de palabras en Python, Java y JavaScript.

beginner

Codificacion y Decodificacion de URLs

Domina la codificacion de URLs en JavaScript y otros lenguajes con encodeURI, encodeURIComponent, manejo de plus-safe, cumplimiento RFC 3986 y casos edge de decodificacion

beginner

URL Encoding

Cómo codificar y decodificar URLs, parámetros de query y segmentos de path de forma segura en Python, JavaScript y Java.

beginner

Generacion de UUID: v4, v7 y Comparacion con ULID

Compara UUID v4, v7, ULID y nanoid para generar identificadores unicos con diferentes tradeoffs en aleatoriedad, ordenamiento, rendimiento y localidad de indices de base de datos

beginner

Generación de UUID

Cómo generar identificadores únicos universales (UUIDs) para claves de base de datos, tokens de sesión y nombrado de recursos en Python, JavaScript y Java.

intermediate

Validar JSON Schema

Cómo validar datos JSON contra schemas en Python, Java y JavaScript.

intermediate

Implementa Transacciones ACID en PostgreSQL

Como usar transacciones de PostgreSQL para asegurar Atomicidad, Consistencia, Aislamiento y Durabilidad en operaciones de base de datos de multiples pasos

intermediate

Agregaciones de Elasticsearch para Analitica y Busqueda

Como usar agregaciones de Elasticsearch para construir busqueda facetada, dashboards de analitica y metricas en tiempo real desde datos indexados

beginner

Templates de Email Responsivos con MJML

Crea templates de email responsivos compatibles con multiples clientes usando MJML, variables en vivo con Handlebars y CSS inline para renderizado confiable en Gmail, Outlook y Apple Mail

intermediate

Patrón RAG Hybrid Search

Combina busqueda por palabras clave (BM25) y semantica (vectores) para mejorar la precision de recuperacion en pipelines RAG. Fusiona resultados con reciprocal rank fusion.

advanced

Patrón Batch-to-Streaming Bridge

Cómo bridgear batch y streaming pipelines con un data lake. Cubre Lambda architecture, Kafka Connect S3 sink, schema alignment, y unified serving layer.

advanced

Patrón CDC: Stream Database Changes a Downstream

Cómo streamear database changes a downstream consumers con CDC. Cubre log-based CDC, Debezium, Kafka Connect, outbox pattern, y consumer reconciliation.

advanced

Patrón Data Lineage Tracking

Cómo trackear data origin y transformations end-to-end. Cubre column-level lineage, OpenLineage, Marquez, metadata injection, y impact analysis.

intermediate

Patrón ETL Extract-Transform-Load

Cómo construir ETL pipelines con extract, transform, y load stages. Cubre staging tables, incremental extraction, idempotent loads, y orchestration.

intermediate

Patrón Idempotent Load

Cómo re-run data loads safely sin duplicates. Cubre deduplication keys, MERGE upserts, load IDs, partition overwrite, y transactional loads.

advanced

Patrón Schema Registry Evolution

Cómo manejar schema versions para streaming pipelines con un schema registry. Cubre Avro, backward compatibility, forward compatibility, y consumer migration.

advanced

Plantilla de Runbook de Migracion de Datos

Una plantilla de runbook para migrar datos entre sistemas de forma segura incluyendo verificaciones pre-migracion, procedimientos de rollback y validacion post-migracion.

advanced

Referencia Detallada de Kafka Stream Processing

Construye pipelines de event streaming en tiempo real con Kafka. Cubre producers, consumers, Kafka Streams, Kafka Connect, schema registry y patrones de procesamiento.

intermediate

Data Lake vs Data Warehouse — Guía de Arquitectura

Guía práctica de arquitectura Data Lake: almacenamiento estructurado vs no estructurado, conceptos de lakehouse, patrones ETL vs ELT y cuándo elegir un lake sobre un warehouse.

advanced

Arquitectura Data Mesh — Propiedad de Datos Descentralizada

Guía práctica de Data Mesh: descentralizar la propiedad de datos a equipos de dominio, tratar datos como producto y habilitar infraestructura de datos self-serve.

intermediate

Arquitectura Lakehouse — Lo Mejor de Ambos Mundos

Guía práctica de arquitectura Lakehouse: combinar flexibilidad de almacenamiento de data lake con confiabilidad de data warehouse usando formatos de tabla abiertos.

intermediate

Almacenamiento Blob: Patrones S3, GCS y Azure Blob para

Guía práctica sobre almacenamiento blob en la nube: diseño de buckets, control de acceso, políticas de ciclo de vida, subidas multipartes, URLs firmadas, y patrones de optimización de costos para S3, Google Cloud Storage y Azure Blob.

intermediate

Estrategias de Caché

Guía práctica sobre estrategias de caché: caché del navegador, caché perimetral de CDN, caché de aplicación con Redis, y caché de consultas de base de datos. Aprende cuándo usar cada una y cómo evitar pesadillas de invalidación de caché.

advanced

Apache Airflow: DAGs, Operadores, Scheduling

Dominá Apache Airflow: DAGs, operadores, sensores, XCom, scheduling, backfilling, connections, variables y patrones de producción para orquestación de pipelines.

advanced

Arquitectura de Data Pipelines: Batch, Streaming, Lambda

Dominá arquitectura de data pipelines: batch processing, streaming, patrones lambda y kappa, ETL vs ELT y cómo elegir el approach correcto para tus data workloads.

advanced

Guía de Data Quality

Dominá data quality: frameworks de validación, profiling, schema enforcement, anomaly detection y monitoreo con Great Expectations, Pandera y Soda para pipelines confiables.

advanced

dbt: Modelos, Tests, Macros, Materializations

Dominá dbt para data transformations: modelos, tests, macros, materializations, seeds, snapshots, Jinja templating y patrones de producción para analytics engineering.

advanced

Migración de Datos: Estrategias Zero-Downtime que Funcionan

Guía práctica sobre migración de datos: planificación, patrones de doble escritura, estrategias de backfill, evolución de esquemas, validación y procedimientos de rollback para mover datos sin interrupción de servicio.

intermediate

Pipelines ETL: Extract, Transform, Load para Ingenieros

Guía práctica sobre pipelines ETL: extraer datos de múltiples fuentes, transformar con validación y lógica de negocio, y cargar en data warehouses. Cubre programación de batches, manejo de errores y monitoreo con Python, dbt y Airflow.

intermediate

Búsqueda de Texto Completo

Guía práctica sobre búsqueda de texto completo: tsvector de PostgreSQL, indexación en Elasticsearch, diseño de consultas, ajuste de relevancia, y construcción de búsqueda con autocompletado, faceting y tolerancia a errores tipográficos.

advanced

Analítica en Tiempo Real

Guía práctica sobre analítica en tiempo real: recolección de eventos, procesamiento de streams, data warehousing y construcción de dashboards sub-segundo con Kafka, ClickHouse, Druid y bases de datos OLAP modernas.

advanced

Procesamiento de Streams: Pipelines con Kafka y Flink

Guía práctica sobre procesamiento de streams: elegir entre Kafka Streams, Flink y Spark Streaming, diseñar esquemas de eventos, manejar operaciones stateful, y construir pipelines exactly-once para datos en tiempo real.

advanced

Referencia Detallada de Elasticsearch Cluster Setup

Despliega y escala clusters de Elasticsearch. Cubre roles de nodos, sharding, réplicas, index templates, mapping, snapshots y tuning de producción para search a escala.

advanced

Referencia Detallada de SQL Query Optimization

Optimizar SQL queries. Cubre EXPLAIN plan analysis, index strategies, join optimization, N+1 query detection, query rewriting, materialized views, partitioning, connection pooling y query caching con ejemplos practicos de PostgreSQL y MySQL.

intermediate

Bases de Datos de Grafos

Guia practica de bases de datos de grafos: modelo de grafo de propiedades, lenguaje Cypher, patrones de modelado y cuando elegir Neo4j sobre bases relacionales.

intermediate

Patrones de Modelado NoSQL

Guia practica de modelado NoSQL: embebido vs referenciado, diseno basado en patrones de acceso, y patrones para MongoDB, DynamoDB, Cassandra y Redis.

intermediate

CTEs en SQL — Expresiones de Tablas Comunes Explicadas

Guia practica de CTEs en SQL: expresiones no recursivas y recursivas, legibilidad, rendimiento y cuando usarlas sobre subconsultas.

beginner

SQL Joins — Guía Visual con Ejemplos

Guía visual de SQL joins: INNER, LEFT, RIGHT, FULL OUTER, CROSS y SELF joins con ejemplos prácticos, tips de rendimiento y errores comunes.

intermediate

Funciones de Ventana SQL — Referencia Detallada

Guia practica de funciones de ventana SQL: ROW_NUMBER, RANK, DENSE_RANK, LEAD, LAG, SUM, AVG sobre particiones y casos de uso de analitica real.

intermediate

Bases de Datos Vectoriales

Guia practica de bases de datos vectoriales: embeddings, busqueda por similitud, vecinos aproximados mas cercanos, y elegir entre Pinecone, Weaviate, pgvector y Chroma.

intermediate

A/B Testing: Frameworks de Experimentación para

Guía práctica sobre A/B testing: diseño de experimentos, significancia estadística, tamaño de muestra, evitando pitfalls y construyendo cultura de experimentación en equipos de ingeniería.

beginner

AWS Básico — Servicios Core para Desarrolladores

Guía práctica de servicios core de AWS para desarrolladores: compute, storage, bases de datos, networking y fundamentos de seguridad con ejemplos hands-on.

beginner

Azure Básico — Servicios Core para Desarrolladores

Guía práctica de servicios core de Microsoft Azure para desarrolladores: compute, storage, bases de datos, networking e identity con ejemplos hands-on.

beginner

GCP Básico: Servicios Core para Desarrolladores

Guía práctica de servicios core de Google Cloud Platform para desarrolladores: compute, storage, bases de datos, networking y data analytics con ejemplos hands-on.

intermediate

Terraform Best Practices — Módulos, State y Workspaces

Guía práctica de mejores prácticas de Terraform: diseño de módulos, gestión de estado remoto, workspaces y seguridad para infraestructura como código de grado productivo.

intermediate

Cumplimiento GDPR — Guía Práctica para Desarrolladores

Guía orientada a desarrolladores sobre cumplimiento GDPR: derechos de los titulares, base legal, minimización de datos y medidas técnicas para privacidad desde el diseño.