data
Recursos prácticos sobre data para ingenieros de software.
87 resultados
Entendiendo el Procesamiento de Datos en Ingeniería de Software
Toda aplicación eventualmente trabaja con datos — analizando entrada de usuario, serializando objetos para APIs, validando envíos de formularios o transformando registros entre formatos. Manejar datos correctamente es lo que separa scripts frágiles de sistemas listos para producción.
Esta colección cubre recetas y patrones prácticos para trabajar con JSON, CSV, XML, YAML y formatos personalizados. Encontrarás soluciones listas para copiar para tareas comunes como aplanar objetos anidados, sanitizar entrada de usuario, generar slugs y formatear fechas en Python, Java y JavaScript.
Patrones de Procesamiento por Lotes
Diseña pipelines robustos de procesamiento por lotes para grandes datasets con retry, idempotencia y observabilidad.
Caching y Memoización
Cómo cachear computaciones costosas y respuestas de API usando caches en memoria, LRU y distribuidos en Python, JavaScript y Java.
Validar y Sanitizar Datos de Input de Usuario
Cómo validar, sanitizar y restringir datos de input de usuario en el boundary de aplicación usando schemas, type checking y librerías de validación.
Formateo de Fechas
Cómo parsear, formatear y manipular fechas a través de timezones usando Python, JavaScript y Java.
Deep Clone de Objetos en JavaScript
Cómo crear copias profundas de objetos y arrays en JavaScript correctamente, manejando referencias circulares, Dates, Maps, Sets y clases custom.
Deep Clone de Objetos en JavaScript: Mas alla de JSON.parse
Compara estrategias de deep clone incluyendo JSON.parse, structuredClone, recursion manual y librerias para copiar objetos anidados con referencias circulares
Comparar Objetos JSON
Cómo comparar dos objetos JSON y encontrar diferencias en Python, Java y JavaScript.
Aplanar y Reconstruir Objetos Anidados
Cómo convertir objetos anidados en pares clave-valor planos y reconstruirlos, con soporte de notación por puntos, corchetes y separadores custom.
Formatear Números de Teléfono
Cómo formatear y validar números de teléfono en Python, Java y JavaScript.
Generar Reportes PDF con Python
Cómo crear documentos PDF con estilos a partir de datos usando ReportLab y fpdf2 en Python.
Generar Slugs URL
Cómo generar slugs limpios y amigables para URLs desde strings en múltiples lenguajes.
Merge de Archivos JSON en JavaScript
Cómo combinar múltiples archivos JSON con estrategias de resolución de conflictos usando Node.js.
Fusionar Archivos JSON
Cómo fusionar múltiples archivos JSON en un solo objeto o array en Python, Java y JavaScript.
Manejo de Dinero y Moneda
Cómo representar, analizar, formatear y calcular valores monetarios con precisión entre monedas.
Analizar Argumentos de Línea de Comandos
Cómo analizar argumentos de línea de comandos en aplicaciones CLI de Python, Java y Node.js.
Analizar Archivos CSV
Cómo analizar archivos CSV en Python, Java y JavaScript con ejemplos de código prácticos.
Leer Archivos CSV con Python y Pandas
Cómo leer, filtrar y transformar archivos CSV grandes usando Python pandas y el módulo csv.
Analizar Archivos Excel
Cómo leer y escribir archivos Excel (.xlsx) en Python, Java y JavaScript.
Parsear JSON
Cómo parsear cadenas JSON a estructuras de datos nativas en varios lenguajes de programación.
Analizar Archivos de Log
Cómo analizar archivos de log de servidores usando Python, Java y JavaScript.
Analizar Archivos Markdown
Cómo analizar Markdown a HTML y extraer datos estructurados en Python, Java y JavaScript.
Analizar Archivos PDF
Cómo extraer texto y metadata de archivos PDF en Python, Java y JavaScript.
Analizar Archivos TOML
Cómo analizar archivos de configuración TOML en Python, Java y JavaScript.
Analizar Archivos XML
Cómo analizar documentos XML en Python, Java y JavaScript con ejemplos de código prácticos.
Analizar Archivos YAML
Cómo analizar archivos de configuración YAML en Python, Java y JavaScript.
Programar y Monitorear DAGs con Apache Airflow
Cómo definir, programar y monitorear Directed Acyclic Graphs en Apache Airflow con operators, sensors, XCom y dependencias de tareas.
Operaciones Paralelas de DataFrame con Dask
Cómo usar Dask para operaciones paralelas de DataFrame en datasets más grandes que la memoria, cubriendo lazy evaluation, particiones, computations custom y scheduling distribuido.
Validar Schemas de DataFrame con Pandera
Cómo validar schemas de DataFrame de pandas y Polars con Pandera, cubriendo tipos de columnas, constraints, checks custom, hypothesis testing y herencia de schemas.
Transformar Datos en el Warehouse con dbt
Cómo usar dbt para transformaciones de datos basadas en SQL con models, tests, materializations, macros e incremental loading en un data warehouse.
Leer y Escribir Archivos Excel con Python
Cómo leer, escribir y formatear hojas de cálculo Excel usando openpyxl y pandas en Python.
Generar Códigos QR con Python
Crea códigos QR para URLs, texto y tarjetas de contacto usando la librería qrcode en Python.
Construir un Pipeline ETL con pandas y Parquet
Cómo construir un pipeline extract-transform-load usando pandas para procesamiento de datos y Parquet para almacenamiento columnar con coerción de tipos y validación.
Operaciones de DataFrame de Alto Rendimiento con Polars
Cómo usar Polars para operaciones rápidas de DataFrame con lazy evaluation, expression API, streaming e interop con pandas para datasets grandes.
Agregaciones a Gran Escala con PySpark
Cómo realizar agregaciones group-by en datasets grandes con PySpark, cubriendo window functions, UDFs, broadcast joins y tuning de performance.
Extrae Datos de Páginas HTML con Python y BeautifulSoup
Parsea HTML y extrae datos usando BeautifulSoup. Cubre selectores CSS, navegación DOM, tablas, paginación y scraping respetuoso con rate limiting.
Expresiones Regulares
Cómo usar expresiones regulares para matching de patrones, validación y extracción de texto en Python, JavaScript y Java.
Serializar y Deserializar Datos
Cómo serializar y deserializar datos en JSON, XML y YAML en Python, Java y JavaScript.
Ordenar un Array
Cómo ordenar arrays y listas en orden ascendente, descendente y personalizado en varios lenguajes.
CTEs Recursivas para Consultas de Datos Jerárquicos
Cómo consultar datos jerárquicos con Common Table Expressions recursivas en SQL, cubriendo tree traversal, org charts, árboles de categorías y detección de ciclos.
Truncar Texto
Cómo truncar texto con ellipsis y límites de palabras en Python, Java y JavaScript.
Codificacion y Decodificacion de URLs
Domina la codificacion de URLs en JavaScript y otros lenguajes con encodeURI, encodeURIComponent, manejo de plus-safe, cumplimiento RFC 3986 y casos edge de decodificacion
URL Encoding
Cómo codificar y decodificar URLs, parámetros de query y segmentos de path de forma segura en Python, JavaScript y Java.
Generacion de UUID: v4, v7 y Comparacion con ULID
Compara UUID v4, v7, ULID y nanoid para generar identificadores unicos con diferentes tradeoffs en aleatoriedad, ordenamiento, rendimiento y localidad de indices de base de datos
Generación de UUID
Cómo generar identificadores únicos universales (UUIDs) para claves de base de datos, tokens de sesión y nombrado de recursos en Python, JavaScript y Java.
Validar JSON Schema
Cómo validar datos JSON contra schemas en Python, Java y JavaScript.
Implementa Transacciones ACID en PostgreSQL
Como usar transacciones de PostgreSQL para asegurar Atomicidad, Consistencia, Aislamiento y Durabilidad en operaciones de base de datos de multiples pasos
Agregaciones de Elasticsearch para Analitica y Busqueda
Como usar agregaciones de Elasticsearch para construir busqueda facetada, dashboards de analitica y metricas en tiempo real desde datos indexados
Templates de Email Responsivos con MJML
Crea templates de email responsivos compatibles con multiples clientes usando MJML, variables en vivo con Handlebars y CSS inline para renderizado confiable en Gmail, Outlook y Apple Mail
Patrón RAG Hybrid Search
Combina busqueda por palabras clave (BM25) y semantica (vectores) para mejorar la precision de recuperacion en pipelines RAG. Fusiona resultados con reciprocal rank fusion.
Patrón Batch-to-Streaming Bridge
Cómo bridgear batch y streaming pipelines con un data lake. Cubre Lambda architecture, Kafka Connect S3 sink, schema alignment, y unified serving layer.
Patrón CDC: Stream Database Changes a Downstream
Cómo streamear database changes a downstream consumers con CDC. Cubre log-based CDC, Debezium, Kafka Connect, outbox pattern, y consumer reconciliation.
Patrón Data Lineage Tracking
Cómo trackear data origin y transformations end-to-end. Cubre column-level lineage, OpenLineage, Marquez, metadata injection, y impact analysis.
Patrón ETL Extract-Transform-Load
Cómo construir ETL pipelines con extract, transform, y load stages. Cubre staging tables, incremental extraction, idempotent loads, y orchestration.
Patrón Idempotent Load
Cómo re-run data loads safely sin duplicates. Cubre deduplication keys, MERGE upserts, load IDs, partition overwrite, y transactional loads.
Patrón Schema Registry Evolution
Cómo manejar schema versions para streaming pipelines con un schema registry. Cubre Avro, backward compatibility, forward compatibility, y consumer migration.
Plantilla de Runbook de Migracion de Datos
Una plantilla de runbook para migrar datos entre sistemas de forma segura incluyendo verificaciones pre-migracion, procedimientos de rollback y validacion post-migracion.
Referencia Detallada de Kafka Stream Processing
Construye pipelines de event streaming en tiempo real con Kafka. Cubre producers, consumers, Kafka Streams, Kafka Connect, schema registry y patrones de procesamiento.
Data Lake vs Data Warehouse — Guía de Arquitectura
Guía práctica de arquitectura Data Lake: almacenamiento estructurado vs no estructurado, conceptos de lakehouse, patrones ETL vs ELT y cuándo elegir un lake sobre un warehouse.
Arquitectura Data Mesh — Propiedad de Datos Descentralizada
Guía práctica de Data Mesh: descentralizar la propiedad de datos a equipos de dominio, tratar datos como producto y habilitar infraestructura de datos self-serve.
Arquitectura Lakehouse — Lo Mejor de Ambos Mundos
Guía práctica de arquitectura Lakehouse: combinar flexibilidad de almacenamiento de data lake con confiabilidad de data warehouse usando formatos de tabla abiertos.
Almacenamiento Blob: Patrones S3, GCS y Azure Blob para
Guía práctica sobre almacenamiento blob en la nube: diseño de buckets, control de acceso, políticas de ciclo de vida, subidas multipartes, URLs firmadas, y patrones de optimización de costos para S3, Google Cloud Storage y Azure Blob.
Estrategias de Caché
Guía práctica sobre estrategias de caché: caché del navegador, caché perimetral de CDN, caché de aplicación con Redis, y caché de consultas de base de datos. Aprende cuándo usar cada una y cómo evitar pesadillas de invalidación de caché.
Apache Airflow: DAGs, Operadores, Scheduling
Dominá Apache Airflow: DAGs, operadores, sensores, XCom, scheduling, backfilling, connections, variables y patrones de producción para orquestación de pipelines.
Arquitectura de Data Pipelines: Batch, Streaming, Lambda
Dominá arquitectura de data pipelines: batch processing, streaming, patrones lambda y kappa, ETL vs ELT y cómo elegir el approach correcto para tus data workloads.
Guía de Data Quality
Dominá data quality: frameworks de validación, profiling, schema enforcement, anomaly detection y monitoreo con Great Expectations, Pandera y Soda para pipelines confiables.
dbt: Modelos, Tests, Macros, Materializations
Dominá dbt para data transformations: modelos, tests, macros, materializations, seeds, snapshots, Jinja templating y patrones de producción para analytics engineering.
Migración de Datos: Estrategias Zero-Downtime que Funcionan
Guía práctica sobre migración de datos: planificación, patrones de doble escritura, estrategias de backfill, evolución de esquemas, validación y procedimientos de rollback para mover datos sin interrupción de servicio.
Pipelines ETL: Extract, Transform, Load para Ingenieros
Guía práctica sobre pipelines ETL: extraer datos de múltiples fuentes, transformar con validación y lógica de negocio, y cargar en data warehouses. Cubre programación de batches, manejo de errores y monitoreo con Python, dbt y Airflow.
Búsqueda de Texto Completo
Guía práctica sobre búsqueda de texto completo: tsvector de PostgreSQL, indexación en Elasticsearch, diseño de consultas, ajuste de relevancia, y construcción de búsqueda con autocompletado, faceting y tolerancia a errores tipográficos.
Analítica en Tiempo Real
Guía práctica sobre analítica en tiempo real: recolección de eventos, procesamiento de streams, data warehousing y construcción de dashboards sub-segundo con Kafka, ClickHouse, Druid y bases de datos OLAP modernas.
Procesamiento de Streams: Pipelines con Kafka y Flink
Guía práctica sobre procesamiento de streams: elegir entre Kafka Streams, Flink y Spark Streaming, diseñar esquemas de eventos, manejar operaciones stateful, y construir pipelines exactly-once para datos en tiempo real.
Referencia Detallada de Elasticsearch Cluster Setup
Despliega y escala clusters de Elasticsearch. Cubre roles de nodos, sharding, réplicas, index templates, mapping, snapshots y tuning de producción para search a escala.
Referencia Detallada de SQL Query Optimization
Optimizar SQL queries. Cubre EXPLAIN plan analysis, index strategies, join optimization, N+1 query detection, query rewriting, materialized views, partitioning, connection pooling y query caching con ejemplos practicos de PostgreSQL y MySQL.
Bases de Datos de Grafos
Guia practica de bases de datos de grafos: modelo de grafo de propiedades, lenguaje Cypher, patrones de modelado y cuando elegir Neo4j sobre bases relacionales.
Patrones de Modelado NoSQL
Guia practica de modelado NoSQL: embebido vs referenciado, diseno basado en patrones de acceso, y patrones para MongoDB, DynamoDB, Cassandra y Redis.
CTEs en SQL — Expresiones de Tablas Comunes Explicadas
Guia practica de CTEs en SQL: expresiones no recursivas y recursivas, legibilidad, rendimiento y cuando usarlas sobre subconsultas.
SQL Joins — Guía Visual con Ejemplos
Guía visual de SQL joins: INNER, LEFT, RIGHT, FULL OUTER, CROSS y SELF joins con ejemplos prácticos, tips de rendimiento y errores comunes.
Funciones de Ventana SQL — Referencia Detallada
Guia practica de funciones de ventana SQL: ROW_NUMBER, RANK, DENSE_RANK, LEAD, LAG, SUM, AVG sobre particiones y casos de uso de analitica real.
Bases de Datos Vectoriales
Guia practica de bases de datos vectoriales: embeddings, busqueda por similitud, vecinos aproximados mas cercanos, y elegir entre Pinecone, Weaviate, pgvector y Chroma.
A/B Testing: Frameworks de Experimentación para
Guía práctica sobre A/B testing: diseño de experimentos, significancia estadística, tamaño de muestra, evitando pitfalls y construyendo cultura de experimentación en equipos de ingeniería.
AWS Básico — Servicios Core para Desarrolladores
Guía práctica de servicios core de AWS para desarrolladores: compute, storage, bases de datos, networking y fundamentos de seguridad con ejemplos hands-on.
Azure Básico — Servicios Core para Desarrolladores
Guía práctica de servicios core de Microsoft Azure para desarrolladores: compute, storage, bases de datos, networking e identity con ejemplos hands-on.
GCP Básico: Servicios Core para Desarrolladores
Guía práctica de servicios core de Google Cloud Platform para desarrolladores: compute, storage, bases de datos, networking y data analytics con ejemplos hands-on.
Terraform Best Practices — Módulos, State y Workspaces
Guía práctica de mejores prácticas de Terraform: diseño de módulos, gestión de estado remoto, workspaces y seguridad para infraestructura como código de grado productivo.
Cumplimiento GDPR — Guía Práctica para Desarrolladores
Guía orientada a desarrolladores sobre cumplimiento GDPR: derechos de los titulares, base legal, minimización de datos y medidas técnicas para privacidad desde el diseño.
No se encontraron resultados.