Construiré pipelines de datos ETL, ELT con Python, Spark, Airflow y dbt
Ingeniero de Datos y IA, Python, PySpark, Airflow y ETL en la nube
Acerca de este Servicio
Sobre este servicio:
¿Necesitas que tus datos se limpien, transformen y fluyan de manera confiable desde la fuente hasta el destino? Construyo pipelines ETL/ELT usando herramientas modernas de ingeniería de datos como Python, PySpark, SQL, Apache Airflow, dbt y Databricks, siguiendo la arquitectura Medallion (Bronze/Silver/Gold) para capas de datos limpias y listas para producción.
Trabajos recientes incluyen un pipeline que ingiere datos en vivo vía API, lo orquesta con Airflow con alertas automáticas de fallos, los transforma mediante más de 10 modelos dbt con más de 60 pruebas de calidad de datos, y los presenta en un dashboard de Power BI además de un pipeline separado en Databricks que procesa datos de comercio electrónico de principio a fin con PySpark.
Lo que ofrezco:
- Diseño y desarrollo de pipelines ETL/ELT (batch)
- Limpieza, validación y pruebas de calidad de datos
- Implementación de la arquitectura Medallion (Bronze/Silver/Gold)
- Orquestación con Apache Airflow
- Transformación de datos con dbt, SQL, PySpark
- Desarrollo de pipelines en Databricks
- Ingesta de datos vía API
- Integración de dashboards (Power BI)
Por qué trabajar conmigo:
- Trabajo real y verificable, cada entregable cuenta con un repositorio público en GitHub
- Comunicación clara, plazos realistas
- Código limpio, documentado y de estilo productivo, no scripts desechables
Plataforma de destino:
Postgresql
•
Amazon S3
•
Otros
Herramientas y plataformas:
Azure Data Factory
•
Otros
Mi porfolio
FAQ
Traducción automática
¿Qué tipo de pipelines de datos puedes construir?
Construyo pipelines ETL/ELT que extraen datos de APIs, bases de datos, archivos planos (CSV/Excel) o sitios web. Limpio, transformo y pruebo esos datos usando Python, PySpark y dbt, y luego los entrego en un formato estructurado a tu base de datos o data warehouse (como PostgreSQL o Databricks).
¿No soy técnico, aún puedes ayudarme?
Por supuesto. La mayoría de mis clientes no son ingenieros. Dime tu objetivo final en inglés sencillo (por ejemplo, "Necesito que mis datos diarios de ventas y inventario se consoliden en un solo lugar"), y yo me encargaré de la arquitectura técnica y te lo explicaré de forma sencilla.
¿Puedes automatizar una pipeline para que funcione diariamente o semanalmente?
Sí. Me especializo en usar Apache Airflow para orquestar y automatizar flujos de trabajo. Dependiendo de tu paquete, puedo configurar ejecuciones programadas, dependencias entre tareas y alertas automáticas por email si alguna parte del pipeline falla.
¿Puedes ayudar con web scraping?
Sí. Puedo crear web scrapers con Python para extraer datos de sitios públicos, asegurando que el proyecto cumple con requisitos legales y reglas del sitio. También puedo integrar directamente con APIs, lo cual siempre recomiendo primero para mayor estabilidad.
¿Qué es la "Arquitectura Medallion"?
Es un patrón de diseño de datos que organiza la información en tres capas: Bronze (datos en crudo), Silver (datos limpios y filtrados) y Gold (datos listos para negocio). Uso esto para asegurar que tus informes finales se construyan con datos altamente confiables y probados.
¿Se puede integrar esto con herramientas de BI?
Sí. Diseño la capa final de tu pipeline de datos específicamente para que herramientas como Power BI, Tableau u otras plataformas de análisis puedan conectarse directamente y consultar los datos de manera eficiente.
¿Qué es el enriquecimiento de datos con IA?
El enriquecimiento de datos con IA significa usar herramientas de IA o LLM para agregar más significado y estructura a datos en bruto y desordenados. Por ejemplo, los comentarios de clientes sin estructura pueden categorizarse automáticamente por sentimiento, o extraer entidades específicas (como nombres o ubicaciones) de bloques grandes de texto.
¿Puedes agregar enriquecimiento con IA o LLM a mis datos?
Sí. Puedo integrar flujos de trabajo de IA/LLM en tu pipeline para tareas como resumen, clasificación, etiquetado y convertir texto no estructurado en campos de base de datos limpios y consultables antes de que lleguen a tu dashboard.
¿Utilizas pruebas de calidad de datos?
Sí. Creo firmemente que la calidad de los datos debe estar integrada desde el principio, no añadida después. Uso dbt para implementar pruebas automáticas (verificación de nulos, duplicados o valores aceptados) para que tu pipeline te alerte sobre datos malos antes de que arruinen tus informes.

