Construiré pipelines de etl para ingeniería de datos usando apache airflow
Data Scientist junior, ingeniero de ML, Python, pipelines ETL
Acerca de este Servicio
¿Tu información está en APIs o archivos sin una forma automatizada de recopilarla y almacenarla? Construyo pipelines ETL listos para producción y flujos de trabajo de ingeniería de datos usando Apache Airflow 3, Python y SQL que extraen, transforman y cargan tus datos en un horario, completamente automatizado, sin trabajo manual.
Lo que entrego:
- Pipeline automatizado con tareas independientes de extracción, transformación y carga
- Apache Airflow 3 con TaskFlow API y programación diaria
- Pila de Docker multi-contenedor para un despliegue limpio y reproducible
- Base de datos PostgreSQL o MySQL con registros estructurados y consultables
- Código fuente completo entregado vía GitHub
¿Por qué elegirme? Tengo una publicación revisada por pares en una conferencia IEEE, doble certificación en DataCamp (Data Scientist certificado y Associate Data Scientist certificado), y una pasantía de investigación en un laboratorio de IA en Reino Unido. Mi pipeline ETL funciona en producción en vivo, acumulando más de 365 registros estructurados al año sin intervención manual.
Trabajo con: APIs REST y fuentes de datos basadas en archivos, cargando datos en bases de datos SQL como PostgreSQL o MySQL.
Nota: Por favor, envíame un mensaje antes de hacer tu pedido para discutir tu fuente de datos y requisitos.
Plataforma de destino:
Postgresql
•
mySQL
Herramientas y plataformas:
Otros
Mi porfolio
FAQ
Traducción automática
¿A qué fuentes de datos puedes conectarte?
Actualmente APIs REST. Si tienes una fuente diferente como archivos CSV o una base de datos, envíame un mensaje primero y podemos discutir la viabilidad.
¿Te encargas de toda la ingeniería de datos o solo de scripts básicos de ETL?
Ingeniería de datos completa: arquitectura de pipelines, orquestación con Apache Airflow, contenedores Docker y código listo para producción, no un script puntual.
¿Necesito tener Apache Airflow ya instalado?
No. Configuraré el entorno de la canalización por ti, incluyendo la configuración de Docker si es necesario.
¿La canalización se ejecutará automáticamente sin que tenga que hacer nada?
Sí. Los paquetes Estándar y Premium incluyen automatización totalmente programada usando Apache Airflow que se ejecuta en tu horario definido sin necesidad de activación manual.
¿Recibiré el código fuente?
Sí, todos los paquetes incluyen el código fuente completo en Python y los archivos DAG.
¿Puedes trabajar con mi base de datos existente?
Sí, siempre que puedas proporcionar las credenciales de conexión de forma segura. Recomiendo discutir esto antes de ordenar.
¿El pipeline verifica datos malos o inválidos?
Sí. Los datos entrantes se validan antes de cargarlos, revisando tipos, campos requeridos y valores claramente inválidos, para que un registro mal formado sea detectado en lugar de llegar silenciosamente a tu base de datos.
¿Qué pasa si un paso en la pipeline falla?
Cada tarea intenta varias veces automáticamente antes de fallar, y puedes recibir una alerta por correo si una ejecución finalmente falla, así los problemas se detectan de inmediato en lugar de días después.

