Construiré tu pipeline de datos ETL usando Python, SQL, Airflow y AWS
Ingeniero de datos
Acerca de este Servicio
¿Luchas con datos desordenados y dispersos que son difíciles de confiar? Creo pipelines ETL confiables que convierten datos en bruto en información limpia y lista para consultar, como lo hacen los equipos de datos de producción.
Trabajo con Python, SQL, Apache Airflow, PySpark y AWS para mover tus datos desde la fuente hasta un almacén estructurado, con validaciones en el camino para detectar datos malos temprano.
Lo que puedo ayudarte a hacer:
diseño y desarrollo de pipelines ETL/ELT
Orquestación con Apache Airflow (DAGs programados)
Ingesta de datos desde APIs, CSVs y bases de datos
Transformación de datos con Python/PySpark
Modelado de almacenes de datos (tablas de hechos/dimensiones, PostgreSQL)
Validación de calidad de datos y controles automáticos
He creado pipelines de extremo a extremo que manejan más de 100,000 registros de múltiples fuentes, estructurados en almacenes limpios y listos para análisis.
Me importa tener código limpio y comunicación clara para que sepas qué está pasando en cada etapa, no solo recibir una caja negra al final.
¿Tienes otra fuente de datos o necesitas algo diferente? Envíame un mensaje primero, feliz de verificar si encaja antes de que hagas tu pedido.
Plataforma de destino:
Amazon Redshift
•
Postgresql
•
mySQL
•
Amazon S3
Herramientas y plataformas:
AWS Glue DataBrew
•
Otros
