Construiré pipelines ETL en AWS con airflow, spark y python
Ingeniero de datos sénior
Acerca de este Servicio
Ingeniero de datos senior con más de 10 años creando ETL en producción para clientes de Fortune 500 (Expedia, Ford, HP).
Construyo pipelines de datos confiables y listos para producción en AWS usando Python, PySpark, Airflow y Spark, no scripts desechables. Ingeniería real: particionado, joins de broadcast, orquestación y pruebas.
Historial:
Reducí un trabajo HiveQL de 64 horas a menos de 3 horas (95.6% más rápido)
Migré 500 TB de Hadoop a AWS, completamente validado
Construí y gestioné mi propia plataforma SaaS multi-inquilino de principio a fin
Lo que obtienes: pipelines de código limpio, documentado y desplegable que tu equipo puede mantener, no una caja negra.
Con base en México (superposición de zona horaria con EE. UU.), colaboración en tiempo real durante tus horas laborales. Inglés fluido.
No estás seguro de qué paquete necesitas? Envíame un mensaje primero y lo definiré contigo.
Herramientas y plataformas:
AWS Glue DataBrew
•
Otros
Mi porfolio
FAQ
Traducción automática
P: ¿Trabajas con fuentes de datos fuera de AWS?
R: Sí — Ingreso datos desde bases de datos (PostgreSQL, MySQL), APIs, archivos y fuentes de streaming como Kafka, depositando los datos en S3, Redshift o tu almacén de datos preferido.
¿Recibiré el código fuente y la documentación?
R: Siempre. Recibes código limpio, controlado por versiones y documentación para que tu equipo pueda ejecutar y mantener todo de forma independiente.
P: No estoy seguro de qué paquete necesito. ¿Puedes ayudar?
R: Por supuesto. Envíame un mensaje con tus fuentes, destino y volumen, y te recomendaré el paquete adecuado o crearé una oferta personalizada.
P: ¿Puedes arreglar u optimizar un pipeline existente en lugar de construir uno nuevo?
R: Sí. Audito pipelines rotos o lentos y los optimizo — mi trabajo con HiveQL redujo un trabajo de 64 horas a menos de 3.

