Construiré pipelines de datos listas para producción con apache spark y kafka
Acerca de este Servicio
Construyo pipelines de datos que aguantan en producción, no solo en un camino feliz.
Doce años en banca y servicios financieros significan que he pasado la mayor parte de mi tiempo en las partes menos glamorosas: registros duplicados, datos que llegan tarde, cambios en el esquema que rompen todo lo que está abajo, y trabajos que necesitan ser reejecutados de forma segura. Esa es la diferencia entre un pipeline que funciona en una demo y uno que puedes dejar corriendo.
Con qué trabajo: Apache Spark, Kafka, Avro, Apache Iceberg, PostgreSQL, Java, Python, en GCP y Kubernetes.
Trabajos típicos que realizo:
- ETL por lotes o en streaming desde sistemas fuente hacia un warehouse o lago de datos
- Convertir scripts frágiles en trabajos Spark adecuados
- Consumidores y productores de Kafka con manejo sensato de errores y reintentos
- Arreglar pipelines que son lentos, inestables o que silenciosamente descartan datos
Explico lo que hago en un lenguaje sencillo y te diré honestamente si tu problema necesita una solución más simple que la que pediste.
Envíame un mensaje antes de ordenar con tus fuentes de datos y volumen aproximado, y te diré qué paquete se ajusta o si soy la persona equivocada para el trabajo.
Herramientas y plataformas:
Otros

