Construiré pipelines de datos ETL automatizados usando pyspark y python

Parte de la información se ha traducido automáticamente.

India

Hablo Inglés
Ingeniero de datos que diseñó y construyó una plataforma de datos de salud desde cero, procesando actualmente más de 5 millones de registros de pacientes y más de 10 TB de datos clínicos provenientes ...
Acerca de este Servicio

¿Necesitas procesamiento de datos escalable y de alto rendimiento para tu negocio?

Soy un ingeniero de datos profesional especializado en PySpark, Python, SQL y arquitecturas de datos en la nube. Ayudo a las empresas a transformar conjuntos de datos sin estructura y en bruto en pipelines de datos limpios, confiables y útiles.

Lo que puedo hacer por ti:

  • Construir pipelines ETL/ELT robustos en batch y en tiempo real usando PySpark.
  • Procesar conjuntos de datos masivos en CSV, Parquet, JSON o SQL con alto rendimiento.
  • Integrar PySpark con Databricks, AWS (S3, Glue, Redshift), GCP y Azure.
  • Optimizar código PySpark lento (reparticionamiento, caching, joins broadcast, corrección de errores por falta de memoria).
  • Limpiar, validar y estructurar conjuntos de datos sucios para análisis o Machine Learning.

¿Por qué elegirme?

  • Código listo para producción, completamente comentado.
  • Instrucciones completas de configuración.
  • Seguridad y confidencialidad total de los datos.

Plataforma de destino:

Postgresql

•

mySQL

Herramientas y plataformas:

AWS Glue DataBrew