¿Necesitas procesamiento de datos escalable y de alto rendimiento para tu negocio?
Soy un ingeniero de datos profesional especializado en PySpark, Python, SQL y arquitecturas de datos en la nube. Ayudo a las empresas a transformar conjuntos de datos sin estructura y en bruto en pipelines de datos limpios, confiables y útiles.
Lo que puedo hacer por ti:
- Construir pipelines ETL/ELT robustos en batch y en tiempo real usando PySpark.
- Procesar conjuntos de datos masivos en CSV, Parquet, JSON o SQL con alto rendimiento.
- Integrar PySpark con Databricks, AWS (S3, Glue, Redshift), GCP y Azure.
- Optimizar código PySpark lento (reparticionamiento, caching, joins broadcast, corrección de errores por falta de memoria).
- Limpiar, validar y estructurar conjuntos de datos sucios para análisis o Machine Learning.
¿Por qué elegirme?
- Código listo para producción, completamente comentado.
- Instrucciones completas de configuración.
- Seguridad y confidencialidad total de los datos.