Construiré o optimizaré pipelines de datos en pyspark databricks

Parte de la información se ha traducido automáticamente.

Estados Unidos

Hablo Inglés, Hindi

Diseño y automatización de sistemas AI agentic de FullStack, MLOps

Ingeniero de AI/ML Full-Stack y Estadístico Aplicado con 10 años en datos, ML y IA empresarial. Construyo flujos de trabajo agentic, sistemas RAG, modelos predictivos, pipelines de datos, APIs y herra...
Acerca de este Servicio

¿Necesitas un pipeline de PySpark o Databricks que sea confiable, escalable y fácil de entender?


Revisaré, construiré, arreglaré u optimizaré un pipeline de datos limitado usando PySpark, Spark SQL, Delta Lake y Azure Databricks cuando sea apropiado.


Puedo abordar trabajos lentos, shuffles excesivos, sesgo en joins, particionado, poda, funciones de ventana, características temporales, procesamiento incremental, Delta Lake, verificaciones de calidad de datos y refactorización de Python UDF.


Tu entrega puede incluir código corregido, hallazgos de rendimiento, implementación del pipeline, verificaciones de validación, guía de benchmarks, documentación y transferencia técnica.


Mi trabajo reciente incluye procesamiento distribuido sobre miles de millones de registros de paquetes en Azure Databricks sin usar Python UDF. Me enfoco en mejoras explicables y fáciles de mantener.


Los paquetes cubren trabajos definidos, fuentes y transformaciones. Los cargos en la nube, credenciales de producción, administración de plataformas y dashboards no relacionados se excluyen a menos que se incluyan en una oferta personalizada.


Por favor, envíame un mensaje antes de ordenar con el código, esquemas, escala de datos, tiempo de ejecución actual y resultado deseado.

Idioma:

Inglés

Hindi

Experiencia técnica:

apache spark

Databricks

Snowflake

Experiencia:

Canalización de datos

Desarrollo ETL

industria:

Análisis de Datos

Legal

Marketing y publicidad

Mi porfolio