Construiré o optimizaré pipelines de datos en pyspark databricks
Diseño y automatización de sistemas AI agentic de FullStack, MLOps
Acerca de este Servicio
¿Necesitas un pipeline de PySpark o Databricks que sea confiable, escalable y fácil de entender?
Revisaré, construiré, arreglaré u optimizaré un pipeline de datos limitado usando PySpark, Spark SQL, Delta Lake y Azure Databricks cuando sea apropiado.
Puedo abordar trabajos lentos, shuffles excesivos, sesgo en joins, particionado, poda, funciones de ventana, características temporales, procesamiento incremental, Delta Lake, verificaciones de calidad de datos y refactorización de Python UDF.
Tu entrega puede incluir código corregido, hallazgos de rendimiento, implementación del pipeline, verificaciones de validación, guía de benchmarks, documentación y transferencia técnica.
Mi trabajo reciente incluye procesamiento distribuido sobre miles de millones de registros de paquetes en Azure Databricks sin usar Python UDF. Me enfoco en mejoras explicables y fáciles de mantener.
Los paquetes cubren trabajos definidos, fuentes y transformaciones. Los cargos en la nube, credenciales de producción, administración de plataformas y dashboards no relacionados se excluyen a menos que se incluyan en una oferta personalizada.
Por favor, envíame un mensaje antes de ordenar con el código, esquemas, escala de datos, tiempo de ejecución actual y resultado deseado.
Mi porfolio
FAQ
Traducción automática
¿Puedes optimizar un trabajo de PySpark existente?
Sí. Revisaré la lógica de ejecución, joins, shuffles, sesgo, particionado, caching, funciones de ventana, uso de UDF, lecturas/escrituras y estructura del trabajo. Las mejoras reales dependen de los datos, la configuración del clúster y la implementación existente.
¿Puedes garantizar una mejora específica en el rendimiento?
No. Identificaré cuellos de botella y validaré mejoras cuando tenga acceso a una ejecución representativa, pero el tiempo de ejecución depende de la distribución de datos, recursos del clúster, concurrencia, almacenamiento y configuración de la plataforma.
¿Trabajas solo con Azure Databricks?
Mi experiencia más reciente es con Azure Databricks y PySpark, pero los conceptos de Spark también aplican a otros entornos gestionados de Spark. Confirma tu plataforma antes de ordenar.
¿Necesitas acceso a datos de producción?
No necesariamente. Muestras sanitizadas, esquemas, planes de ejecución, capturas de pantalla de Spark UI, logs y datos de prueba reproducibles suelen ser suficientes. Nunca envíes credenciales de producción sin restricciones a través de Fiverr.
¿Están incluidos los cargos en la nube y en el clúster?
No. El comprador paga los cargos de Databricks, la nube, almacenamiento, base de datos y otra infraestructura. Usa un entorno sin producción controlado en costos siempre que sea posible.
¿Me proporcionarás el código fuente y la documentación?
Sí. Los entregables siguen el paquete seleccionado e incluyen notebooks, módulos de Python, SQL, ejemplos de configuración, pruebas, hallazgos, instrucciones README y un manual de operaciones.
¿Puedes construir una plataforma de extremo a extremo?
Este Gig cubre pipelines limitados y trabajos conectados. Una plataforma de datos completa, migración a nivel de organización, programa de gobernanza u operación continua en producción requiere descubrimiento y una oferta personalizada de hitos.
¿Qué cuenta como revisión?
Una revisión corrige el trabajo entregado respecto a los requisitos acordados. Nuevas fuentes, transformaciones, notebooks, plataformas, esquemas o cambios en la lógica empresarial son alcance adicional.

