Explorar las categorías
Explora
Fiverr Pro
Español
$
USD
Construiré y optimizaré grandes pipelines de datos con apache spark
Ingeniero de datos sénior
Ingeniero de datos senior con más de 8 años de experiencia en construcción y optimización de pipelines de datos distribuidos a gran escala.
Con experiencia en Apache Spark, Scala, PySpark, Hive, Hado...
Acerca de este Servicio
Optimización experta de Apache Spark y arquitectura de pipelines de datos
¿Tus trabajos de Spark fallan con errores de Out-of-Memory (OOM), se agotan en las transmisiones o cuestan demasiado en la nube?
Soy un ingeniero de datos senior con más de 8 años de experiencia en empresas construyendo, solucionando problemas y optimizando pipelines de datos distribuidos a gran escala. Me especializo en procesar cargas de trabajo de varios terabytes y resolver cuellos de botella complejos en Big Data usando Apache Spark, Scala, PySpark, Hadoop y Hive.
Lo que puedo hacer por ti:
- Optimización de rendimiento en Spark: Resolver desequilibrios de datos, optimizar joins costosos y ajustar la asignación de memoria para detener fallos en los trabajos y reducir drásticamente el tiempo de ejecución.
- Desarrollo de pipelines ETL: Diseñar y construir pipelines de ingestión de datos robustos, escalables y tolerantes a fallos desde cero, usando las mejores prácticas para particionado y almacenamiento.
- Depuración en producción: Analizar en profundidad el linaje, los shuffles y la utilización de recursos del clúster para arreglar problemas silenciosos de rendimiento en tu código existente.
- Pila tecnológica principal: Apache Spark, Scala, Python/PySpark, Hadoop, Hive, SQL y plataformas en la nube (AWS).
Ya sea que necesites una solución rápida para un problema en una consulta o una arquitectura de datos empresarial de extremo a extremo, puedo ayudarte.
