Construiré y optimizaré grandes pipelines de datos con apache spark

Parte de la información se ha traducido automáticamente.

India

Hablo Telugu, Inglés, Hindi

Ingeniero de datos sénior

Ingeniero de datos senior con más de 8 años de experiencia en construcción y optimización de pipelines de datos distribuidos a gran escala. Con experiencia en Apache Spark, Scala, PySpark, Hive, Hado...
Acerca de este Servicio

Optimización experta de Apache Spark y arquitectura de pipelines de datos

¿Tus trabajos de Spark fallan con errores de Out-of-Memory (OOM), se agotan en las transmisiones o cuestan demasiado en la nube?

Soy un ingeniero de datos senior con más de 8 años de experiencia en empresas construyendo, solucionando problemas y optimizando pipelines de datos distribuidos a gran escala. Me especializo en procesar cargas de trabajo de varios terabytes y resolver cuellos de botella complejos en Big Data usando Apache Spark, Scala, PySpark, Hadoop y Hive.

Lo que puedo hacer por ti:

  • Optimización de rendimiento en Spark: Resolver desequilibrios de datos, optimizar joins costosos y ajustar la asignación de memoria para detener fallos en los trabajos y reducir drásticamente el tiempo de ejecución.
  • Desarrollo de pipelines ETL: Diseñar y construir pipelines de ingestión de datos robustos, escalables y tolerantes a fallos desde cero, usando las mejores prácticas para particionado y almacenamiento.
  • Depuración en producción: Analizar en profundidad el linaje, los shuffles y la utilización de recursos del clúster para arreglar problemas silenciosos de rendimiento en tu código existente.
  • Pila tecnológica principal: Apache Spark, Scala, Python/PySpark, Hadoop, Hive, SQL y plataformas en la nube (AWS).

Ya sea que necesites una solución rápida para un problema en una consulta o una arquitectura de datos empresarial de extremo a extremo, puedo ayudarte.