Construiré pipelines de datos y ETL en pyspark y databricks

Parte de la información se ha traducido automáticamente.

India

Hablo Inglés

Ingeniero de datos para PySpark, Databricks, SQL y Python

Hola, soy Abhishek, un ingeniero de datos a tiempo completo en GHD que trabaja con PySpark, Databricks, SQL, Python y Azure. Ayudo a empresas e ingenieros con: - Construcción y reparación de pipeline...
Acerca de este Servicio

¿Necesitas un pipeline de datos confiable, o un trabajo de Spark que sea demasiado lento o que siga fallando? Soy un ingeniero de datos a tiempo completo que trabaja con PySpark, Databricks, SQL y Azure todos los días.


LO QUE PUEDO HACER POR TI:

  1. Construir pipelines ETL/ELT en PySpark y Databricks (CSV, JSON, Parquet, APIs, bases de datos)
  2. Cargar datos en Delta Lake, Databricks, Azure Synapse, PostgreSQL o SQL Server
  3. Cargas incrementales, Delta MERGE / upserts, tablas de historial SCD Tipo 2
  4. Arreglar trabajos de Spark lentos o que fallan: desequilibrio de datos, shuffles, joins, archivos pequeños, errores de memoria
  5. Verificaciones de calidad de datos, deduplicación y tablas de informes limpias
  6. Programación con Azure Data Factory o Databricks Workflows

LO QUE RECIBES:

  1. Código limpio, comentado y de estilo producción
  2. Un documento breve que explique cómo ejecutarlo y mantenerlo
  3. Runtimes antes/después para trabajos de optimización

Por favor, envíame un mensaje antes de ordenar con tus fuentes de datos, volúmenes y objetivo, para confirmar el paquete y el plazo adecuados. No se necesitan credenciales de producción; datos de muestra o un sandbox son suficientes para comenzar.

Plataforma de destino:

Azure Synapse Analytics

Herramientas y plataformas:

Azure Data Factory

•

Otros