Crearé pipelines de datos en producción con pyspark, python y sql

Parte de la información se ha traducido automáticamente.

India

Hablo Inglés, Hindi

Ingeniero de datos y backend

Más de 13 años construyendo plataformas de datos y sistemas backend — Goldman Sachs, Walmart Global Tech, Ola y dos startups financiadas donde lideré equipos de 6 a 12 ingenieros. Lo que realmente ha...
Acerca de este Servicio

He pasado más de 13 años construyendo pipelines de datos en Goldman Sachs, Walmart Global Tech, Ola y dos startups respaldadas por inversión. Los pipelines que he gestionado mueven terabytes al día. Ahora construiré el tuyo.


LO QUE OBTIENES

- Un pipeline funcional en PySpark / Python / SQL, no solo un volcado de notas

- Idempotente y reejecutable, para que sea seguro volver a correr después de un fallo

- Maneja nulos, duplicados, datos tardíos y cambios en el esquema en lugar de fallar

- Código comentado y legible, además de un video corto explicándolo paso a paso


TRABAJO CON

PySpark, Pandas, Polars, SQL (Postgres, MySQL, Redshift, BigQuery), Airflow, dbt, Kafka, Iceberg, AWS (S3, EMR, Glue, Lambda)


TRABAJOS TÍPICOS

- CSV/JSON/Parquet desordenados convertidos en una tabla limpia y modelada

- Un trabajo o consulta en Spark que necesita terminarse realmente

- Una extracción programada desde una API o base de datos

- Funciones de ventana, lógica de deduplicación, cargas incrementales, CDC


ANTES DE PEDIR

Envíame un mensaje con una muestra de datos y cómo debería verse el resultado. Te diré qué paquete se ajusta o si no soy la persona adecuada para ello. La definición del alcance es gratis.


Estoy en IST y trabajo en horarios que superponen con EE. UU. y la UE.

Plataforma de destino:

Google BigQuery

Amazon Redshift

Herramientas y plataformas:

Hevo Data

Kafka Connect

Debezium