Construiré una pipeline de datos de producción de código abierto de pila completa con automatización cicd.

Parte de la información se ha traducido automáticamente.

Pakistán

Hablo Urdu, Inglés

Ingeniero de datos

Ingeniero de datos especializado en construir lakehouses de datos de extremo a extremo y autoalojados en Kubernetes usando tecnologías de código abierto. Diseñé y operé una plataforma de datos de nive...
Acerca de este Servicio

¿Buscas soporte flexible en ingeniería de datos, ya sea para una 

solución rápida o para construir un pipeline completo? Ofrezco tres niveles de compromiso:


Soporte por hora: solución rápida de errores, tareas pequeñas de Spark/ETL, o consulta

Compromiso a medio tiempo: desarrollo de pipelines o modelos dbt enfocado en 20 horas

Construcción completa de proyecto: configuración end-to-end de lakehouse (más de 50 horas)


Soy un ingeniero de datos con experiencia práctica en construir un lakehouse completo y autoalojado en Kubernetes, procesando aproximadamente 5 millones de filas usando Apache Spark, Apache Iceberg, Trino, dbt-Trino y Google BigQuery.


Lo que entrego:

Ingesta, limpieza y transformación de pipelines ETL con Apache Spark

Verificación de calidad de datos usando PyDeequ

Modelos de capa Gold en dbt-Trino: esquema estrella, Data Vault, OBT, Marts

Orquestación con Dagster y automatización CI/CD

Documentación completa (niveles Standard y Premium)


Envíame un mensaje antes de ordenar para que podamos discutir tus requisitos específicos.

Plataforma de almacenes:

Snowflake

BigQuery

Databricks

Tipo de proyecto:

Nueva creación

Mi porfolio

Etiquetas relacionadas