Construiré pipelines de datos en tiempo real con apache kafka, spark y aws

Parte de la información se ha traducido automáticamente.

India

Hablo Inglés

Ingeniero de datos

Soy un ingeniero de datos orientado a resultados con más de 5 años de experiencia en Big Data, AWS y liderazgo técnico. Me especializo en diseñar pipelines a gran escala nativos de la nube y arquitect...
Acerca de este Servicio

PIPELINES QUE SOBREVIVEN EN PRODUCCIÓN, NO SOLO LA DEMO.


Construyo pipelines de datos por lotes y en streaming que funcionan todos los días sin que alguien tenga que estar vigilándolos.


LO QUE ENTREGO

- Ingesta en streaming: Kafka, Kinesis, RabbitMQ, NiFi, CDC desde tu base de datos

- Transformaciones con PySpark / Spark SQL, ajustadas - no la configuración por defecto

- Data lake en S3 con Apache Iceberg: evolución de esquemas, viaje en el tiempo, MERGE upserts

- Cargas en warehouse en Redshift, Snowflake, Athena o BigQuery

- Historial SCD Tipo 2, deduplicación, re-ejecuciones idempotentes, manejo de datos que llegan tarde

- DAGs en Airflow, reintentos, alertas y dashboards en CloudWatch/Grafana

- CI/CD, pruebas y documentación para que sea fácil de mantener


RESULTADOS

Más de 3.5 años en una plataforma de streaming de una telecom europea: más de 100 pipelines en producción, 0.6 TB/día (18 TB/mes), millones de usuarios en 8 países. Reduje más del 50% el tiempo de cómputo en más de 100 trabajos de PySpark. Menos del 60% en fallos de trabajos. Más del 99.9% de tiempo en línea.


También migré una carga de trabajo de Redshift a Apache Iceberg: consultas un 40% más rápidas con menor gasto.


Envíame tu fuente, tu destino y tu volumen. Te daré un alcance fijo y un plazo real antes de que hagas tu pedido.


Idioma:

Inglés

•

Alemán

•

Hindi

•

Esloveno

Experiencia técnica:

Apache NiFi

•

Apache Airflow

•

apache spark

Experiencia:

Canalización de datos

•

Desarrollo ETL

industria:

Audio y video

•

Análisis de Datos

•

Servicios financieros

Mi porfolio