Construiré pipelines de ETL escalables usando spark, databricks y delta lake
Acerca de este Servicio
Ingeniería de Datos Profesional | ETL | Databricks | Spark | Especialista en Data Lake
¿Buscas un pipeline de datos escalable y listo para producción para tu negocio?
Soy un Ingeniero de Datos Profesional con experiencia real en la industria construyendo soluciones de Big Data usando:
- Apache Spark / PySpark
- Databricks (Delta Lake, Medallion Architecture)
- Azure Data Factory
- Hadoop Ecosystem
- SQL y Python
- Integraciones API (SOAP/REST)
- MongoDB, Oracle, MySQL, PostgreSQL, etc.
Lo que puedo ayudarte a hacer:
- Desarrollo de pipelines ETL / ELT
- Procesamiento de datos en batch y en tiempo real
- Integraciones con Data Lake en bases de datos
- Diseño de arquitectura Delta Lake
- Limpieza y transformación de datos
- Optimización del rendimiento
- Ajuste de trabajos Spark
- Automatización y programación
- Ingesta de bases de datos mediante API
- Ingeniería de datos en la nube (Azure/Databricks)
Experiencia real incluye:
- Integración de MongoDB con Delta Lake
- Ingesta de API SOAP de Oracle Fusion en Delta Lake
- Pipelines diarios a nivel empresarial
- Procesamiento optimizado de big data para millones de registros
¿Por qué elegirme?
⭐ Experiencia en la industria
⭐ Código limpio y optimizado
⭐ Arquitectura escalable
⭐ Entrega a tiempo
⭐ Satisfacción total del cliente
FAQ
Traducción automática
1. ¿Qué servicios ofreces en este gig?
Ofrezco servicios profesionales de Ingeniería de Datos y ETL/ELT que incluyen: Desarrollo en PySpark / Spark Flujos de trabajo en Databricks Pipelines en Azure Data Factory Integraciones con bases de datos y API Configuración de Data Lake / Delta Lake Limpieza y transformación de datos Optimización y automatización de pipelines
2. ¿Con qué tecnologías y herramientas trabajas?
Me especializo en: Apache Spark / PySpark Databricks (Delta Lake, Notebooks, Jobs) Azure Data Factory Ecosistema Hadoop Python y SQL APIs REST/SOAP MongoDB, Oracle, MySQL, PostgreSQL, SQL Server Almacenamiento en la nube (ADLS, S3, Blob)
3. ¿Puedes integrar datos de múltiples fuentes?
Sí. Puedo integrar datos de: Bases de datos APIs Archivos CSV/Excel/JSON Almacenamiento en la nube Fuentes de streaming
4. ¿Construyes pipelines tanto de ETL como de ELT?
Sí. Apoyo: ETL (Transformar antes de cargar) ELT (Cargar primero, transformar en Databricks/Spark) Dependiendo de tu caso de uso, recomendaré la mejor arquitectura para rendimiento y costo.
5. ¿Puedes optimizar mis trabajos lentos en Spark o Databricks?
Por supuesto. Ayudo con: Ajuste de particiones Estrategias de caché Optimización de memoria Reducción de shuffle Optimización de consultas Ajuste del rendimiento en Delta Lake Esto puede reducir significativamente el tiempo de ejecución y los costos en la nube.
¿Qué necesitas de mí antes de comenzar?
Por favor, proporciona: Detalles de la fuente (DB/API/archivos) Conjunto de datos de muestra o esquema Formato de salida esperado Detalles de la plataforma en la nube Requisitos del negocio Fecha límite Requisitos claros me ayudan a entregar más rápido y mejor.
