Construiré pipelines de datos que
Ingeniero de IA y ML para ajuste fino de LLM, RAG y ciencia de datos
Acerca de este Servicio
Construyo pipelines ETL de estilo productivo usando PySpark para transformación, Airflow para orquestación y Delta Lake para almacenamiento, la misma pila que uso en mi trabajo diario de ingeniería de datos.
Lo que cubre:
- Transformación de Bronze a Silver (datos en bruto a limpios) en PySpark
- Diseño de DAG en Airflow con programación adecuada y manejo de dependencias
- Configuración de tablas en Delta Lake con versionado
- Opcional: panel de control en Trino/Metabase sobre los datos limpios
- Arquitectura de pipeline completamente interna y autohospedada, sin dependencia de plataformas ETL gestionadas por terceros (Fivetran, Airbyte Cloud, etc.) si prefieres tener el control total del stack
Preguntaré sobre tu volumen de datos y formato de origen antes de comenzar el diseño del pipeline, ya que puede variar mucho entre un CSV de 10k filas y una fuente en streaming, y seré honesto en el alcance en lugar de reutilizar una plantilla genérica.
FAQ
Traducción automática
¿Trabajas con fuentes de datos en la nube (S3, GCS, Azure Blob)?
Sí — especifica tu fuente en los requisitos.
¿Puedes arreglar un pipeline roto existente en lugar de construir uno nuevo?
Sí, envíame un mensaje primero con los detalles — el precio varía respecto a los trabajos de construcción desde cero.
¿Necesito tener mi propia instancia de Airflow?
No, puedo configurarla (local/Docker) como parte de la entrega, o trabajar dentro de la tuya si me proporcionas acceso.
¿Puedes construir esto sin depender de herramientas ETL gestionadas por terceros?
Sí — construyo pipelines completamente internos y autohospedados (PySpark + Airflow + Delta Lake) en lugar de integrar herramientas como Fivetran o Airbyte Cloud. Disponible en el nivel Premium.
