Construiré pipelines de datos que

Parte de la información se ha traducido automáticamente.

India

Hablo Inglés

Ingeniero de IA y ML para ajuste fino de LLM, RAG y ciencia de datos

Desarrollador de IA/ML con experiencia práctica en producción en ajuste fino de LLM (QLoRA/PEFT), sistemas RAG (ChromaDB, búsqueda vectorial en MongoDB Atlas, memoria agentica) y ingeniería de datos (...
Acerca de este Servicio

Construyo pipelines ETL de estilo productivo usando PySpark para transformación, Airflow para orquestación y Delta Lake para almacenamiento, la misma pila que uso en mi trabajo diario de ingeniería de datos.

Lo que cubre:

  • Transformación de Bronze a Silver (datos en bruto a limpios) en PySpark
  • Diseño de DAG en Airflow con programación adecuada y manejo de dependencias
  • Configuración de tablas en Delta Lake con versionado
  • Opcional: panel de control en Trino/Metabase sobre los datos limpios
  • Arquitectura de pipeline completamente interna y autohospedada, sin dependencia de plataformas ETL gestionadas por terceros (Fivetran, Airbyte Cloud, etc.) si prefieres tener el control total del stack

Preguntaré sobre tu volumen de datos y formato de origen antes de comenzar el diseño del pipeline, ya que puede variar mucho entre un CSV de 10k filas y una fuente en streaming, y seré honesto en el alcance en lugar de reutilizar una plantilla genérica.

Plataforma de destino:

Amazon Redshift

Databricks Lakehouse

Herramientas y plataformas:

AWS Glue DataBrew