Construiré una pipeline de datos ETL que limpia y enriquece en el camino.

Parte de la información se ha traducido automáticamente.

Pakistán

Hablo Urdu, Inglés

259 pedidos completados

Ingeniero de datos en Python: web scraping, pipelines ETL y enriquecimiento de datos

Obtengo datos de sitios que fueron diseñados para mantenerlos: renderizado en JavaScript, inicios de sesión, límites de tasa, protección anti-bot. Luego, la pipeline que asegura que lleguen. Seis año...

Nivel 2

Ha cumplido con los criterios de alto rendimiento y tiene un historial comprobado de cumplimiento de las expectativas de los clientes.

Acerca de este Servicio

La data llega de seis lugares y ninguno coincide. Una API REST, dos hojas de cálculo que alguien mantiene a mano, una salida de scraper y una exportación de CRM con nombres de columnas diferentes en todos ellos. Alguien pasa una mañana a la semana ensamblándolo todo.


Lo que hace la pipeline

  • Extrae datos de sitios web, APIs REST, bases de datos y archivos
  • Los limpia, elimina duplicados y los reestructura en un esquema que tú defines
  • Enriquece los registros con otras fuentes: datos de empresas, contactos, geodatos
  • Los carga en BigQuery, PostgreSQL, MySQL, Sheets o tu CRM
  • Funciona en un horario programado, orquestado en Airflow o n8n


Construido para que no falle en silencio

  • Reintentos y limitación de tasa en cada fuente
  • Validación dentro de la pipeline, para que las filas malas se detecten antes de que lleguen
  • Alertas cuando una ejecución falla o un campo empieza a llegar vacío


Construí la pipeline detrás de más de 1 millón de perfiles de abogados en EE. UU., funcionando sin supervisión.


Obtienes la pipeline funcional, el código fuente y la documentación de configuración escrita para quien la herede. Dime tus fuentes y tu destino, y lo evaluaré y cotizaré antes de que hagas el pedido.

Plataforma de destino:

Google BigQuery

Postgresql

mySQL

Amazon S3

Herramientas y plataformas:

AWS Glue DataBrew

Mi porfolio