Construiré una pipeline de datos ETL que limpia y enriquece en el camino.
Ingeniero de datos en Python: web scraping, pipelines ETL y enriquecimiento de datos
Nivel 2
Ha cumplido con los criterios de alto rendimiento y tiene un historial comprobado de cumplimiento de las expectativas de los clientes.
Acerca de este Servicio
La data llega de seis lugares y ninguno coincide. Una API REST, dos hojas de cálculo que alguien mantiene a mano, una salida de scraper y una exportación de CRM con nombres de columnas diferentes en todos ellos. Alguien pasa una mañana a la semana ensamblándolo todo.
Lo que hace la pipeline
- Extrae datos de sitios web, APIs REST, bases de datos y archivos
- Los limpia, elimina duplicados y los reestructura en un esquema que tú defines
- Enriquece los registros con otras fuentes: datos de empresas, contactos, geodatos
- Los carga en BigQuery, PostgreSQL, MySQL, Sheets o tu CRM
- Funciona en un horario programado, orquestado en Airflow o n8n
Construido para que no falle en silencio
- Reintentos y limitación de tasa en cada fuente
- Validación dentro de la pipeline, para que las filas malas se detecten antes de que lleguen
- Alertas cuando una ejecución falla o un campo empieza a llegar vacío
Construí la pipeline detrás de más de 1 millón de perfiles de abogados en EE. UU., funcionando sin supervisión.
Obtienes la pipeline funcional, el código fuente y la documentación de configuración escrita para quien la herede. Dime tus fuentes y tu destino, y lo evaluaré y cotizaré antes de que hagas el pedido.
Mi porfolio
FAQ
Traducción automática
¿Qué fuentes puedes conectar?
Sitios web y scrapers, APIs REST y GraphQL, PostgreSQL, MySQL, MongoDB, BigQuery, archivos CSV y Excel, Google Sheets y la mayoría de los CRMs a través de su API. Si una fuente tiene API o una página, generalmente puede ser una fuente. Envíame la lista y confirmaré antes de cotizar.
¿Dónde puede cargar los datos?
BigQuery, PostgreSQL, MySQL, MongoDB, Google Sheets, S3 o archivos planos. Si el destino es un CRM o una app en lugar de un almacén, eso es una integración y funciona igual. Dime qué lee los datos después y escribiré en lo que eso espera.
¿Cómo se programa y dónde se ejecuta?
Airflow cuando el flujo de trabajo tiene dependencias reales entre pasos, n8n cuando es más simple y quieres verlo, y un cron simple cuando ninguno de los dos vale la pena por la sobrecarga. Se ejecuta en tu servidor o en tu cuenta en la nube, así que no dependo de mí después de la entrega.
¿Puedes integrar dos herramientas que no se comunican entre sí?
Sí, y es una versión común de este trabajo. Extrae de una API, transforma a lo que la otra espera, envía, maneja errores y límites de tasa, y programa. HubSpot, Airtable, Salesforce, Sheets y la mayoría de APIs REST. Zapier o n8n donde encajen, Python personalizado donde no.
¿Con qué puedes enriquecer los registros?
Tamaño de la empresa, industria, ubicación, sitio web, tecnología en uso, correos electrónicos y teléfonos de negocios, nombres de tomadores de decisiones y geocodificación. Lo que esté disponible depende de la fuente, así que te diré qué campos probablemente estarán completos antes de que hagas el pedido, no después.
¿Recibo el código?
Sí, todo ello, documentado y a tu disposición para modificar. La entrega incluye el repositorio, un readme con instrucciones de instalación y configuración, la definición del programa y los ajustes de conexión con tus propias credenciales en lugar de las mías.
¿Qué pasa cuando una fuente cambia y se rompe el pipeline?
Te lo advierte, que es el objetivo. La validación se realiza dentro del pipeline en lugar de después, así que una fuente que empieza a devolver campos vacíos falla la ejecución en lugar de cargar silenciosamente nulos en tu warehouse. La opción premium incluye la configuración de monitoreo y alertas.
¿Puedes monitorear y mantenerlo después de entregarlo?
La opción premium incluye monitoreo y alertas en la entrega. El mantenimiento continuo, donde vigilo las alertas y arreglo fallos, es un acuerdo mensual separado. La mayoría de los clientes toman el código y lo ejecutan, por eso las instrucciones están escritas para un desconocido, no para ti.
¿Cuánta información puede manejar?
El trabajo más grande procesó más de 100 millones de archivos JSON en CSV listos para análisis. El volumen suele ser una cuestión de diseño más que un límite: agrupamiento, cargas incrementales y dónde se realiza la transformación. Dime el número de filas y la frecuencia y te diré la forma.
Esto parece costoso. ¿Hay una versión más pequeña?
Sí. Si solo necesitas extraer una fuente a un destino en un horario, Basic cubre eso y no se necesita nada más. Si quieres los datos una sola vez en lugar de repetidamente, mi servicio de scraping cuesta una décima parte y es la respuesta correcta. Lo diré en lugar de intentar venderte algo más.
