Crearé un crawler web en python y un scraper programado con una base de datos
Ingeniero de datos en Python: web scraping, pipelines ETL y enriquecimiento de datos
Nivel 1
Ha cumplido determinados criterios de rendimiento y muestra un gran potencial en la plataforma.
Acerca de este Servicio
Un scraper que se ejecuta una sola vez es un archivo. Un scraper que se ejecuta cada semana es un sistema, y la diferencia está en lo que pasa el día que el sitio cambia su diseño. La mayoría se rompe silenciosamente, y el panel de control muestra datos incorrectos durante dos semanas antes de que alguien se dé cuenta.
Lo que construyo
- Scrapers y crawlers personalizados en Python, para un sitio o varios
- Ejecuciones programadas en tu servidor o en la nube, escribiendo en PostgreSQL, BigQuery o Sheets
- Reintentos, limitación de tasa, rotación de proxy y manejo de logins y JavaScript
- Alertas cuando un campo empieza a devolver datos vacíos, así se detecta una ruptura silenciosa
Lo que obtienes
- El scraper funcional y el código fuente, para que puedas mantenerlo y modificarlo
- Documentación de configuración escrita para quien lo vaya a usar después, no solo para ti
- Una entrega breve para que pueda ser redeployado sin mi ayuda
Construí el crawler que recopilaba y estructuraba las declaraciones de proxy de todas las principales aerolíneas de EE. UU. y Europa.
Prefiero decirte que una fuente es una mala idea que construir algo frágil sobre ella. Envíame el sitio y la frecuencia con la que necesitas los datos, y lo evaluaré y cotizaré antes de que hagas el pedido.
Tecnología:
Python
•
Titiritero
•
Selenium
•
Beautiful Soup
•
Playwright
Técnica:
Automatizado
Mi porfolio
FAQ
Traducción automática
¿Obtengo el código fuente?
Sí, todo, y es tuyo para modificar, redeployar o entregárselo a otro desarrollador. Sin licencia, sin dependencia en tiempo de ejecución conmigo, sin ofuscación. El repositorio incluye un readme que explica cómo instalar, configurar y cambiar los campos que recopila.
¿Puede funcionar sin que tenga que tocarlo?
Para eso están las versiones Standard y Premium. Programado en tu propio servidor, en una pequeña VM en la nube o en AWS Lambda, con registros que puedes leer y alertas cuando una ejecución falla o no devuelve nada. Donde se ejecuta es tu elección, y lo configuraré donde prefieras.
¿Qué pasa cuando el sitio cambia y se rompe?
Dos cosas reducen el daño. Selectores escritos contra estructuras estables en lugar de clases generadas, para que pequeños rediseños no lo rompan. Y una validación que avisa cuando un campo empieza a devolver vacío, para que te enteres el mismo día en lugar de dos semanas después.
¿A qué bases de datos puede escribir?
PostgreSQL, MySQL, SQLite, BigQuery, MongoDB, o archivos CSV y Parquet si una base de datos es más de lo que necesitas. Google Sheets funciona para volúmenes menores. Dime qué datos quieres después y los escribiré en lo que sea que espere esa fuente.
¿Puede hacer seguimiento de precios o stock con el tiempo?
Sí, y es una de las mejores razones para construir en lugar de comprar una extracción puntual. Ejecuciones programadas con historial retenido significan que puedes ver movimientos en lugar de una instantánea. La versión Premium incluye la detección de cambios y las alertas correspondientes.
¿Qué pasa con protección anti-bot pesada?
Sesiones reales en Playwright, rotación de proxy residencial, temporización a ritmo humano y persistencia de sesión. La mayoría de los sitios son manejables. Algunos no valen el costo, y lo diré en lugar de cotizarte una pelea. Envíame la URL primero y lo revisaré.
¿Puedes mantenerlo después de la entrega?
El mantenimiento mensual está disponible como un acuerdo separado: vigilo las alertas, arreglo fallos y ajusto cuando la fuente cambia. Muchos clientes toman el código y lo ejecutan ellos mismos, por eso los documentos están escritos para un desconocido.
¿En qué se diferencia esto de tu servicio de web scraping?
Ese servicio entrega un archivo. Este entrega una máquina que genera el archivo. Si solo necesitas los datos una vez, pide ese, es más barato y rápido. Si los necesitarás de nuevo el próximo mes, este es el adecuado, y la segunda ejecución se paga sola.
¿Cuanto tiempo lleva una construcción?
Tres días para un scraper de un solo sitio con código fuente. Cinco cuando está programado y escribe en una base de datos. Siete para un crawler de múltiples sitios con monitoreo y documentación de entrega. Cotizo la fecha después de ver el sitio, y la complejidad puede moverlo antes de que hagas el pedido.
¿Puedes arreglar o tomar el control de un scraper que alguien más construyó?
Sí. Envíame el repositorio y dime qué está haciendo mal. Te diré qué está roto, si repararlo es más barato que reconstruirlo, y te daré una respuesta honesta cuando no lo sea. A veces la respuesta es que el código está bien y la fuente cambió.
