Crearé un scraper personalizado para sitios web con ejecuciones programadas y exportación limpia a CSV
Acerca de este Servicio
Construyo scrapers limpios en Python que obtienen datos web por ti en un horario establecido. Precios de productos, listados inmobiliarios, catálogos de competidores, reseñas o leads.
Lo que obtienes. Un scraper funcional desarrollado con Python y Playwright. Maneja sitios con JavaScript, paginación, casos de anti-bot y extracción estructurada mediante JSON LD o selectores CSS configurables. La salida puede ser en CSV, JSON, Excel, Google Sheets o directamente a tu base de datos.
Usos comunes. Monitoreo de precios de competidores con alertas diarias en Slack sobre caídas. Agregación de listados inmobiliarios en diferentes portales. Extracción de catálogos y reseñas de productos en e-commerce. Generación de leads desde directorios y sitios de listados. Noticias y artículos para análisis o pipelines RAG.
La opción premium incluye automatización completa. Cron de GitHub Actions, comparación de CSV y alertas por cambios. Arquitectura similar a mi repositorio público de monitor de precios de competidores en GitHub.
Soy honesto respecto a los límites. Sitios con protección anti-bot agresiva como Cloudflare Turnstile, muros de login o acceso solo residencial pueden requerir proxies pagos o no valer la pena para scrapear. Te informaré desde el principio si tu objetivo entra en esa categoría.
Mi porfolio
FAQ
Traducción automática
¿Qué información necesitas para empezar?
La(s) URL(s) del(s) sitio(s) que quieres scrapear, los campos exactos que necesitas (por ejemplo, nombre del producto, precio, SKU, URL de la imagen), el formato de salida (CSV/JSON/Excel/Sheets/DB) y con qué frecuencia quieres que se ejecute (una sola vez, diario, cada hora).
¿Es legal el web scraping?
Generalmente sí para datos accesibles públicamente, pero depende de los Términos de Servicio del sitio y de qué hagas con los datos (GDPR para datos personales, derechos de autor para reutilización de contenido). Solo scrapeo datos públicos, respeto robots.txt cuando es razonable y añado retrasos corteses. Para objetivos en zona gris, señalaré el riesgo.
¿Qué pasa si el sitio web cambia su diseño y rompe el scraper?
Mis scrapers usan extracción en capas (JSON-LD primero, microdatos, selectores CSS como respaldo) por lo que la mayoría de los rediseños no los rompen. Los selectores están en la configuración, no en el código, así que cambios pequeños son arreglos de una línea. Si se rompe en menos de 14 días y se puede arreglar en configuración, lo reparo gratis.
¿Puedes manejar login, captcha o protección anti-bot?
Login: sí si proporcionas credenciales y no hay captcha difícil. Anti-bot básico (UA, límites de tasa): sí mediante encabezados y retrasos. Anti-bot difícil (Cloudflare Turnstile, hCaptcha, solo residencial): posible con proxies pagos, pero aumenta el costo y baja la fiabilidad. Te lo digo desde el principio.
¿Dónde se ejecuta el scraper después de entregarlo?
Básico/Estándar: lo ejecutas en tu máquina o servidor (te doy instrucciones). Premium: lo despliego en GitHub Actions (gratis para público, generoso para privado), funciona en horario sin tu intervención. AWS Lambda, Render o tu propio VPS bajo solicitud.
¿Qué hay de los costos continuos?
GitHub Actions: gratis en la mayoría de los casos. Almacenamiento: archivo CSV (gratis). Proxies (solo si el sitio los requiere): desde 30 dólares al mes con proveedores como Bright Data o Smartproxy. No cobro nada después de la entrega a menos que quieras que mantenga o extienda el scraper.

