Parece que este servicio está en espera

Extraeré y limpiaré HTML offline en archivos de texto estructurados txt MD jsonl

Parte de la información se ha traducido automáticamente.

México

Hablo Español, Inglés

7 pedidos completados

Soy Alejandro, especialista en web scraping y extracción de datos. Recojo, limpio y entrego datos estructurados de sitios web en CSV, Excel o Google Sheets, listos para usar. Tecnologías: Python (Beau...
Acerca de este Servicio

Convertiré tu exportación de sitio web descargada/offline (HTTrack, SiteSucker, o similar) en archivos de texto limpios y legibles adecuados para análisis, migración de documentación, indexación de búsqueda o bases de conocimiento AI/RAG.

Lo que obtienes:

  • Salida limpia en TXT (UTF-8) (un archivo por página HTML)
  • Salida opcional en Markdown (MD)
  • Estructura de carpetas reflejada (organizada como tu exportación)
  • Eliminación de boilerplate (menús, navegación, encabezados/pies de página, barras laterales, bloques repetidos)
  • Detección del contenido principal (main/artículo o extracción heurística)
  • Registro de procesamiento + informe final (procesado/escrito/saltado/fallido)

Lo que necesito de ti:

  • Un archivo ZIP con la carpeta de tu sitio offline (archivos HTML)
  • Indícame tu formato de salida preferido: TXT / MD / JSONL
  • Cualquier sección que quieras excluir (páginas legales, login, carrito, etc.)

Notas importantes:

  • Este trabajo funciona con exportaciones HTML offline. No requiero acceso a hosting.
  • No hago scraping de sitios web en vivo en este trabajo (solo procesamiento offline).
  • Asegúrate de tener los derechos para procesar el contenido que proporcionas.

Si quieres un conjunto de datos listo para RAG, elige Premium (JSONL + metadatos + deduplicación).

Tecnología:

Python

Experiencia:

Adquisición de Datos

Extracción de Datos

Mi porfolio