Limpiaré datos, eliminaré duplicados y normalizaré con python
Desarrollador Full Stack y especialista en automatización con 88 reseñas de cinco estrellas
Nivel 2
Ha cumplido con los criterios de alto rendimiento y tiene un historial comprobado de cumplimiento de las expectativas de los clientes.
Acerca de este Servicio
¿Conjunto de datos desordenado que te ralentiza? Realizo limpieza profesional de datos en CSV, Excel, JSON y volcados de SQL. Eliminación de duplicados, normalización de campos, análisis de fechas, manejo de valores faltantes.
Lo que limpio:
+ Volcados de CSV, Excel, JSON, SQL, TSV, Parquet
+ Catálogos de productos y listas de precios scrapeados
+ Listas de clientes y mailing
+ Exportaciones de encuestas y envíos de formularios
+ Archivos de transacciones o inventarios desordenados
Operaciones que realizo:
+ Eliminación de duplicados con reglas personalizadas
+ Normalización de cadenas (mayúsculas, espacios, codificación)
+ Análisis de fechas, teléfonos y direcciones
+ Manejo de valores faltantes (imputar, eliminar, marcar)
+ Detección de valores atípicos y mapeo de campos
Herramientas que uso:
+ Pandas, numpy, SQL, regex, Python
Lo que recibes:
+ Conjunto de datos estructurado y limpio en el formato que elijas
+ Script de limpieza en Python que puedes volver a ejecutar
+ Documentación de cada regla aplicada
He recibido 89 reseñas de cinco estrellas en mi perfil y más de 30 proyectos de scraping que generaron datos desordenados que luego limpié de principio a fin. Sé exactamente lo descompuestos que pueden estar los archivos reales.
Importante: Envíame un mensaje ANTES de ordenar con un archivo de muestra y tus reglas de limpieza. Confirmaré el alcance y el plazo.
Mi porfolio
FAQ
Traducción automática
¿Qué formatos de archivo admite?
CSV, Excel (xlsx y xls), JSON, TSV, dumps de SQL, Parquet y texto simple. Si tu formato es inusual, envía una muestra y lo confirmaré antes de que hagas el pedido.
¿Cuántas filas puedes limpiar?
Básico cubre hasta 5,000 filas, Estándar hasta 50,000, Premium es ilimitado. Para conjuntos de datos muy grandes, construyo una pipeline y proceso en partes.
¿Cómo decides qué cuenta como duplicado?
Me dices los campos clave. Si no estás seguro, propongo un conjunto de reglas basado en los datos y tú apruebas antes de que lo ejecute.
¿Cómo manejas los valores faltantes?
Tres opciones: imputar desde otras filas o fuentes externas, eliminar la fila o marcar para revisión. Confirmo por columna antes de ejecutar.
¿Recibo el script en Python o solo los datos limpios?
Ambos desde Estándar en adelante. El script es reutilizable en archivos futuros y viene con una lista de reglas documentada.
¿Mis datos son confidenciales?
Sí. Trabajo en un espacio privado, elimino tus archivos después de la entrega si lo solicitas y firmo un NDA si es necesario.
¿Puedes manejar fechas y direcciones en formatos mezclados?
Sí. Las fechas se analizan en ISO 8601, los teléfonos en E.164, las direcciones se estandarizan. Casos extremos se marcan para tu revisión.

