igualaré, fusionaré y eliminaré duplicados en tus conjuntos de datos desordenados

Parte de la información se ha traducido automáticamente.

México

Hablo Español, Inglés, Francés

Candidato a PhD en Astrofísica, Consultoría Estadística

Candidato a PhD en astrofísica. Paso mis días haciendo estadísticas con datos desordenados, incompletos y correlacionados — catálogos de galaxias donde nada está limpio y cada barra de error debe ser ...
Acerca de este Servicio

Dos listas de las mismas personas, productos o lugares, sin ID compartido: nombres escritos de manera diferente, errores tipográficos, campos faltantes. La función VLOOKUP de Excel se rinde rápidamente.


Hago enlace probabilístico de registros: en lugar de "igual / no igual", cada par candidato recibe una puntuación de cuán probable es que sea la misma entidad, basada en cuánto acuerdo hay en cada campo y cuánto vale realmente ese acuerdo. Estar de acuerdo en un apellido poco común es una prueba fuerte; en uno común, es débil. El método distingue la diferencia.


Por qué esto te importa: tú eliges el umbral. Alta confianza para fusionar automáticamente, y una lista separada de pares ambiguos para que un humano los revise, en lugar de fusionar silenciosamente dos clientes diferentes o mantener el mismo dos veces.


Lo uso en catálogos astronómicos, donde fusionar dos objetos incorrectos invalida la ciencia. Tus datos merecen el mismo cuidado.


Lo que entrego: tu conjunto de datos fusionado con una puntuación de confianza en cada coincidencia; una lista separada de "necesita revisión" para casos ambiguos; un informe de calidad sobre cuántos coincidieron, cuántos no, y por qué; y duplicados encontrados dentro de cada archivo, no solo entre ellos.


Envía una pequeña muestra primero si quieres ver cómo funciona antes de ordenar.

Tecnología:

Python

Experiencia:

Manipulación de Datos

Validación de Datos

etl

Etiquetas relacionadas