Calidad de los datos

Puntuación de confianza: qué hay detrás del número

Una puntuación de confianza presentada como un único número entre 0 y 1 puede parecer engañosamente simple, como si fuera una medición directa y no el resultado combinado de varias señales distintas sobre la seguridad real de una coincidencia. Entender a grandes rasgos qué alimenta ese número lo hace mucho más útil que tratarlo como una probabilidad opaca que se filtra por encima o por debajo de un umbral arbitrario elegido sin pensarlo mucho.

Un factor importante es hasta qué punto la consulta original coincidió con los datos de referencia subyacentes. Una dirección en la que todos los componentes coincidieron exactamente (número, nombre de la calle, localidad, código postal), todos alineados limpiamente con un único registro conocido, produce una confianza mayor que otra en la que faltaban componentes, estaban mal escritos o hubo que inferirlos mediante coincidencia aproximada para encontrar el candidato plausible más cercano. Cuanto más tuvo que adivinar o rellenar huecos el geocodificador, más razonable es que esa incertidumbre se refleje a la baja en la puntuación.

Un segundo factor es la ambigüedad de la propia coincidencia, en concreto si existía más de un candidato plausible para la misma entrada. Un nombre de calle único dentro de la ciudad indicada produce una coincidencia más fiable que un nombre de calle que existe en varias zonas distintas dentro de la misma región de búsqueda más amplia, lo que obliga al geocodificador a elegir el candidato más probable entre alternativas reales en lugar de llegar a un único resultado inequívoco.

Un tercer factor es la calidad y la densidad de los datos subyacentes para esa ubicación concreta, lo que enlaza directamente con patrones como la brecha entre zonas rurales y urbanas y la variación de la calidad de los datos postales de un país a otro, tratados en otros artículos. Una coincidencia en una zona escasa y verificada con menos frecuencia de los datos de referencia tiene razonablemente menos confianza que una coincidencia equivalente en una zona urbana densamente cartografiada y verificada con frecuencia, aunque técnicamente ambas coincidencias hayan encontrado y devuelto un resultado.

Con todo esto, la forma más útil de trabajar con las puntuaciones de confianza en tu propia aplicación es empírica y no teórica. Ejecuta una muestra representativa de tus propias consultas reales, observa cómo se distribuye la confianza en los resultados que puedes verificar de forma independiente como correctos o incorrectos, y fija tu propio umbral a partir de esa distribución en lugar de un límite supuesto que suena razonable en abstracto. Un umbral adecuado para validar direcciones de envío, donde un resultado erróneo tiene un costo real, debería ser razonablemente más estricto que uno adecuado para una analítica regional aproximada, donde una coincidencia imprecisa ocasional apenas importa.

Tanto la geocodificación directa como la inversa devuelven la confianza junto con la precisión precisamente para que puedas construir este tipo de umbral calibrado y específico para cada caso de uso, en lugar de tratar cualquier coincidencia por encima de cero como igual de fiable.