Un score de confiance présenté sous la forme d'un seul nombre compris entre 0 et 1 peut sembler faussement simple, comme s'il s'agissait d'une mesure directe plutôt que du résultat combiné de plusieurs signaux distincts indiquant à quel point une correspondance est sûre. Comprendre à peu près ce qui alimente ce nombre le rend bien plus utile que de le traiter comme une probabilité opaque à filtrer au-dessus ou au-dessous d'un seuil arbitraire choisi sans grande réflexion.
Un premier facteur important est le degré de correspondance entre la requête d'origine et les données de référence sous-jacentes. Une adresse dont chaque composant correspond exactement, numéro, nom de rue, localité, code postal, le tout s'alignant proprement sur un seul enregistrement connu, produit une confiance plus élevée qu'une adresse dont certains composants manquaient, étaient mal orthographiés ou ont dû être déduits par correspondance approximative pour trouver le candidat plausible le plus proche. Plus le géocodeur a dû deviner ou combler de lacunes, plus cette incertitude devrait logiquement faire baisser le score.
Un deuxième facteur est l'ambiguïté de la correspondance elle-même, c'est-à-dire l'existence de plusieurs candidats plausibles pour une même saisie. Un nom de rue unique dans la ville indiquée produit une correspondance plus sûre qu'un nom de rue présent dans plusieurs secteurs de la même zone de recherche plus large, ce qui oblige le géocodeur à choisir le candidat le plus probable parmi de véritables alternatives au lieu d'aboutir à un résultat unique et sans ambiguïté.
Un troisième facteur est la qualité et la densité des données sous-jacentes pour ce lieu précis, ce qui renvoie directement à des phénomènes comme l'écart entre zones rurales et urbaines et les variations de qualité des données postales d'un pays à l'autre, abordés ailleurs. Une correspondance dans une zone peu dense et moins souvent vérifiée des données de référence présente logiquement une confiance plus faible qu'une correspondance équivalente dans une zone urbaine densément cartographiée et fréquemment vérifiée, même si les deux ont techniquement trouvé et renvoyé un résultat.
Dans ces conditions, la façon la plus utile d'exploiter les scores de confiance dans votre propre application est empirique plutôt que théorique. Exécutez un échantillon représentatif de vos propres requêtes réelles, observez comment la confiance se répartit entre les résultats que vous pouvez vérifier de façon indépendante comme corrects ou incorrects, et fixez votre seuil à partir de cette répartition plutôt que selon une limite supposée qui paraît raisonnable dans l'abstrait. Un seuil adapté à la validation d'adresses de livraison, où un mauvais résultat a un coût réel, devrait logiquement être plus strict qu'un seuil adapté à des statistiques régionales approximatives, où une correspondance imprécise de temps en temps compte à peine.
Le géocodage direct comme le géocodage inverse renvoient la confiance en plus de la précision, justement pour que vous puissiez établir ce type de seuil calibré et propre à votre cas d'usage, plutôt que de considérer toute correspondance supérieure à zéro comme également fiable.
Une adresse dans un centre-ville bien cartographié ne vous apprend presque rien sur la façon dont votre système gère une route rurale, une frontière contestée ou une requête près des pôles. Testez délibérément les cas difficiles.
Tous les jeux de données contenant des informations de localisation apparemment publiques ne peuvent pas légalement être utilisés dans un produit payant. Ce sont souvent les conditions de licence, et non la disponibilité technique, qui fixent la véritable limite.
Lorsqu'une requête ne peut réellement pas être résolue de manière fiable, ne rien renvoyer est une meilleure réponse que renvoyer une supposition présentée comme un fait. Voici le raisonnement derrière ce choix.