Géocodez une adresse dans un centre-ville dense et une adresse sur une route rurale du même pays, et il est courant de constater une réelle différence de précision et de confiance entre les deux, alors que rien n'a changé dans la technologie de géocodage sous-jacente d'une requête à l'autre. L'écart vient des données elles-mêmes, et non de la méthode utilisée pour les interroger, et il reflète une tendance réelle et bien comprise que l'on retrouve dans les données d'adresses presque partout dans le monde.
Les zones urbaines disposent généralement de données d'adresses détaillées et fréquemment mises à jour pour une raison simple : une population dense implique davantage de transactions, de livraisons, de services publics et d'activité commerciale liés à des adresses précises, ce qui crée une pression et une occasion permanentes de maintenir ces données exactes et à jour. Les nouveaux bâtiments sont ajoutés aux registres assez rapidement, la numérotation des maisons tend à être systématique et complète, et davantage de sources indépendantes recoupent les mêmes informations.
Les zones rurales n'ont souvent pas la même densité d'activité, ni donc la même pression pour tenir des registres détaillés. L'adressage peut y être plus clairsemé, parfois fondé sur des routes nommées plutôt que sur une numérotation séquentielle, la prise en compte des nouvelles constructions peut accuser un retard sur l'urbanisation réelle, et il y a tout simplement moins de transactions indépendantes générant des données fraîches à recouper. Rien de tout cela ne signifie que les données rurales ne sont pas fiables, mais elles ont tendance à être plus grossières en moyenne, se résolvant de manière fiable à une localité ou à une zone générale plus souvent qu'à un bâtiment précis.
Cette tendance apparaît directement et honnêtement dans les champs precision et confidence, et c'est exactement leur raison d'être. Une adresse urbaine a plus de chances d'être résolue avec une précision house et une confiance élevée. Une adresse rurale, pour le même type de requête, a plus de chances d'être résolue au niveau street ou à un niveau plus grossier, avec une confiance qui reflète l'incertitude réelle liée à la correspondance avec un registre d'adresses plus clairsemé, et non un quelconque défaut de la logique de géocodage elle-même.
La leçon pratique pour quiconque construit sur ce type de données est de prévoir cette variation et de concevoir en conséquence, plutôt que de supposer une précision uniforme partout. Si votre application sert à la fois des utilisateurs urbains et ruraux, fixez vos seuils de précision et de confiance en gardant cet écart à l'esprit, et envisagez une solution de repli, par exemple demander à un utilisateur rural de confirmer ou d'ajuster un repère sur une carte, plutôt que d'exiger partout une précision au niveau du numéro de rue alors que les données sous-jacentes de la région ne le permettent peut-être pas de façon fiable. Tester vos propres parcours de saisie d'adresse sur un échantillon réellement rural, et pas seulement sur des adresses de test en centre-ville, est l'un des moyens les plus fiables de repérer cet écart avant vos utilisateurs.
Une adresse dans un centre-ville bien cartographié ne vous apprend presque rien sur la façon dont votre système gère une route rurale, une frontière contestée ou une requête près des pôles. Testez délibérément les cas difficiles.
Tous les jeux de données contenant des informations de localisation apparemment publiques ne peuvent pas légalement être utilisés dans un produit payant. Ce sont souvent les conditions de licence, et non la disponibilité technique, qui fixent la véritable limite.
Lorsqu'une requête ne peut réellement pas être résolue de manière fiable, ne rien renvoyer est une meilleure réponse que renvoyer une supposition présentée comme un fait. Voici le raisonnement derrière ce choix.