Uma pontuação de confiança apresentada como um único número entre 0 e 1 pode parecer enganosamente simples, como se fosse uma medição direta, e não o resultado combinado de vários sinais distintos sobre o quanto uma correspondência é realmente segura. Entender, em linhas gerais, o que alimenta esse número o torna muito mais útil do que tratá-lo como uma probabilidade opaca a ser filtrada acima ou abaixo de um limite arbitrário escolhido sem muita reflexão.
Um dos principais fatores é o quão completamente a consulta original correspondeu aos dados de referência subjacentes. Um endereço em que todos os componentes corresponderam exatamente, número, nome da rua, localidade e código postal, todos alinhados de forma limpa com um único registro conhecido, gera uma confiança maior do que um em que alguns componentes estavam ausentes, com erros de digitação ou tiveram de ser inferidos por correspondência aproximada para encontrar o candidato plausível mais próximo. Quanto mais o geocodificador precisou adivinhar ou preencher lacunas, mais essa incerteza deve, com razão, se refletir em uma pontuação menor.
Um segundo fator é a ambiguidade da própria correspondência, especificamente se existia mais de um candidato plausível para a mesma entrada. Um nome de rua único dentro da cidade informada gera uma correspondência mais confiável do que um nome de rua que existe em várias áreas diferentes dentro da mesma região de busca mais ampla, o que obriga o geocodificador a escolher o candidato mais provável entre alternativas reais, em vez de chegar a um único resultado sem ambiguidade.
Um terceiro fator é a qualidade e a densidade dos dados subjacentes para aquela localização específica, o que se liga diretamente a padrões como a diferença entre áreas rurais e urbanas e a variação da qualidade dos dados postais de país para país, tratadas em outros artigos. Uma correspondência em uma área esparsa e verificada com menos frequência nos dados de referência carrega, com razão, uma confiança menor do que uma correspondência equivalente em uma área urbana densamente mapeada e verificada com frequência, mesmo quando as duas correspondências tecnicamente encontraram e retornaram um resultado.
Diante de tudo isso, a forma mais útil de trabalhar com pontuações de confiança na sua própria aplicação é empírica, e não teórica. Execute uma amostra representativa das suas próprias consultas reais, observe como a confiança costuma se distribuir entre resultados que você consegue verificar de forma independente como corretos ou incorretos e defina seu próprio limite com base nessa distribuição, em vez de um corte presumido que parece razoável em abstrato. Um limite adequado para validar endereços de entrega, em que um resultado errado tem um custo real, deve com razão ser mais rigoroso do que um adequado para análises regionais aproximadas, em que uma correspondência imprecisa ocasional quase não importa.
Tanto a geocodificação direta quanto a geocodificação reversa retornam a confiança junto com a precisão justamente para que você possa criar esse tipo de limite calibrado e específico para o seu caso de uso, em vez de tratar toda correspondência acima de zero como igualmente confiável.
Um endereço no centro de uma cidade bem mapeada quase não diz nada sobre como o seu sistema lida com uma estrada rural, uma fronteira disputada ou uma consulta perto dos polos. Teste os casos difíceis de propósito.
Nem todo conjunto de dados com informações de localização de aparência pública pode ser usado legalmente dentro de um produto pago. Os termos de licenciamento, e não a disponibilidade técnica, costumam definir o limite real.
Quando uma consulta realmente não pode ser resolvida de forma confiável, não retornar nada é uma resposta melhor do que retornar um palpite disfarçado de fato. Veja o raciocínio por trás dessa escolha.