数据质量

置信度评分:这个数字由什么构成

一个以 0 到 1 之间的单一数字呈现的置信度分数看起来简单得具有迷惑性,仿佛它是一次直接测量,而不是多个关于匹配可靠程度的独立信号的综合结果。大致了解这个数字由哪些因素构成,会让它比被当作一个不透明的概率、再用随手选定的任意阈值进行高低过滤要有用得多。

一个主要因素是原始查询与底层参考数据的匹配完整程度。如果一个地址的每个组成部分都完全匹配,门牌号、街道名称、所在地、邮政编码都与某条已知记录清晰吻合,其置信度就会高于那些部分组成缺失、拼写错误,或者需要通过模糊匹配推断才能找到最接近候选的地址。地理编码器需要猜测或补全的内容越多,这种不确定性就理应越多地体现为分数的下降。

第二个因素是匹配本身的歧义,具体来说就是同一输入是否存在不止一个合理的候选。在指定城市内唯一的街道名称,比在同一较大搜索区域内多个不同地区都存在的街道名称能产生更可信的匹配,因为后者迫使地理编码器在真实存在的多个选项中挑出最可能的一个,而不是解析到单一明确的结果。

第三个因素是该具体位置的底层数据质量和密度,这与其他文章中讨论过的城乡差距以及各国邮政数据质量差异等规律直接相关。与参考数据中稀疏、较少核实的区域匹配,其置信度理应低于与测绘密集、经常核实的城市区域的同等匹配,即使两者在技术上都找到并返回了结果。

鉴于以上所有因素,在您自己的应用中使用置信度分数最有效的方式是基于经验而非理论。用您自己真实查询中具有代表性的样本来测试,观察那些您能独立核实为正确或错误的结果,其置信度通常如何分布,然后根据这一分布设定自己的阈值,而不是采用一个抽象上听起来合理的假定界限。用于验证收货地址的阈值(错误结果会带来实际成本)理应比用于粗略区域分析的阈值(偶尔不精确的匹配几乎无关紧要)更严格。

正向逆地理编码都会同时返回置信度和精度,正是为了让您能够构建这种经过校准、针对具体用例的阈值,而不是把每个大于零的匹配都视为同样可信。