数据质量

为什么威胁和网络数据比位置数据过时得更快

比较关于同一个 IP 地址的两个事实:它在地理上位于哪里,以及它当前是否属于某个已知的 VPN 或托管服务商。两者都有用,但它们的变化速度有着根本的不同,如果把它们视为同样持久,而变化更快的那一类又没有足够频繁地更新以跟上变化,这个错误就会表现为过时或误导性的结果。

与 IP 地址相关联的地理位置,在国家层面、往往也在地区层面,在相当长的时间内都相对稳定,因为它锚定于区域注册管理机构向运营商分配互联网地址段的方式,而这些分配虽然并非永久固定,但对于某个给定的地址段来说,通常不会每周都变动。住宅 ISP 的地址段一般会在较长时间内与大致相同的地理范围保持关联。

威胁和网络分类数据的表现则完全不同。新的 VPN 服务定期推出。现有的托管服务商会获得新的地址段,并改变旧地址段的用途。一个原本纯住宅的地址段,可能在相对较短的时间内,随着使用模式和所有权的变化,开始包含托管或代理基础设施。这类数据描述的是当前的使用情况和信誉,本质上比底层的地理分配更不稳定,因为使用情况可以在地址段的技术所有者或注册地没有任何相应变化的情况下发生改变。

实际的含义是,同时提供这两类数据的系统需要为每一类设置不同的更新频率,把它们当作真正独立的维护问题来处理,而不是作为一个按统一时间表更新的合并数据集。地理和行政数据可以合理地按较长周期更新,而不会损失太多准确性。网络和威胁分类数据则需要明显更频繁的更新才能保持有用,因为一个哪怕只过时了几周的威胁分类,对于当前活跃的地址段来说可能就已经明显错误了。

如果您的应用依赖威胁或网络分类信号来做诸如欺诈评分之类的决策,值得专门询问这一类数据的更新频率,与更广泛的地理数据集如何维护分开来问,因为两者确实不需要、也不应该得到同样的答案。正是由于这种区别,威胁和网络详情在我们的 IPv4IPv6 查询中作为核心地理字段之外的可选附加项提供,通过 mg_extras=1X-MG-Extras 请求头启用,因为它是一种真正不同的数据,与它旁边的位置字段有着不同的自然更新节奏。