Datenqualität

Konfidenzbewertung: Was in die Zahl einfließt

Ein Konfidenzwert, der als einzelne Zahl zwischen 0 und 1 dargestellt wird, kann täuschend einfach wirken, als wäre er eine direkte Messung und nicht das kombinierte Ergebnis mehrerer unterschiedlicher Signale dazu, wie sicher ein Treffer tatsächlich ist. Wenn Sie ungefähr verstehen, was in diese Zahl einfließt, ist sie weitaus nützlicher, als wenn Sie sie als undurchsichtige Wahrscheinlichkeit behandeln, die ober- oder unterhalb eines willkürlichen, ohne viel Überlegung gewählten Schwellenwerts gefiltert wird.

Ein wichtiger Faktor ist, wie vollständig die ursprüngliche Abfrage mit den zugrunde liegenden Referenzdaten übereinstimmte. Eine Adresse, bei der jeder Bestandteil exakt übereinstimmte, also Hausnummer, Straßenname, Ort und Postleitzahl sauber zu einem einzigen bekannten Datensatz passten, ergibt eine höhere Konfidenz als eine, bei der einige Bestandteile fehlten, falsch geschrieben waren oder per unscharfer Suche erschlossen werden mussten, um den nächstliegenden plausiblen Kandidaten zu finden. Je mehr der Geocoder raten oder Lücken füllen musste, desto mehr sollte sich diese Unsicherheit sinnvollerweise in einem niedrigeren Wert widerspiegeln.

Ein zweiter Faktor ist die Mehrdeutigkeit des Treffers selbst, genauer gesagt, ob es für dieselbe Eingabe mehr als einen plausiblen Kandidaten gab. Ein Straßenname, der innerhalb der angegebenen Stadt eindeutig ist, ergibt einen sichereren Treffer als ein Straßenname, der in mehreren Gebieten innerhalb derselben größeren Suchregion vorkommt, sodass der Geocoder unter echten Alternativen den wahrscheinlichsten Kandidaten wählen muss, statt zu einem einzigen eindeutigen Ergebnis zu gelangen.

Ein dritter Faktor ist die Qualität und Dichte der zugrunde liegenden Daten für genau diesen Ort, was direkt mit Mustern wie dem Gefälle zwischen Land und Stadt und den an anderer Stelle behandelten Unterschieden in der Qualität der Postdaten von Land zu Land zusammenhängt. Ein Treffer in einem dünn erfassten, seltener überprüften Bereich der Referenzdaten hat berechtigterweise eine geringere Konfidenz als ein gleichwertiger Treffer in einem dicht kartierten, häufig überprüften städtischen Gebiet, selbst wenn beide Treffer technisch ein Ergebnis gefunden und zurückgegeben haben.

Vor diesem Hintergrund arbeiten Sie mit Konfidenzwerten in Ihrer eigenen Anwendung am besten empirisch statt theoretisch. Führen Sie eine repräsentative Stichprobe Ihrer eigenen echten Abfragen aus, sehen Sie sich an, wie sich die Konfidenz bei Ergebnissen verteilt, die Sie unabhängig als richtig oder falsch überprüfen können, und legen Sie Ihren eigenen Schwellenwert anhand dieser Verteilung fest, statt eines angenommenen Grenzwerts, der abstrakt vernünftig klingt. Ein Schwellenwert für die Validierung von Lieferadressen, bei denen ein falsches Ergebnis echte Kosten verursacht, sollte sinnvollerweise strenger sein als einer für grobe regionale Analysen, bei denen ein gelegentlich ungenauer Treffer kaum ins Gewicht fällt.

Sowohl die Geokodierung als auch die Reverse-Geokodierung liefern die Konfidenz zusammen mit der Genauigkeit, damit Sie genau diese Art von kalibriertem, auf den Anwendungsfall zugeschnittenem Schwellenwert aufbauen können, statt jeden Treffer über null als gleich vertrauenswürdig zu behandeln.