データ品質

住所データにおける名称の翻字と発音区別符号

アクセント記号付きの文字、ウムラウト、あるいはラテン文字以外の文字体系の文字を含む通りの名前は、正当にいくつもの異なる書き方で表記されることがあり、文脈によってはそのすべてが正しい場合があります。ウムラウトを含むドイツの通りの名前は、ウムラウトをそのまま使って書かれることもあれば、ウムラウトの文字が使えない場合の標準的な代替として、その文字の後に「e」を加えて書かれることもあります。もともとラテン文字以外で書かれた名前は、ラテン文字に翻字する方法として認められたものが複数あることがあります。翻字は1つの決定的な関数ではなく慣習の集まりであり、システムごとに異なる妥当な選択をするからです。

これはジオコーディングにとって現実的な照合の問題を生みます。ユーザーがある正しい綴りで住所を入力し、基盤となるデータが別の同じく正しい綴りでインデックスされていた場合、両方の表記が明らかに同じ実在の通りを指していても、単純な完全一致の検索は失敗します。従来の意味でのデータの誤りではなく、どちらの綴りも正しいのですが、ユーザーから見える症状は誤りと同じです。明らかに結果を返すべき検索が何も返さないのです。

優れた住所照合では、基盤となるデータがたまたま名前をどう保存していたかに対して1文字ずつの完全一致を求めるのではなく、比較の前に入力を正規化することでこれに対処します。ダイアクリティカルマークを取り除くか標準化し、既知の代替表記の慣習を考慮し、その地域でよく使われる別の翻字を許容します。これは本質的にあいまい一致の問題であり、一致に対して返されるconfidenceスコアに直接影響します。ダイアクリティカルマークや翻字の違いを経由して解決された住所は、文字列そのものの完全一致で照合された住所とは、当然わずかに異なる信頼度になるからです。

テスト用の住所セットが単一の文字体系の国内住所に大きく偏っている場合、それがユーザーが実際に入力するあらゆる入力を代表していると想定するのではなく、ダイアクリティカルマークを含む名前や翻字が一般的な場所に対して、自社の住所入力の処理を特にテストする価値があります。正しく綴られた海外の住所を黙って崩したり拒否したりするフォームは、目立たないものの利用可能なトラフィックの現実的な損失であり、意図的に多様なテストセットを使えば早期に発見しやすいデータ品質の問題の1つです。

海外の住所向けのオートコンプリートや入力欄を作る場合は、既存の国内向けテストケースでこの種の入力をカバーできていると想定せず、住所オートコンプリートのエンドポイントを使って、さまざまな文字体系やダイアクリティカルマークの異なる表記で直接テストしてください。