住所データにおける名称の翻字と発音区別符号
同じ通りの名前でも、複数の異なる文字体系や綴りで正しく書くことができます。こうした表記の違いをまたいで住所を照合することは、データ品質上の本当の課題です。
国別のカバレッジ、精度の測定、そして各回答の精度と信頼度の読み方。
同じ通りの名前でも、複数の異なる文字体系や綴りで正しく書くことができます。こうした表記の違いをまたいで住所を照合することは、データ品質上の本当の課題です。
座標の小数点以下の桁を削るのは無害に見えますが、1桁ごとに地上の実際の距離を表しており、丸めすぎると地点がメートル単位、あるいはキロメートル単位で動いてしまうことがあります。
1つの住所文字列には複数の異なる意味の要素が隠れていることがあり、同じ略語でも国によって意味が異なることがあります。正しく解析するのは見た目よりも難しいのです。
あらゆる座標は、地球の形状を表す何らかのモデルを基準に定義されています。WGS84がGPSとWeb地図のデフォルトになったのには、理解しておく価値のある実用的な理由があります。
一部の座標は、複数の政府が主権を主張する場所にあります。位置データは、政治的にどちらかの側に立つことなく、現地の実情を記述しなければなりません。
国コードと地域区分コードは、例外に出くわすまでは単純に見えます。ここでは、ISO 3166-1と3166-2が実際に何を対象としているのか、そしてどこで混乱が生じるのかを解説します。
すべての国が通りの名前と番地を軸に住所を構成しているわけではありません。まったく異なる方式を使う国もいくつかあり、ジオコーディングはそれに対応しなければなりません。
英国のポストコードは、1本の通りや、ほんの数棟の建物まで特定できることがあります。米国のZIPコードははるかに広いエリアをカバーします。郵便番号の細かさは国によって大きく異なります。
標高データの精度はどこでも同じではありません。平坦で開けた地形は正確に測定しやすい一方、急峻な地形や植生が密な土地はそうではありません。
標高値は、問い合わせたちょうどその地点で測定されたものではなく、所定の解像度を持つサンプルグリッドから得られます。その解像度によって、数値の意味が変わります。
データ品質の記事だけを、公開され次第お届けします。
データ品質を購読する