Качество данных

Оценка достоверности: из чего складывается число

Оценка достоверности в виде одного числа от 0 до 1 может выглядеть обманчиво простой, как будто это одно прямое измерение, а не совокупный результат нескольких отдельных сигналов о том, насколько надёжно совпадение. Если примерно понимать, что входит в это число, оно становится гораздо полезнее, чем непрозрачная вероятность, по которой фильтруют результаты выше или ниже произвольного порога, выбранного без особых размышлений.

Один из главных факторов: насколько полно исходный запрос совпал с эталонными данными. Адрес, у которого точно совпали все компоненты (номер дома, название улицы, населённый пункт, почтовый индекс), чисто совпадающие с одной известной записью, получает более высокую оценку, чем адрес, в котором часть компонентов отсутствовала, была написана с ошибкой или её пришлось выводить нечётким сопоставлением, чтобы найти ближайшего правдоподобного кандидата. Чем больше геокодеру пришлось угадывать или заполнять пробелы, тем сильнее эта неопределённость должна понижать оценку.

Второй фактор: неоднозначность самого совпадения, а именно существовало ли несколько правдоподобных кандидатов для одних и тех же входных данных. Название улицы, уникальное в пределах указанного города, даёт более уверенное совпадение, чем название улицы, которое встречается в нескольких разных районах одной и той же широкой области поиска, из-за чего геокодеру приходится выбирать наиболее вероятного кандидата среди реальных альтернатив, а не выдавать один однозначный результат.

Третий фактор: качество и плотность эталонных данных для конкретного места, что напрямую связано с такими закономерностями, как разрыв между сельской и городской местностью и различия в качестве почтовых данных от страны к стране, о которых говорится в других статьях. Совпадение в редкой, реже проверяемой части эталонных данных обоснованно получает более низкую оценку, чем аналогичное совпадение в плотно картографированном, часто проверяемом городском районе, даже если в обоих случаях результат технически найден и возвращён.

С учётом всего этого самый полезный способ работать с оценками достоверности в вашем приложении эмпирический, а не теоретический. Прогоните репрезентативную выборку своих реальных запросов, посмотрите, как распределяется оценка для результатов, которые вы можете независимо проверить как верные или неверные, и задайте собственный порог на основе этого распределения, а не предполагаемого значения, которое звучит разумно в абстракции. Порог для проверки адресов доставки, где неверный результат стоит реальных денег, обоснованно должен быть строже, чем порог для приблизительной региональной аналитики, где случайное неточное совпадение почти ничего не значит.

И прямое, и обратное геокодирование возвращают оценку достоверности вместе с точностью именно для того, чтобы вы могли выстроить такой откалиброванный порог под свой сценарий, а не считать каждое совпадение выше нуля одинаково надёжным.