डेटा की गुणवत्ता

कॉन्फ़िडेंस स्कोरिंग: इस संख्या में क्या-क्या शामिल होता है

0 और 1 के बीच की एक अकेली संख्या के रूप में दिखाया गया कॉन्फ़िडेंस स्कोर भ्रामक रूप से सरल लग सकता है, मानो यह कोई एक सीधा माप हो, न कि इस बारे में कई अलग-अलग संकेतों का संयुक्त नतीजा कि कोई मिलान असल में कितना पक्का है। मोटे तौर पर यह समझ लेना कि इस संख्या में क्या-क्या जाता है, इसे बिना ज़्यादा सोचे चुने गए किसी मनमाने थ्रेशोल्ड के ऊपर या नीचे फ़िल्टर की जाने वाली एक अपारदर्शी संभावना मानने से कहीं ज़्यादा उपयोगी बना देता है।

एक बड़ा इनपुट यह है कि मूल क्वेरी संदर्भ डेटा से कितनी पूरी तरह मेल खाई। ऐसा पता जिसका हर घटक, यानी मकान नंबर, सड़क का नाम, इलाका, पिन कोड, एक अकेले ज्ञात रिकॉर्ड से साफ़ तौर पर बिल्कुल मेल खाता हो, उस पते से ज़्यादा कॉन्फ़िडेंस देता है जिसके कुछ घटक गायब थे, गलत लिखे थे, या सबसे नज़दीकी संभावित उम्मीदवार खोजने के लिए फ़ज़ी मैचिंग से अनुमानित करने पड़े। जियोकोडर को जितना ज़्यादा अंदाज़ा लगाना या खाली जगहें भरनी पड़ीं, उतनी ही यह अनिश्चितता उचित रूप से स्कोर में नीचे की ओर दिखनी चाहिए।

दूसरा इनपुट खुद मिलान में अस्पष्टता है, खास तौर पर यह कि क्या एक ही इनपुट के लिए एक से ज़्यादा संभावित उम्मीदवार मौजूद थे। बताए गए शहर में अनोखा सड़क का नाम उस सड़क के नाम से ज़्यादा भरोसेमंद मिलान देता है जो उसी बड़े खोज क्षेत्र के कई अलग-अलग इलाकों में मौजूद है, जिससे जियोकोडर को किसी एक स्पष्ट नतीजे तक पहुँचने के बजाय असली विकल्पों में से सबसे संभावित उम्मीदवार चुनना पड़ता है।

तीसरा इनपुट उस खास लोकेशन के लिए मूल डेटा की गुणवत्ता और घनत्व है, जो सीधे उन पैटर्नों से जुड़ता है जिनकी चर्चा कहीं और की गई है, जैसे ग्रामीण और शहरी अंतर और डाक डेटा की गुणवत्ता में देश-दर-देश अंतर। संदर्भ डेटा के किसी विरल, कम बार सत्यापित क्षेत्र से हुआ मिलान उचित रूप से किसी घने मैप किए गए, बार-बार सत्यापित शहरी क्षेत्र के समान मिलान से कम कॉन्फ़िडेंस रखता है, भले ही तकनीकी रूप से दोनों मिलानों ने कोई नतीजा खोजा और लौटाया हो।

इन सबको देखते हुए, अपने एप्लिकेशन में कॉन्फ़िडेंस स्कोर के साथ काम करने का सबसे उपयोगी तरीका सैद्धांतिक नहीं, बल्कि अनुभवजन्य है। अपनी असली क्वेरी का एक प्रतिनिधि नमूना चलाएँ, देखें कि जिन नतीजों को आप स्वतंत्र रूप से सही या गलत के रूप में सत्यापित कर सकते हैं उनके लिए कॉन्फ़िडेंस आम तौर पर कैसे बँटता है, और अपना थ्रेशोल्ड उसी वितरण के आधार पर तय करें, न कि किसी ऐसी मानी हुई सीमा पर जो सिद्धांत में उचित लगती हो। शिपिंग पतों को सत्यापित करने के लिए उपयुक्त थ्रेशोल्ड, जहाँ गलत नतीजे की असली कीमत होती है, उचित रूप से मोटे क्षेत्रीय एनालिटिक्स के थ्रेशोल्ड से ज़्यादा सख़्त होना चाहिए, जहाँ कभी-कभार का अस्पष्ट मिलान मुश्किल से ही मायने रखता है।

फ़ॉरवर्ड और रिवर्स जियोकोडिंग दोनों सटीकता के साथ कॉन्फ़िडेंस भी इसीलिए लौटाते हैं ताकि आप शून्य से ऊपर के हर मिलान को बराबर भरोसेमंद मानने के बजाय इस तरह का कैलिब्रेट किया हुआ, उपयोग के अनुसार थ्रेशोल्ड बना सकें।