जाँच के ऐसे सूत्र, जिन्हें पीछे तक खोजा जा सके
जाँचकर्ताओं के पास डेटा की कमी शायद ही होती है। मुश्किल यह है कि हज़ारों ऐसे रिकॉर्डों के भीतर पैटर्न ढूँढा जाए जो एक-एक करके देखने पर मामूली लगते हैं। SENTINEL एक डेस्कटॉप औज़ार है जो सार्वजनिक अपराध डेटा पढ़ता है, उस पर सांख्यिकी चलाता है और यह क्रम में रखता है कि किस पर क़रीब से नज़र डालने लायक़ है — और हर नतीजा ठीक उन्हीं रिकॉर्डों, मॉडल और सेटिंग तक पीछे खोजा जा सकता है जिनसे वह आया। अगर कोई विश्लेषक यह न दिखा सके कि कोई सूत्र जिस जगह है वहाँ क्यों है, तो वह सूत्र होना ही नहीं चाहिए।
यह विश्लेषण का सॉफ़्टवेयर है, जो सार्वजनिक अपराध डेटा से जगहों और रिश्तों को क्रम में लगाता है। यह विश्लेषक का ध्यान मोड़ने का औज़ार है, ऐसा सिस्टम नहीं जो किसी व्यक्ति के बारे में कुछ तय करता हो।
अंशांकन और निष्पक्षता वाले पृष्ठ इसलिए हैं कि जो मॉडल क्रम तो ठीक लगाता हो पर अंशांकन में ख़राब हो, वह किसी मॉडल के न होने से ज़्यादा ख़तरनाक है। चरण 3–5 की योजना साफ़ तौर पर निष्पक्षता-पहले है, और प्रकाशित बेंचमार्क कोई मार्केटिंग का दावा नहीं, बल्कि साफ़ लिखी हुई डिलीवरी हैं।
यह क्या है, एक मिनट में
एक सेंधमारी, गाड़ी से हुई एक चोरी, बीमे का एक दावा। अकेले-अकेले हर एक मामूली है, और इन्हें जोड़ने वाली बात तभी सामने आती है जब कोई सैकड़ों को क़तार में रखकर देखे। हाथ से यह धीमा काम है, और जो विश्लेषण अनुबंध इसे बड़े पैमाने पर करते हैं, उनकी क़ीमत ज़्यादातर पुलिस बलों की पहुँच से बाहर है।
SENTINEL रिकॉर्ड पढ़कर उन पर जमे-जमाए सांख्यिकीय मॉडल चलाता है: अपराध कहाँ घना है, कौन-सी घटनाएँ कई नहीं बल्कि एक ही शृंखला लगती हैं, कोई शृंखला किस इलाक़े से चलाई गई होगी। वह यह क्रम में रखता है कि किस पर क़रीब से नज़र डालने लायक़ है। हर चरण अपना किया हुआ लिख देता है, इसलिए हर सूत्र अपने साथ अपने स्रोत रिकॉर्ड, मॉडल और सेटिंग लेकर आता है।
छोटे और क्षेत्रीय पुलिस बल, जिनकी पहुँच बड़े विश्लेषण अनुबंधों तक नहीं — यह एक आम डेस्कटॉप कंप्यूटर पर चलता है और किसी विभाग के लिए नहीं, एक अकेले विश्लेषक के लिए बना है। धोखाधड़ी और बार-बार अपराध करने वालों की जाँच करने वाले, जहाँ पैटर्न उन घटनाओं में बिखरा होता है जिन्हें किसी ने साथ दर्ज ही नहीं किया। शोधकर्ता, जो किसी भी नतीजे को उन्हीं रिकॉर्डों तक पीछे खोज सकते हैं जिनसे वह निकला।
असली मॉडलों में से दो, WebAssembly में कंपाइल किए हुए
models/KDEHotspot और models/HawkesProcess — वही C++ जो कोई विश्लेषक डेस्कटॉप पर चलाता है, Qt for WebAssembly से कंपाइल किया हुआ, और उसमें वे बिंदु डाले गए हैं जो आप ख़ुद रखते हैं। घटनाएँ जोड़ने के लिए नक़्शे पर क्लिक कीजिए।
KDEHotspot + HawkesProcess — WebAssembly
लोड नहीं हुआ2.4 मेगाबाइट (MB), क्योंकि Qt6Core साथ आता है। किसी नक़ल के बजाय असली मॉडल चलाने की ईमानदार क़ीमत यही है, और जब तक आप न कहें, कुछ भी डाउनलोड नहीं होता।
इनजेस्ट → प्राकृतिक भाषा प्रसंस्करण (NLP) → फ़ीचर → मॉडल → इन्फ़रेंस
हर चरण अपना किया हुआ उत्पत्ति-श्रृंखला में लिख देता है, इसलिए आख़िर में मिलने वाला सूत्र अपने साथ यह रिकॉर्ड लाता है कि वह वहाँ तक पहुँचा कैसे।
UK पुलिस का अनुप्रयोग प्रोग्रामिंग इंटरफ़ेस (API) और ऐतिहासिक फ़ीड, अल्पविराम-पृथक मान (CSV) आयात, जिसमें UK / US-शहर / सामान्य लेआउट अपने आप पहचाने जाते हैं, Open-Meteo से मौसम, और क्वारंटीन सीमाओं के साथ डेटा-गुणवत्ता का अंकन।
शास्त्रीय, नियम-आधारित तरीक़े से modus operandi निकालना और अपराध का वर्गीकरण। लूप में कोई भाषा मॉडल नहीं — जान-बूझकर, क्योंकि आउटपुट ऐसा होना चाहिए जिसे समझाया जा सके।
पॉइसों गणनाएँ, हॉक्स की स्व-उत्तेजक प्रक्रियाएँ, शोर के साथ अनुप्रयोगों का घनत्व-आधारित स्थानिक क्लस्टरिंग (DBSCAN) से शृंखला की पहचान, KDE हॉटस्पॉट, गाउसी प्रक्रिया प्रतिगमन, बेयेसीय और समूह परतें।
रॉसमो भौगोलिक प्रोफ़ाइलिंग, MO विश्लेषण, सबूत का अंकन, विसंगति पहचान, साथ-अपराध का PageRank और समुदाय पहचान, और संकेत इंजन।
एक ही घटनाओं पर दो मॉडल
नक़्शे पर घटनाएँ रखिए। KDE पूछता है कि अपराध कहाँ घना है। रॉसमो का फ़ॉर्मूला कुछ और पूछता है, और वह ज़्यादा दिलचस्प है: यह मानते हुए कि अपराधी घर के आसपास एक बफ़र क्षेत्र से बचते हैं, अपराधी के रहने की सबसे ज़्यादा संभावना कहाँ है? दोनों जीते-जी चलते हैं, उन्हीं बिंदुओं पर जो आप रखते हैं।
sentinel — स्थानिक इन्फ़रेंस
घटना जोड़ने के लिए क्लिक कीजिए। हर बिंदु पर सतहें दोबारा गिनी जाती हैं।
सबसे ऊपर का सूत्र
उत्पत्ति-श्रृंखला
आज क्या चलता है
- इनजेस्ट से लेकर क्रम में लगे सूत्रों तक पूरी पाइपलाइन
- 495 स्वचालित परीक्षण
- UK और US डेटासेट पर असली डेटा से मान्यकरण
- Windows और Linux के लिए पैकेजिंग
- स्थानीय, सिर्फ़-पढ़ने वाला प्रातिनिधिक स्थिति अंतरण (REST) API
- नौ पृष्ठों का डैशबोर्ड: घटनाएँ, नक़्शा, अंशांकन, मामले, साथ-अपराध का ग्राफ़, सूत्र, ऑडिट लॉग, सेटिंग, डीबग
क्या नहीं चलता
- सिर्फ़ नियम-आधारित NLP। modus operandi निकालना शास्त्रीय तरीक़े से होता है, और उसकी रिकॉल की सीमाएँ भी साथ आती हैं।
- एक ही मशीन का डेस्कटॉप। कोई बहु-उपयोक्ता तैनाती नहीं, विश्लेषकों के बीच मामले की कोई साझा हालत नहीं।
- जीवित कनेक्टर थोड़े ही हैं। वास्तविक-समय के गिने-चुने डेटा स्रोत ही जुड़े हुए हैं।
- नक़्शा बुनियादी है। ख़ुद बनाया गया, कोई भौगोलिक सूचना प्रणाली (GIS) नहीं। वैकल्पिक GIS एकीकरण चरण 3–5 की चीज़ है।
चरण 3–5, योजना में
कई अधिकार-क्षेत्रों का समर्थन, वैकल्पिक GIS एकीकरण, प्रकाशित बेंचमार्क, निष्पक्षता-पहले तैनाती, और शायद एक प्रबंधित सेवा। बचा हुआ काम
REMAINING.md में है, न कि किसी रोडमैप प्रस्तुति में।
अपराध डेटा में पैटर्न ढूँढ़ता है, और अपना हिसाब भी दिखाता है
विश्लेषक घटनाओं के अभिलेखों में डूबे रहते हैं। यह उन सबके आर-पार पैटर्न ढूँढ़ता है और क्रम में लगाता है कि किस पर क़रीब से नज़र डालनी चाहिए, और हर सुझाव के पीछे के सबूत तक लौटने का रास्ता भी बनाए रखता है।
छोटी और क्षेत्रीय पुलिस इकाइयाँ
बड़े विश्लेषण ठेके ज़्यादातर बजटों की पहुँच से बाहर हैं। यह एक साधारण डेस्कटॉप कंप्यूटर पर चलता है और किसी विभाग के लिए नहीं, एक अकेले विश्लेषक के लिए बना है।
धोखाधड़ी और बार-बार अपराध करने वालों की जाँच करने वाले
बीमा धोखाधड़ी और संगठित खुदरा चोरी तब तक असंबंधित घटनाएँ लगती हैं, जब तक कोई उन्हें एक क़तार में न रख दे। यह वही क़तार लगाता है, और इशारा करता है कि अगली घटना कहाँ होने की संभावना है।
अपराध और पुलिसिंग पर शोध करने वाले
हर नतीजा ठीक उन्हीं अभिलेखों और सेटिंग्स तक खोजा जा सकता है जिनसे वह बना, इसलिए कोई दूसरा शोधकर्ता काम को भरोसे पर मानने के बजाय जाँच सकता है।
हर सूत्र अपनी रसीद साथ लाता है
मूल अभिलेख, मॉडल, पैरामीटर, और हर चरण पर हुआ रूपांतरण। ऑडिट लॉग देखने वाला पृष्ठ डैशबोर्ड के नौ पृष्ठों में से एक है, कोई फ़ीचर अनुरोध नहीं। जो सॉफ़्टवेयर तय करता है कि पुलिस का ध्यान कहाँ जाएगा, उसके लिए यह कम-से-कम की शर्त है — और इसी वजह से उसके पीछे का अनुसंधान प्रोटोटाइप, ARIA-INTEL, उसी इस्तेमाल के लिए तैयार नहीं बताया गया है।