SENTINEL · चरण 1–2 पूरे

जाँच के ऐसे सूत्र, जिन्हें पीछे तक खोजा जा सके

जाँचकर्ताओं के पास डेटा की कमी शायद ही होती है। मुश्किल यह है कि हज़ारों ऐसे रिकॉर्डों के भीतर पैटर्न ढूँढा जाए जो एक-एक करके देखने पर मामूली लगते हैं। SENTINEL एक डेस्कटॉप औज़ार है जो सार्वजनिक अपराध डेटा पढ़ता है, उस पर सांख्यिकी चलाता है और यह क्रम में रखता है कि किस पर क़रीब से नज़र डालने लायक़ है — और हर नतीजा ठीक उन्हीं रिकॉर्डों, मॉडल और सेटिंग तक पीछे खोजा जा सकता है जिनसे वह आया। अगर कोई विश्लेषक यह न दिखा सके कि कोई सूत्र जिस जगह है वहाँ क्यों है, तो वह सूत्र होना ही नहीं चाहिए।

भाषाC++23
यूज़र इंटरफ़ेस (UI)Qt 6, 9-पृष्ठ डैशबोर्ड
परीक्षण495 स्वचालित
भंडारणSQLite
आख़िरी पुशहाल ही में
पहले ही साफ़ कर दिया जाए

यह विश्लेषण का सॉफ़्टवेयर है, जो सार्वजनिक अपराध डेटा से जगहों और रिश्तों को क्रम में लगाता है। यह विश्लेषक का ध्यान मोड़ने का औज़ार है, ऐसा सिस्टम नहीं जो किसी व्यक्ति के बारे में कुछ तय करता हो।

अंशांकन और निष्पक्षता वाले पृष्ठ इसलिए हैं कि जो मॉडल क्रम तो ठीक लगाता हो पर अंशांकन में ख़राब हो, वह किसी मॉडल के न होने से ज़्यादा ख़तरनाक है। चरण 3–5 की योजना साफ़ तौर पर निष्पक्षता-पहले है, और प्रकाशित बेंचमार्क कोई मार्केटिंग का दावा नहीं, बल्कि साफ़ लिखी हुई डिलीवरी हैं।

सीधी-सादी भाषा में

यह क्या है, एक मिनट में

समस्या

एक सेंधमारी, गाड़ी से हुई एक चोरी, बीमे का एक दावा। अकेले-अकेले हर एक मामूली है, और इन्हें जोड़ने वाली बात तभी सामने आती है जब कोई सैकड़ों को क़तार में रखकर देखे। हाथ से यह धीमा काम है, और जो विश्लेषण अनुबंध इसे बड़े पैमाने पर करते हैं, उनकी क़ीमत ज़्यादातर पुलिस बलों की पहुँच से बाहर है।

समाधान

SENTINEL रिकॉर्ड पढ़कर उन पर जमे-जमाए सांख्यिकीय मॉडल चलाता है: अपराध कहाँ घना है, कौन-सी घटनाएँ कई नहीं बल्कि एक ही शृंखला लगती हैं, कोई शृंखला किस इलाक़े से चलाई गई होगी। वह यह क्रम में रखता है कि किस पर क़रीब से नज़र डालने लायक़ है। हर चरण अपना किया हुआ लिख देता है, इसलिए हर सूत्र अपने साथ अपने स्रोत रिकॉर्ड, मॉडल और सेटिंग लेकर आता है।

यह किसके लिए है

छोटे और क्षेत्रीय पुलिस बल, जिनकी पहुँच बड़े विश्लेषण अनुबंधों तक नहीं — यह एक आम डेस्कटॉप कंप्यूटर पर चलता है और किसी विभाग के लिए नहीं, एक अकेले विश्लेषक के लिए बना है। धोखाधड़ी और बार-बार अपराध करने वालों की जाँच करने वाले, जहाँ पैटर्न उन घटनाओं में बिखरा होता है जिन्हें किसी ने साथ दर्ज ही नहीं किया। शोधकर्ता, जो किसी भी नतीजे को उन्हीं रिकॉर्डों तक पीछे खोज सकते हैं जिनसे वह निकला।

यह विश्लेषक को उस चीज़ की ओर इशारा करता है जिसे जाँचना चाहिए। यह किसी व्यक्ति के बारे में कुछ तय नहीं करता। इस पृष्ठ का बाक़ी हिस्सा इंजीनियरिंग है: आपके ब्राउज़र में चलते असली मॉडलों में से दो, उन्हें खिलाने वाली पाइपलाइन, आज क्या काम करता है, और क्या नहीं।
मॉडल ख़ुद

असली मॉडलों में से दो, WebAssembly में कंपाइल किए हुए

models/KDEHotspot और models/HawkesProcess — वही C++ जो कोई विश्लेषक डेस्कटॉप पर चलाता है, Qt for WebAssembly से कंपाइल किया हुआ, और उसमें वे बिंदु डाले गए हैं जो आप ख़ुद रखते हैं। घटनाएँ जोड़ने के लिए नक़्शे पर क्लिक कीजिए।

KDEHotspot + HawkesProcess — WebAssembly

लोड नहीं हुआ

2.4 मेगाबाइट (MB), क्योंकि Qt6Core साथ आता है। किसी नक़ल के बजाय असली मॉडल चलाने की ईमानदार क़ीमत यही है, और जब तक आप न कहें, कुछ भी डाउनलोड नहीं होता।

घटनाएँ
0
शाखन अनुपात
—
शाखन अनुपात वही है जो Hawkes मॉडल ने सीखा: हर घटना अपने बाद कितनी घटनाएँ छेड़ती है, उसकी अपेक्षित संख्या। शून्य के पास होने का मतलब है कि इन बिंदुओं में कोई स्व-उत्तेजना नहीं — उन्हें बराबर फैला दीजिए और इसे यही कहना चाहिए।
सिर्फ़ मॉडल। इनजेस्ट, डेटाबेस, उत्पत्ति और डैशबोर्ड मिलकर एप्लिकेशन बनाते हैं, और एप्लिकेशन यहाँ नहीं है — SENTINEL के अपने बिल्ड को Qt6::Test चाहिए, जिसे Qt6::Concurrent चाहिए, जो सिंगल-थ्रेडेड WebAssembly Qt में होता ही नहीं।
पाइपलाइन

इनजेस्ट → प्राकृतिक भाषा प्रसंस्करण (NLP) → फ़ीचर → मॉडल → इन्फ़रेंस

हर चरण अपना किया हुआ उत्पत्ति-श्रृंखला में लिख देता है, इसलिए आख़िर में मिलने वाला सूत्र अपने साथ यह रिकॉर्ड लाता है कि वह वहाँ तक पहुँचा कैसे।

SENTINEL की पाइपलाइन: इनजेस्ट से होकर नियम-आधारित NLP, सांख्यिकीय मॉडल और इन्फ़रेंस तक, और वहाँ से क्रम में लगे सूत्रों तक, जिसमें हर चरण से जुड़ी एक उत्पत्ति-पटरी है
पूरा आरेख देखने के लिए स्क्रॉल करें →
नीचे की पटरी ही उत्पाद है। हर चरण अपना किया हुआ उत्पत्ति-श्रृंखला में लिख देता है, इसलिए सूत्र इस रिकॉर्ड के साथ आता है कि वह वहाँ तक पहुँचा कैसे।
इनजेस्ट

UK पुलिस का अनुप्रयोग प्रोग्रामिंग इंटरफ़ेस (API) और ऐतिहासिक फ़ीड, अल्पविराम-पृथक मान (CSV) आयात, जिसमें UK / US-शहर / सामान्य लेआउट अपने आप पहचाने जाते हैं, Open-Meteo से मौसम, और क्वारंटीन सीमाओं के साथ डेटा-गुणवत्ता का अंकन।

NLP

शास्त्रीय, नियम-आधारित तरीक़े से modus operandi निकालना और अपराध का वर्गीकरण। लूप में कोई भाषा मॉडल नहीं — जान-बूझकर, क्योंकि आउटपुट ऐसा होना चाहिए जिसे समझाया जा सके।

मॉडल

पॉइसों गणनाएँ, हॉक्स की स्व-उत्तेजक प्रक्रियाएँ, शोर के साथ अनुप्रयोगों का घनत्व-आधारित स्थानिक क्लस्टरिंग (DBSCAN) से शृंखला की पहचान, KDE हॉटस्पॉट, गाउसी प्रक्रिया प्रतिगमन, बेयेसीय और समूह परतें।

इन्फ़रेंस

रॉसमो भौगोलिक प्रोफ़ाइलिंग, MO विश्लेषण, सबूत का अंकन, विसंगति पहचान, साथ-अपराध का PageRank और समुदाय पहचान, और संकेत इंजन।

इंटरैक्टिव

एक ही घटनाओं पर दो मॉडल

नक़्शे पर घटनाएँ रखिए। KDE पूछता है कि अपराध कहाँ घना है। रॉसमो का फ़ॉर्मूला कुछ और पूछता है, और वह ज़्यादा दिलचस्प है: यह मानते हुए कि अपराधी घर के आसपास एक बफ़र क्षेत्र से बचते हैं, अपराधी के रहने की सबसे ज़्यादा संभावना कहाँ है? दोनों जीते-जी चलते हैं, उन्हीं बिंदुओं पर जो आप रखते हैं।

sentinel — स्थानिक इन्फ़रेंस

घटना जोड़ने के लिए क्लिक कीजिए। हर बिंदु पर सतहें दोबारा गिनी जाती हैं।

घटनाएँ
0
शिखर घनत्व
—

सबसे ऊपर का सूत्र

कोई सूत्र नहीं
कम से कम तीन घटनाएँ रखिए।

उत्पत्ति-श्रृंखला

रॉसमो पर बहस है। भौगोलिक प्रोफ़ाइलिंग तब अच्छा काम करती है जब शृंखला एक ही अपराधी की हो और उसका ठिकाना स्थिर हो, और तब ख़राब जब ये मान्यताएँ टूट जाएँ। उसके शिखर को किसी व्यक्ति के बारे में सबूत मानना उसका दुरुपयोग होगा।
गाउसी KDE और रॉसमो के आपराधिक भौगोलिक लक्ष्य-निर्धारण फ़ॉर्मूले के जीवित कार्यान्वयन, जो इस पृष्ठ के लिए लिखे गए हैं। भेजा जाने वाला औज़ार इनके ऊपर, असली लिए हुए डेटा पर Hawkes प्रक्रियाएँ, DBSCAN शृंखला पहचान और गाउसी प्रक्रिया प्रतिगमन जोड़ता है।
पूरा

आज क्या चलता है

  • इनजेस्ट से लेकर क्रम में लगे सूत्रों तक पूरी पाइपलाइन
  • 495 स्वचालित परीक्षण
  • UK और US डेटासेट पर असली डेटा से मान्यकरण
  • Windows और Linux के लिए पैकेजिंग
  • स्थानीय, सिर्फ़-पढ़ने वाला प्रातिनिधिक स्थिति अंतरण (REST) API
  • नौ पृष्ठों का डैशबोर्ड: घटनाएँ, नक़्शा, अंशांकन, मामले, साथ-अपराध का ग्राफ़, सूत्र, ऑडिट लॉग, सेटिंग, डीबग
सीमाएँ

क्या नहीं चलता

  • सिर्फ़ नियम-आधारित NLP। modus operandi निकालना शास्त्रीय तरीक़े से होता है, और उसकी रिकॉल की सीमाएँ भी साथ आती हैं।
  • एक ही मशीन का डेस्कटॉप। कोई बहु-उपयोक्ता तैनाती नहीं, विश्लेषकों के बीच मामले की कोई साझा हालत नहीं।
  • जीवित कनेक्टर थोड़े ही हैं। वास्तविक-समय के गिने-चुने डेटा स्रोत ही जुड़े हुए हैं।
  • नक़्शा बुनियादी है। ख़ुद बनाया गया, कोई भौगोलिक सूचना प्रणाली (GIS) नहीं। वैकल्पिक GIS एकीकरण चरण 3–5 की चीज़ है।

चरण 3–5, योजना में

कई अधिकार-क्षेत्रों का समर्थन, वैकल्पिक GIS एकीकरण, प्रकाशित बेंचमार्क, निष्पक्षता-पहले तैनाती, और शायद एक प्रबंधित सेवा। बचा हुआ काम REMAINING.md में है, न कि किसी रोडमैप प्रस्तुति में।

यह किसके लिए है

अपराध डेटा में पैटर्न ढूँढ़ता है, और अपना हिसाब भी दिखाता है

विश्लेषक घटनाओं के अभिलेखों में डूबे रहते हैं। यह उन सबके आर-पार पैटर्न ढूँढ़ता है और क्रम में लगाता है कि किस पर क़रीब से नज़र डालनी चाहिए, और हर सुझाव के पीछे के सबूत तक लौटने का रास्ता भी बनाए रखता है।

01

छोटी और क्षेत्रीय पुलिस इकाइयाँ

बड़े विश्लेषण ठेके ज़्यादातर बजटों की पहुँच से बाहर हैं। यह एक साधारण डेस्कटॉप कंप्यूटर पर चलता है और किसी विभाग के लिए नहीं, एक अकेले विश्लेषक के लिए बना है।

02

धोखाधड़ी और बार-बार अपराध करने वालों की जाँच करने वाले

बीमा धोखाधड़ी और संगठित खुदरा चोरी तब तक असंबंधित घटनाएँ लगती हैं, जब तक कोई उन्हें एक क़तार में न रख दे। यह वही क़तार लगाता है, और इशारा करता है कि अगली घटना कहाँ होने की संभावना है।

03

अपराध और पुलिसिंग पर शोध करने वाले

हर नतीजा ठीक उन्हीं अभिलेखों और सेटिंग्स तक खोजा जा सकता है जिनसे वह बना, इसलिए कोई दूसरा शोधकर्ता काम को भरोसे पर मानने के बजाय जाँच सकता है।

क्या यहाँ आपको अपनी स्थिति दिख रही है? यह अभी बीटा परीक्षण के लिए खुला है, और जिनके लिए यह बना है, उन्हीं की राय इसे सचमुच बदलती है। बीटा टेस्टर बनें →
उत्पत्ति

हर सूत्र अपनी रसीद साथ लाता है

मूल अभिलेख, मॉडल, पैरामीटर, और हर चरण पर हुआ रूपांतरण। ऑडिट लॉग देखने वाला पृष्ठ डैशबोर्ड के नौ पृष्ठों में से एक है, कोई फ़ीचर अनुरोध नहीं। जो सॉफ़्टवेयर तय करता है कि पुलिस का ध्यान कहाँ जाएगा, उसके लिए यह कम-से-कम की शर्त है — और इसी वजह से उसके पीछे का अनुसंधान प्रोटोटाइप, ARIA-INTEL, उसी इस्तेमाल के लिए तैयार नहीं बताया गया है।