SENTINEL · Fases 1–2 completas

Pistas de investigación que se pueden rastrear hasta su origen

A los investigadores rara vez les faltan datos. Lo difícil es encontrar el patrón dentro de miles de registros que, de uno en uno, no llaman la atención. SENTINEL es una herramienta de escritorio que lee datos públicos de delincuencia, les pasa la estadística y ordena lo que merece una mirada más de cerca — y cada resultado se remonta a los registros, el modelo y los ajustes exactos de los que salió. Si un analista no puede enseñar por qué una pista quedó donde quedó, no debería ser una pista.

LenguajeC++23
Interfaz de usuario (UI)Qt 6, panel de 9 páginas
Pruebas495 automatizadas
AlmacenamientoSQLite
Último envíohace poco
Dicho por delante

Esto es software analítico que ordena lugares y asociaciones a partir de datos públicos de delincuencia. Es una herramienta para dirigir la atención de un analista, no un sistema que decida nada sobre una persona.

Las páginas de calibración y equidad existen porque un modelo bien ordenado y mal calibrado es más peligroso que no tener modelo. La planificación de las fases 3–5 pone explícitamente la equidad por delante, y los benchmarks publicados son un entregable declarado y no una afirmación de marketing.

En lenguaje llano

Qué es esto, en un minuto

El problema

Un robo en una vivienda, un robo en un coche, una reclamación al seguro. Cada uno por separado no llama la atención, y lo que los conecta solo aparece cuando alguien alinea cientos de ellos y mira. Eso es trabajo lento a mano, y los contratos de analítica que lo hacen a escala tienen un precio fuera del alcance de casi cualquier cuerpo policial.

La solución

SENTINEL lee los registros y les pasa modelos estadísticos establecidos: dónde se concentra la delincuencia, qué incidentes parecen una sola serie y no varias, desde qué zona es más probable que se llevara una serie. Ordena lo que merece una mirada más de cerca. Cada etapa escribe lo que hizo, así que una pista llega con sus registros de origen, el modelo y los ajustes que hay detrás.

Para quién es

Cuerpos policiales pequeños y regionales, donde los grandes contratos de analítica quedan fuera de alcance — esto funciona en un ordenador de escritorio corriente y está pensado para un solo analista, no para un departamento. Quienes investigan fraude y reincidencia, donde el patrón está repartido entre incidentes que nadie archivó juntos. Investigadores, que pueden rastrear cualquier resultado hasta los registros que lo produjeron.

Señala a un analista algo que merece comprobarse. No decide nada sobre una persona. El resto de esta página es la ingeniería: dos de los modelos reales funcionando en tu navegador, la cadena que los alimenta, qué funciona hoy y qué no.
Los modelos en sí

Dos de los modelos reales, compilados a WebAssembly

models/KDEHotspot y models/HawkesProcess — el mismo C++ que un analista ejecuta en el escritorio, compilado con Qt para WebAssembly y alimentado con los puntos que tú colocas. Haz clic en el mapa para añadir incidentes.

KDEHotspot + HawkesProcess — WebAssembly

sin cargar

2,4 megabytes (MB) porque Qt6Core viene con ello. Ese es el coste honesto de ejecutar el modelo de verdad en lugar de una imitación, y no se descarga nada hasta que lo pides.

Incidentes
0
Razón de ramificación
—
Razón de ramificación es lo que aprendió el modelo de Hawkes: el número esperado de incidentes de seguimiento que dispara cada incidente. Cerca de cero significa que los puntos no llevan autoexcitación — espárcelos de forma uniforme y debería decirlo.
Solo los modelos. La ingesta, la base de datos, la procedencia y el panel son la aplicación, y la aplicación no está aquí — la propia compilación de SENTINEL necesita Qt6::Test, que necesita Qt6::Concurrent, que un Qt de WebAssembly de un solo hilo no tiene.
Cadena

Ingesta → procesamiento de lenguaje natural (PLN) → características → modelos → inferencia

Cada etapa escribe lo que hizo en la cadena de procedencia, así que una pista al final lleva el registro de cómo llegó hasta allí.

La cadena de SENTINEL desde la ingesta, pasando por PLN basado en reglas, modelos estadísticos e inferencia, hasta las pistas ordenadas, con un carril de procedencia conectado a cada etapa
desplaza para ver el diagrama completo →
El carril de debajo es el producto. Cada etapa escribe lo que hizo en la cadena de procedencia, así que una pista llega con el registro de cómo llegó hasta ahí.
Ingesta

Interfaz de programación de aplicaciones (API) de la policía británica y fuentes históricas, importación de valores separados por comas (CSV) con autodetección de formatos británico / de ciudad estadounidense / genérico, meteorología por Open-Meteo y puntuación de calidad de datos con umbrales de cuarentena.

PLN

Extracción clásica de modus operandi basada en reglas y clasificación de delitos. Sin modelo de lenguaje de por medio — a propósito, porque la salida tiene que ser explicable.

Modelos

Recuentos de Poisson, procesos autoexcitados de Hawkes, detección de series por agrupamiento espacial basado en densidad de aplicaciones con ruido (DBSCAN), puntos calientes por KDE, regresión por procesos gaussianos, capas bayesianas y de conjunto.

Inferencia

Perfilado geográfico de Rossmo, análisis de MO, puntuación de pruebas, detección de anomalías, PageRank de codelincuencia y detección de comunidades, y el motor de pistas.

Interactivo

Dos modelos sobre los mismos incidentes

Coloca incidentes en el mapa. KDE pregunta dónde es densa la delincuencia. La fórmula de Rossmo pregunta algo distinto y más interesante: dado que los delincuentes evitan una zona de amortiguación alrededor de su casa, ¿dónde es más probable que viva el delincuente? Los dos corren en vivo, sobre los mismos puntos que tú colocas.

sentinel — inferencia espacial

Haz clic para añadir un incidente. Las superficies se recalculan con cada punto.

Incidentes
0
Densidad máxima
—

Pista mejor clasificada

Sin pistas
Coloca al menos tres incidentes.

Cadena de procedencia

Rossmo está en discusión. El perfilado geográfico funciona bien en series de un solo delincuente con un punto de anclaje estable, y mal cuando esos supuestos se rompen. Tratar su máximo como prueba sobre una persona sería usarlo mal.
Implementaciones en vivo de KDE gaussiano y de la fórmula de localización geográfica criminal de Rossmo, escritas para esta página. La herramienta que se distribuye añade procesos de Hawkes, detección de series con DBSCAN y regresión por procesos gaussianos sobre datos reales ya ingeridos.
Completo

Lo que funciona hoy

  • Cadena completa desde la ingesta hasta las pistas ordenadas
  • 495 pruebas automatizadas
  • Validación con datos reales sobre conjuntos británicos y estadounidenses
  • Empaquetado para Windows y Linux
  • API de transferencia de estado representacional (REST) local y de solo lectura
  • Panel de nueve páginas: eventos, mapa, calibración, casos, grafo de codelincuencia, pistas, registro de auditoría, ajustes, depuración
Limitaciones

Lo que no

  • Solo PLN basado en reglas. La extracción de modus operandi es clásica, con los límites de exhaustividad que eso implica.
  • Escritorio en una sola máquina. Sin despliegue multiusuario, sin estado de casos compartido entre analistas.
  • Conectores en vivo limitados. Hay pocas fuentes de datos en tiempo real conectadas.
  • Mapa básico. Dibujado a medida, no un sistema de información geográfica (GIS). La integración opcional con GIS es cosa de las fases 3–5.

Fases 3–5, planificadas

Soporte multijurisdicción, integración opcional con GIS, benchmarks publicados, despliegue con la equidad por delante y un posible servicio gestionado. La lista de pendientes está en REMAINING.md y no en una presentación de hoja de ruta.

Para quién es

Encuentra patrones en los datos de delincuencia, y enseña cómo lo ha hecho

Los analistas se ahogan en registros de incidentes. Esto busca los patrones que los atraviesan y ordena lo que merece una mirada más de cerca, manteniendo un rastro hasta las pruebas que hay detrás de cada sugerencia.

01

Cuerpos policiales pequeños y regionales

Los grandes contratos de analítica quedan fuera del alcance de casi cualquier presupuesto. Esto funciona en un ordenador de escritorio corriente y está pensado para un solo analista, no para un departamento.

02

Investigadores de fraude y de delincuentes reincidentes

El fraude a seguros y el robo organizado en comercios parecen incidentes sin relación hasta que alguien los alinea. Esto hace ese alineamiento, y señala dónde es probable que esté el siguiente.

03

Investigadores que estudian la delincuencia y el trabajo policial

Todo resultado se puede rastrear hasta los registros y ajustes exactos que lo produjeron, así que otro investigador puede comprobar el trabajo en vez de fiarse sin más.

¿Reconoces aquí tu situación? Esto está abierto a pruebas beta ahora, y las personas para las que está hecho son aquellas cuyos comentarios de verdad lo cambian. Hazte probador beta →
Procedencia

Cada pista lleva su propio recibo

Registro de origen, modelo, parámetros y la transformación en cada etapa. Un visor del registro de auditoría es una de las nueve páginas del panel, no una petición de función. Para un software que ordena hacia dónde va la atención policial, ese es el listón mínimo — y es la razón por la que el prototipo de investigación que hay detrás, ARIA-INTEL, está etiquetado como no listo para el mismo uso.