Insights

Visión artificial con las cámaras que ya tienes: lo que nos enseñaron dos pruebas de concepto

La mayoría de los edificios ya tienen el sensor. Estacionamientos, oficinas, depósitos, locales comerciales, obras: las cámaras se instalaron hace años por seguridad y ven todo lo que la operación querría contar: cuántos autos hay dentro, cuántas personas hay en una zona, si quien entra al predio lleva casco. Convertir esas imágenes en números antes requería hardware específico: molinetes, barreras infrarrojas, contadores manuales. Ahora requiere un modelo, un dispositivo de procesamiento local y una serie de decisiones que importan más que el modelo.

Cómo funciona la canalización

La estructura es la misma para casi cualquier problema de conteo o cumplimiento:

  • Detección. Un modelo que encuentra personas, vehículos o equipos en cada fotograma. Los detectores abiertos de la familia YOLO son lo bastante buenos como para que esta etapa rara vez sea la limitación.
  • Seguimiento. Cada objeto detectado recibe una identidad persistente entre fotogramas, de modo que una persona que pasa tres veces cuenta como una persona que pasa tres veces. Seguidores como ByteTrack o SORT hacen ese trabajo.
  • Zonas y líneas de paso. Líneas y regiones virtuales dibujadas sobre la imagen de la cámara: una línea de entrada, una de salida, un área restringida. La ocupación se calcula a partir de ellas: entradas menos salidas.
  • Dónde se ejecuta. En un dispositivo de procesamiento local junto a la cámara cuando lo requieren la latencia, el ancho de banda o la privacidad; en la nube cuando no lo requieren. El video no tiene por qué salir del edificio: solo los conteos y las marcas de tiempo.
  • Qué produce. Un número en tiempo real, un tablero, una alerta cuando se supera un umbral y datos para los sistemas que operan el edificio: señalización, iluminación o un flujo de gestión de instalaciones.

Qué falla en la práctica

La ubicación de la cámara, antes que cualquier otra cosa. Una cámara cenital cuenta una multitud; una inclinada pierde de vista a las personas que quedan detrás de otras. La mayoría de los problemas de precisión atribuidos al modelo son problemas de ubicación.

Oclusión y aglomeraciones. Personas que se cruzan, giran, se sientan o están de pie en grupos. La exhaustividad cae precisamente en las escenas que más necesitas contar. Las vistas desde arriba y un seguimiento robusto ayudan; también ayuda no prometer una precisión que la escena no puede ofrecer.

Deriva. La iluminación cambia con las estaciones, se pinta una pared, se mueve una entrada, la cámara recibe un golpe. Un sistema que acertaba en marzo puede equivocarse sin que nadie lo note en noviembre, a menos que alguien lo contraste con un conteo manual de vez en cuando.

Falsos positivos. La planta en una maceta que se cuenta como una persona hasta que se ajusta el umbral de confianza. Los umbrales son una decisión para cada ubicación, no un valor predeterminado.

Qué nunca se registra

Contar personas no significa identificarlas. Los sistemas que vale la pena construir detectan una persona, sin determinar qué persona es: sin rostros, sin reidentificación entre cámaras y sin video almacenado. Solo metadatos, conteos y marcas de tiempo, con la retención y el acceso definidos antes de conectar la primera cámara. Si haces eso, el análisis de ocupación es una herramienta operativa. Si lo omites, es vigilancia con un tablero, independientemente de cómo lo llame el proveedor.

Qué aprendimos de dos pruebas de concepto

Construimos dos sistemas de este tipo como investigación, no para clientes, para descubrir dónde estaba realmente el trabajo.

Ocupación de estacionamientos. Una cámara cenital en un estacionamiento, un detector de vehículos para esa vista y un entorno de pruebas comparativas para medirlo. Logramos que la detección funcionara y nos detuvimos antes de la parte que convierte las detecciones en un conteo por plaza: el adaptador de ocupación quedó especificado, sin construir, y no se incorporaron resultados de las pruebas comparativas al repositorio. Ese es el hallazgo, no una nota al pie: la visión fue la parte breve; la aritmética que la convierte en un producto fue donde realmente estaba el trabajo.

Cumplimiento del uso de EPP. Un detector de personas preentrenado con heurísticas para comprobar la presencia de un casco y un chaleco de alta visibilidad. Explícitamente, no era un clasificador de equipos de protección personal entrenado para esa tarea, y el README lo aclara. Produjo detecciones y señaló incumplimientos fotograma por fotograma en una ejecución pequeña; nunca se midió su precisión, y los límites se documentaron para cada conjunto de datos antes de que alguien sintiera la tentación de citar una cifra. Sin reconocimiento facial por diseño: el modelo detecta equipos en una persona, sin identificarla.

Tres cosas se repitieron en ambos casos. El modelo fue la parte más breve del trabajo; el ángulo de la cámara, la iluminación y la ubicación de las líneas virtuales determinaron qué podía ver el detector. La distancia entre «detecta» y «cuenta» fue el proyecto entero. Y la segunda prueba de concepto planteó una pregunta que la primera no había planteado: una cámara de cumplimiento cambia cómo se siente trabajar bajo su observación. Explicarle al equipo qué se detecta, qué no y qué se almacena forma parte del diseño, en lugar de ser un comunicado posterior.

Lo que añade la producción: integración con los sistemas del edificio o del predio, una rutina de validación contra conteos manuales, una comprobación de deriva programada y, para cualquier sistema que observe a personas trabajando, una conversación con el personal antes del despliegue.

“Visión artificial con las cámaras que ya tienes: lo que nos enseñaron dos pruebas de concepto” by Martin Prunell is licensed under CC BY SA. Source code examples are licensed under MIT. Categorized under IA y agentes / Datos.

Related reading