Insights

Visão computacional com as câmeras que você já tem: o que duas provas de conceito nos ensinaram

A maioria dos edifícios já tem o sensor. Estacionamentos, escritórios, armazéns, lojas, canteiros de obras: as câmeras foram instaladas anos atrás por segurança e veem tudo o que a operação gostaria de contar: quantos carros estão dentro, quantas pessoas estão em uma zona, se a pessoa que entra no local está usando capacete. Transformar essas imagens em números antes exigia hardware específico: catracas, barreiras infravermelhas, contadores manuais. Agora exige um modelo, um dispositivo de processamento local e um conjunto de decisões que importam mais do que o modelo.

Como funciona o pipeline

A estrutura é a mesma para quase qualquer problema de contagem ou conformidade:

  • Detecção. Um modelo que encontra pessoas, veículos ou equipamentos em cada quadro. Os detectores abertos da família YOLO são bons o suficiente para que essa etapa raramente seja a limitação.
  • Rastreamento. Cada objeto detectado recebe uma identidade persistente entre quadros, de modo que uma pessoa que passa três vezes seja contada como uma pessoa que passa três vezes. Rastreadores como ByteTrack ou SORT fazem esse trabalho.
  • Zonas e linhas de passagem. Linhas e regiões virtuais desenhadas sobre a imagem da câmera: uma linha de entrada, uma de saída, uma área restrita. A ocupação é calculada a partir delas: entradas menos saídas.
  • Onde roda. Em um dispositivo de processamento local junto à câmera quando a latência, a largura de banda ou a privacidade exigem; na nuvem quando não exigem. O vídeo não precisa sair do edifício: apenas as contagens e os registros de data e hora.
  • O que produz. Um número em tempo real, um painel, um alerta quando um limiar é ultrapassado e dados para os sistemas que operam o edifício: sinalização, iluminação ou um fluxo de gestão de instalações.

O que falha na prática

O posicionamento da câmera, antes de qualquer outra coisa. Uma câmera vista de cima conta uma multidão; uma câmera inclinada perde de vista as pessoas que ficam atrás de outras. A maioria dos problemas de precisão atribuídos ao modelo é um problema de posicionamento.

Oclusão e aglomerações. Pessoas que se cruzam, viram, sentam ou ficam em pé em grupos. A revocação cai justamente nas cenas que você mais precisa contar. Vistas de cima e um rastreador robusto ajudam; também ajuda não prometer uma precisão que a cena não pode oferecer.

Deriva. A iluminação muda com as estações, uma parede é pintada, uma entrada muda de lugar, a câmera leva uma batida. Um sistema que acertava em março pode errar silenciosamente em novembro, a menos que alguém o compare com uma contagem manual de tempos em tempos.

Falsos positivos. O vaso de planta que é contado como uma pessoa até que o limiar de confiança seja ajustado. Os limiares são uma decisão para cada local, não um valor padrão.

O que nunca é registrado

Contar pessoas não significa identificá-las. Os sistemas que vale a pena construir detectam uma pessoa, sem determinar qual pessoa é: sem rostos, sem reidentificação entre câmeras e sem vídeo armazenado. Apenas metadados, contagens e registros de data e hora, com retenção e acesso definidos antes de conectar a primeira câmera. Faça isso e a análise de ocupação será uma ferramenta operacional. Pule essa etapa e será vigilância com um painel, independentemente de como o fornecedor a chame.

O que aprendemos com duas provas de conceito

Construímos dois sistemas desse tipo como pesquisa, não para clientes, para descobrir onde estava o trabalho de fato.

Ocupação de estacionamentos. Uma câmera vista de cima em uma garagem, um detector de veículos para essa vista e um ambiente de testes comparativos para medi-lo. Fizemos a detecção funcionar e paramos antes da parte que transforma as detecções em uma contagem por vaga: o adaptador de ocupação foi especificado, mas não construído, e nenhum resultado dos testes comparativos foi incluído no repositório. Essa é a descoberta, não uma nota de rodapé: a visão foi a parte curta; a aritmética que a transforma em produto foi onde estava o trabalho de fato.

Conformidade no uso de EPI. Um detector de pessoas pré-treinado com heurísticas para verificar a presença de capacete e colete de alta visibilidade. Explicitamente, não era um classificador de equipamentos de proteção individual treinado para essa tarefa, e o README deixa isso claro. Produziu detecções e sinalizou violações quadro a quadro em uma execução pequena; sua precisão nunca foi medida, e os limites foram documentados para cada conjunto de dados antes que alguém sentisse a tentação de citar um número. Sem reconhecimento facial por definição: o modelo detecta equipamentos em uma pessoa, sem identificá-la.

Três pontos se repetiram nos dois casos. O modelo foi a parte mais curta do trabalho; o ângulo da câmera, a iluminação e a posição das linhas virtuais determinaram o que o detector conseguia ver. A distância entre “detecta” e “conta” foi o projeto inteiro. E a segunda prova de conceito trouxe uma pergunta que a primeira não trouxe: uma câmera de conformidade muda a sensação de trabalhar sob sua observação. Explicar à equipe o que é detectado, o que não é e o que é armazenado faz parte do projeto, em vez de ser um comunicado posterior.

O que a produção acrescenta: integração com os sistemas do edifício ou do local, uma rotina de validação contra contagens manuais, uma verificação de deriva agendada e, para qualquer sistema que observe pessoas trabalhando, uma conversa com os funcionários antes da implantação.

“Visão computacional com as câmeras que você já tem: o que duas provas de conceito nos ensinaram” by Martin Prunell is licensed under CC BY SA. Source code examples are licensed under MIT. Categorized under IA e agentes / Dados.

Related reading