Procurar vídeos por objetos: o que funciona mesmo e o que não

Que desempenho tem mesmo o reconhecimento de objetos em material bruto, a diferença entre etiquetas e descrições, e porque é que procurar por código de tempo é outro problema.

7 min de leitura

“Sei que tenho um plano de um carro vermelho a passar.” Essa frase é todo o problema da busca de vídeo, e até há pouco a única resposta era abrir clipes até dar com ele.

A busca por objetos muda isso, mas não como as demonstrações sugerem. Isto é o que faz mesmo, que precisão tem realmente, e como a pôr a funcionar nos seus próprios discos.

Porque é que o seu Mac ainda não consegue fazer isto

O Spotlight é um bom índice. Conhece todos os nomes de ficheiro, todas as pastas, o texto completo dos seus documentos, o EXIF das suas fotografias, a duração e as dimensões dos seus vídeos.

Não sabe qual é o aspeto de um vídeo. Nenhum sistema operativo indexa o conteúdo de imagem, porque até há pouco isso significava descodificar cada fotograma de cada ficheiro e passá-lo por um modelo, algo nem de perto comportável.

Portanto a formulação honesta de “procurar vídeos por objetos” é um trabalho em dois passos:

  1. Gerar texto que descreva o que está em cada clipe
  2. Procurar nesse texto com as ferramentas que já tem

O passo dois está resolvido desde 2005. O passo um é a parte nova, e é aí que está tudo o que é interessante.

Como funciona o passo da descrição

Um modelo de visão não vê o seu clipe. Amostra fotogramas, normalmente entre oito e trinta conforme a duração, e olha para esses.

Essa amostragem tem consequências que vale a pena perceber:

  • O que persiste é encontrado. Um carro estacionado dez segundos no enquadramento aparecerá num fotograma amostrado.
  • O que passa depressa perde-se. Um pássaro que atravessa o enquadramento em meio segundo provavelmente cai entre amostras.
  • A descrição reflete o clipe inteiro, não um instante. Obtém “uma estrada costeira com trânsito”, não um registo ao segundo.

Para quase todo o material isso é exatamente o correto, porque procura o clipe, não o fotograma. Quer passar de 400 ficheiros a três e depois usar os olhos.

O que acerta

Ao fim de alguns milhares de clipes, as categorias fiáveis são constantes:

Pessoas e a sua disposição. Uma pessoa, um grupo, uma multidão. Sentados, de pé, a andar, a falar para a câmara. Grande plano, plano aberto.

Veículos e transportes. Carro, camião, bicicleta, barco, avião, comboio. A cor quase sempre, o modelo raramente.

Locais, por tipo. Cozinha, escritório, rua, floresta, praia, montanha, estádio, armazém. É uma das categorias mais sólidas e a mais útil na prática.

Objetos comuns. Comida, portáteis, ferramentas, instrumentos, mobiliário, sinalética, animais ao nível de “cão” e “pássaro”.

Condições. Dia ou noite, interior ou exterior, sol ou nublado, hora dourada. Para casar planos numa montagem valem tanto como os assuntos.

Câmara e enquadramento. Estático ou à mão, drone ou solo, grande plano ou aberto, movimentos evidentes.

Combine duas ou três dessas e tem uma busca a sério: “cozinha, duas pessoas, luz de dia” reduz 400 clipes a quatro.

O que falha

Igualmente constante, e vale a pena saber antes de confiar:

Identificação fina. “Peixe” é fiável. “Peixe-balão” depende muito do modelo. Um modelo na nuvem costuma acertar espécies, raças e plantas. Um modelo local pequeno dá-lhe a categoria.

Locais e pessoas com nome. Um modelo pode reconhecer um horizonte urbano famoso. Não conhece o edifício do seu cliente, e não sabe que a pessoa no enquadramento é o Marcus a não ser que o tenha dito ao sistema. Pior: pode nomear com toda a confiança a cidade errada, o que sai mais caro do que calar-se.

Texto na imagem. Os modelos na nuvem leem placas e quadros surpreendentemente bem. Os modelos locais pequenos muitas vezes não.

Tudo o que é pequeno, rápido ou meio tapado. O adereço no canto, o logótipo na caneca, a coisa que só aparece aos 0:42.

Contar. “Três pessoas” costuma sair como “várias pessoas”. Não construa uma busca que dependa de números exatos.

A postura prática: use as descrições geradas como o filtro que o leva de centenas de clipes a um punhado, e use os olhos para o último passo. São 95 por cento menos de percorrer material, que é de isso que se trata.

Etiquetas ou descrições? As duas, para buscas diferentes

Duas formas de texto gerado, que servem consultas diferentes.

As etiquetas são uma lista curta e controlada: cozinha, entrevista, dia, mao. Boas para filtrar e agrupar, porque a mesma palavra significa sempre o mesmo. É o que faz funcionar um sistema de etiquetas para B-roll.

As descrições são uma frase: “duas pessoas a uma bancada de cozinha, uma fala para a câmara, luz de manhã pela janela”. Boas para busca de texto completo, porque as encontra com qualquer uma das suas palavras, incluindo as que nunca se lembraria de definir como etiqueta.

Use as duas. Etiquetas nas etiquetas do Finder do ficheiro, descrição no nome e num ficheiro de texto anexo. Assim uma busca ampla toca a descrição e um filtro preciso toca as etiquetas.

Onde guardar para que a busca funcione

Gerar o texto só serve se aterrar onde as suas ferramentas de busca olham. Num Mac:

  • Nome do ficheiro: Cozinha-Entrevista-Duas-Pessoas-Manha_16x9_4K_25FPS.mp4. Visível em todo o lado, pesquisável em todo o lado.
  • Etiquetas do Finder: o vocabulário controlado. Indexadas pelo Spotlight, filtráveis de qualquer caixa de abrir.
  • Ficheiro de texto anexo: a descrição longa e a transcrição. O Spotlight indexa o conteúdo.

Repare no que não está na lista: um catálogo proprietário. Se a descrição só existe dentro de uma aplicação, então “procurar no meu material” significa na verdade “abre primeiro essa aplicação”, e num disco de arquivo de há dois anos talvez essa aplicação nem sequer esteja instalada. O argumento longo está em onde devem viver os metadados.

A questão do código de tempo

O pedido evidente a seguir: não “que clipe tem o carro vermelho” mas “em que segundo aparece o carro vermelho”.

Esse é um problema bastante mais difícil. Implica indexar ao nível do fotograma ou do segundo, o que multiplica o custo da análise por uma ou duas ordens de grandeza e produz um índice que nenhum sistema de ficheiros consegue meter num nome.

Onde está a coisa hoje:

  • Conteúdo falado: resolvido. As transcrições trazem códigos de tempo ao nível da palavra por omissão, portanto procurar uma frase dá-lhe o momento exato. Se o seu material são entrevistas, já tem busca ao nível do momento. Veja transcrever vídeo num Mac.
  • Conteúdo visual: parcialmente, e a pagar. Existem sistemas que o fazem, sobretudo no servidor e cobrados por hora de material.

Para quase todo o trabalho independente, a busca visual por clipe mais a busca por momento no falado cobrem as perguntas reais. Encontra o clipe em segundos e depois percorre trinta segundos, em vez de quatro horas.

Nuvem ou equipamento

As duas funcionam. Falham de formas diferentes.

A nuvem dá as respostas finas: espécies, monumentos, texto legível, objetos concretos. Os fotogramas saem do seu equipamento e paga por clipe.

O equipamento, com Apple Silicon, dá as categorias: peixe, costa, cozinha, multidão. Nada sai do equipamento, sem custo por clipe, funciona sem ligação. Para material com confidencialidade não é uma preferência: é a única versão que passa numa revisão de contrato. A busca de vídeo com IA local detalha o que esperar.

O valor por omissão útil: no equipamento para o grosso, na nuvem para o material onde uma descrição vaga ou errada lhe custaria tempo mais tarde.


Cliptag faz o passo da descrição no macOS. Analisa vídeo, fotografias e áudio, escreve um nome descritivo, aplica etiquetas de assunto como etiquetas do Finder e guarda as transcrições como texto junto ao clipe, de modo que a sua busca acontece no Spotlight e não noutra aplicação. Plano gratuito com 25 análises na nuvem por mês, e modo local gratuito e ilimitado.

Perguntas
Posso procurar os meus ficheiros de vídeo pelo que está lá dentro?

De forma nativa não, nenhum sistema operativo indexa o conteúdo de imagem de um vídeo. Torna-se possível quando cada clipe tem anexada uma descrição de texto gerada por um modelo de visão. Depois procura no texto, que o seu sistema operativo indexa. A descrição é a ponte entre os pixels e a busca.

Que precisão tem o reconhecimento de objetos em material bruto?

Fiável em categorias comuns: pessoas, veículos, animais, edifícios, comida, ferramentas, água, vegetação, interior ou exterior. Menos fiável em identificações finas, espécies concretas, marcas ou lugares com nome, e pouco fiável com qualquer coisa pequena, desfocada ou que apareça um instante. Trate-o como um bom primeiro filtro, não como uma garantia.

Posso procurar um momento concreto dentro de um clipe longo?

Isso exige indexar por código de tempo, o que é bastante mais pesado do que descrever um clipe uma vez. Para o conteúdo falado está resolvido, porque as transcrições trazem códigos de tempo. Para o conteúdo visual, uma descrição por clipe mais uma passagem curta dentro do clipe encontrado é o compromisso prático para quase todos os fluxos.

A busca por objetos funciona sem ligação?

Sim. Os modelos de visão que cabem num Mac com Apple Silicon produzem descrições utilizáveis sem que nada saia do equipamento. Espere categorias mais amplas do que com um modelo na nuvem, ou seja peixe em vez de peixe-balão, o que costuma bastar para encontrar o clipe.

Experimente no seu próprio material

Largue uma pasta. Receba nomes, etiquetas e transcrições.

A Cliptag lê o seu vídeo, fotos e áudio, dá a cada ficheiro um nome pelo que está lá dentro e arquiva-o onde o vai voltar a encontrar. Plano gratuito, sem conta, e o modo local continua gratuito e ilimitado.

Descarregar grátis para Mac Ou experimentar no navegador
macOS 11+ · Sem conta · Sem cartão
Continuar a ler
Encontrar imagens de drone depressa: de DJI_0001.MP4 a uma biblioteca pesquisável Porque é que o material aéreo é o mais difícil de procurar, para que servem mesmo os ficheiros SRT, e como encontrar uma tomada de costa específica em dez segundos. Busca de vídeo com IA local: o que corre no seu próprio Mac em 2026 O que o Apple Silicon consegue fazer ao seu material sem ligação, quanto pior é do que a nuvem, e quando essa troca é obviamente a certa. Como etiquetar B-roll para o encontrar mesmo mais tarde Assunto, função e qualidade: os três eixos de um sistema de etiquetas que ainda funciona ao fim de vinte projetos, mais um vocabulário inicial.