Búsqueda de vídeo con IA local: qué corre en tu propio Mac en 2026
Qué puede hacer Apple Silicon con tu material sin conexión, cuánto peor es que la nube, y cuándo ese intercambio es obviamente el correcto.
Hace dos años, “análisis de tu material con IA” significaba subirlo. Eso estaba bien para un vlog de viajes y era inviable para cualquier cosa con una cláusula de confidencialidad, que es casi todo el trabajo pagado.
Eso ha cambiado, en silencio y bastante rápido. Un modelo que describe un clip lo bastante bien como para volver a encontrarlo cabe hoy en un portátil. Esto es lo que consigues de verdad, lo que cuesta en calidad, y dónde la nube sigue mereciendo el trabajo.
Qué significa “local” aquí
Hoy corren en el equipo tres tipos de modelo, y conviene separarlos porque rinden de forma muy distinta.
Voz a texto. Con diferencia el más maduro. Los modelos de la familia Whisper corren cómodamente en Apple Silicon y producen transcripciones de una calidad realmente cercana a la de los servicios en la nube, en decenas de idiomas, con códigos de tiempo por palabra. Si en tu trabajo habla gente, esto solo ya cambia tu flujo. Detalle en transcribir vídeo en un Mac.
Visión y lenguaje. Modelos de dos a ocho mil millones de parámetros que miran fotogramas y los describen con palabras. Es la capacidad más nueva y la que tiene mayor distancia con la nube. Suficiente para encontrar un clip, no suficiente para escribir tu lista de planos.
Clasificación. Modelos pequeños, rápidos y específicos: ¿es un clip hablado o un recurso?, ¿está borroso?, ¿es material sensible? Llevan años siendo rápidos y fiables en el equipo.
En Apple Silicon esto pasa por los propios componentes de Apple y, cada vez más, por MLX, un marco de aprendizaje automático creado específicamente para la arquitectura de memoria unificada. Esa arquitectura es la razón de que un portátil pueda hacerlo: la GPU y la CPU comparten la misma memoria, así que un modelo de varios gigabytes no tiene que copiarse por un bus.
Qué hardware hace falta de verdad
Cifras honestas, no de folleto.
| Equipo | Qué esperar |
|---|---|
| Mac Intel | Los modelos de visión locales son inviables. Usa la nube. |
| M1 o M2, 8 GB | Solo modelos pequeños, mucha presión de memoria, lento. Posible, no agradable. |
| M1 a M4, 16 GB | El punto de entrada realista. Análisis alrededor de tiempo real o mejor, por clip. |
| 32 GB o más | Modelos mayores, mejores descripciones, puedes seguir trabajando mientras corre. |
| Serie M Pro o Max | Bastante más rápido, porque más núcleos de GPU es más rendimiento. |
Cuenta también con espacio en disco. Un modelo de visión son varios gigabytes, y uno bueno de voz otros uno a tres. Descargarlos es un coste único, pero es real en un portátil que siempre está al 90 por ciento.
Rendimiento en la práctica: cuenta con segundos para un clip corto, y con un trabajo en segundo plano que lanzas y dejas correr para una tarjeta entera. No es instantáneo. Es desatendido, que importa más.
¿Cuánto peor es realmente?
Esta es la pregunta que todo el mundo quiere respondida sin rodeos. La honesta:
Categorías: prácticamente igual. Cocina, calle, playa, bosque, oficina, multitud, entrevista, plano de dron. Un modelo local resuelve todo eso.
Detalles: notablemente peor. Donde un modelo en la nube dice “pez globo sobre un arrecife de coral”, uno local dice “pez bajo el agua”. Donde el de la nube lee el cartel y te da el nombre de la tienda, el local dice “un escaparate”.
Texto en imagen: mucho peor. Leer pizarras, señalización y pantallas es una fuerza de los modelos grandes y una debilidad de los pequeños.
Voz: casi igual. Es la excepción. La transcripción en el equipo está lo bastante cerca de la de la nube como para que la diferencia rara vez importe con audio limpio.
Consistencia: el local suele ser mejor. Un modelo pequeño te da siempre el mismo vocabulario, que para etiquetar es una ventaja real. Uno grande es más elocuente y más variable.
Y ahora lo importante: para recuperar material, las descripciones gruesas suelen bastar. Tu búsqueda no es “encuentra el pez globo”. Tu búsqueda es “cuál de estos 400 clips es el de debajo del agua con el pez”. “Pez bajo el agua” responde a eso en un segundo. Después usas los ojos, que era lo que ibas a hacer igualmente.
Los casos en los que lo grueso no basta son el registro para bibliotecas de stock, los archivos que necesitan vocabulario controlado en profundidad, y cualquier flujo en el que alguien buscará más adelante con palabras que tú no anticipaste.
Cuándo el local es obviamente lo correcto
No una preferencia, un requisito:
- Contratos con cláusulas de confidencialidad. Casi todos los contratos de producción tienen una. Una subida puede incumplirla aunque a los datos no les pase nada.
- Material médico, jurídico y policial. Regulado, y a la normativa no le interesa tu flujo de trabajo.
- Productos sin anunciar, material bajo embargo, grabaciones internas. El riesgo de filtración es el trabajo de alguien.
- Cualquier cosa con personas que no consintieron un tratamiento. Transeúntes, menores, lugares sensibles.
- Material personal que simplemente no quieres en el servidor de otro.
- Volumen. Diez mil clips a cualquier precio por clip es dinero real. El análisis en el equipo cuesta electricidad.
- Sin conexión. Montar en un avión, en un hotel con wifi hostil, en localización.
Esa lista cubre una parte muy grande del trabajo profesional, y por eso la capacidad en el equipo dejó de ser un nicho.
Qué sigue sin poder hacer el análisis local
Por completitud:
- No conoce a tus personas ni tus lugares. Ningún modelo lo hace, salvo que se lo digas.
- No puede leer tu proyecto. Cuál es la toma buena no es una propiedad visual.
- No indexa por código de tiempo. Obtienes una descripción del clip, no un registro del clip. Esa distinción está en buscar vídeos por objetos.
- No toca el RAW de cámara. R3D, BRAW, ProRes RAW, ARRIRAW y DNG son contenedores cerrados para casi todas las herramientas. Transcodifica antes.
- Calienta tu portátil. Analizar una tarjeta entera de forma sostenida es una carga fuerte de GPU. En un equipo sin ventilador, se ralentiza.
Una mezcla sensata
El montaje al que llega casi todo profesional que prueba las dos vías:
- En el equipo por defecto, para la tarjeta entera, justo después de la ingesta. Gratis, privado, desatendido.
- En la nube de forma selectiva, para el material donde la precisión compensa: el B-roll que vale para stock, el rodaje que vas a revender, el archivo que buscarás dentro de cinco años con palabras que hoy no puedes prever.
- Transcripción siempre en local, porque la diferencia de calidad es pequeña y las transcripciones son el resultado con más valor por unidad de esfuerzo.
Así la cuestión de la confidencialidad solo aparece con los clips que has decidido enviar conscientemente, y nunca con el grueso de tu biblioteca.
Dónde ocurre la búsqueda en sí
Merece decirse claro: el modelo no es el motor de búsqueda. El modelo escribe texto. Tu sistema operativo busca texto.
Así que la cadena local termina donde termina toda cadena buena: descripciones en los nombres, etiquetas de sujeto como etiquetas de Finder, transcripciones como archivos de texto junto a los clips. Spotlight indexa las tres cosas. El resultado es que tu “búsqueda de vídeo con IA local” es simplemente Spotlight, sobre datos que por fin existen.
Eso es una ventaja, no un compromiso. Significa que la búsqueda sigue funcionando cuando el modelo esté desinstalado, la app haya desaparecido y el disco esté conectado a un equipo que nunca ha oído hablar de nada de esto. Cómo se ve eso en el día a día está en encontrar clips sin abrir Premiere.
Cliptag usa los dos modos en macOS. El modo local usa un modelo de visión mediante MLX en Apple Silicon y es gratis e ilimitado, con una comprobación en el equipo que impide que los clips sensibles lleguen siquiera a la nube aunque el análisis en la nube esté activado. El análisis en la nube está para el material donde la precisión compensa, con 25 análisis al mes en el plan gratuito.