Cómo funciona la detección de objetos en el dispositivo
Qué hace este detector
El Detector de Objetos con IA analiza una foto y dibuja un recuadro etiquetado alrededor de cada elemento que reconoce: una persona, un coche, un perro, un portátil, una silla. Por debajo funciona el modelo COCO-SSD sobre TensorFlow.js, una red neuronal entrenada con el conjunto de datos COCO para reconocer 80 clases de objetos cotidianos. De cada detección obtienes tres datos: el nombre de la clase, un cuadro delimitador que marca dónde está el objeto y una puntuación de confianza del 0 al 100% que indica cuán seguro está el modelo.
La detección arranca en cuanto se carga la imagen y todo el análisis ocurre en el dispositivo: el archivo del modelo (~10MB) se descarga una sola vez y queda en caché para las siguientes visitas.
Cuándo conviene usarlo
Sirve para etiquetar automáticamente una carpeta de fotos, comprobar qué contiene de verdad un conjunto de datos antes de entrenar tu propio modelo, o contar cuántas personas o vehículos aparecen en una escena. También resulta práctico para tareas de accesibilidad, al generar una descripción textual rápida de una imagen, y para quien prototipa ideas de visión por computador sin montar un entorno de Python.
Como exporta JSON estructurado con coordenadas, encaja en una tubería más amplia: ejecutas el detector, tomas los cuadros y los pasas a scripts de recorte, difuminado o anotación.
Un ejemplo concreto
Suelta una foto de calle. El modelo podría devolver persona al 92%, coche al 88% y semáforo al 71%, cada uno dentro de su propio recuadro de color. Sube la confianza mínima al 80% y el semáforo desaparece de los resultados, dejando solo las dos detecciones más seguras. Bájala al 40% y empiezan a aparecer objetos más tenues o parcialmente ocultos, junto con algún acierto equivocado. Descarga la imagen anotada para conservar las superposiciones, o exporta el JSON para obtener los nombres de clase, las puntuaciones y las coordenadas de los cuadros en bruto.
Notas y límites
COCO-SSD conoce 80 clases, así que todo lo que quede fuera de esa lista (una raza concreta de perro, el logotipo de una marca, un texto) no se etiquetará. Los objetos superpuestos o muy pequeños son los casos más difíciles y suelen quedar por debajo del umbral. El deslizador de confianza es tu control principal: los valores altos cambian exhaustividad por precisión y los bajos hacen lo contrario. Si una foto no devuelve nada, bajar el umbral suele sacar a la luz los objetos que el modelo vio pero de los que no estaba seguro.