Resumen ejecutivo: La detección precisa de logotipos es esencial para proteger a las marcas contra el uso indebido y las actividades fraudulentas. El enfoque híbrido de IA de Red Sift mejora la precisión de detección, equilibrando eficazmente la reducción de falsos positivos con la identificación de amenazas genuinas.
Este artículo:
- Explora la importancia de la detección precisa de logotipos para proteger las marcas.
- Presenta el innovador método híbrido de IA de Red Sift para aumentar la precisión de detección.
- Enfatiza el equilibrio entre la reducción de falsos positivos y la identificación de amenazas genuinas.
Introducción
La detección de logotipos es crucial para la protección de marcas, ya que ayuda a identificar el uso indebido de logotipos en dominios similares y actividades fraudulentas. Detectar la presencia real del logotipo minimizando al mismo tiempo los falsos positivos es igualmente esencial: los falsos positivos desperdician recursos, desencadenan acciones de aplicación innecesarias y ocultan amenazas genuinas.
En Red Sift, nuestro producto Brand Trust combate el abuso de marca, el fraude y los ataques de dominios similares mediante el descubrimiento y monitoreo de dominios fraudulentos que imitan marcas legítimas. La detección precisa de logotipos es clave para proporcionar información fiable e inteligencia procesable. Para mejorar la precisión, exploramos diversas técnicas, incluida la combinación de modelos de detección de objetos de IA especializada con modelos de IA generativa. En esta entrada de blog, describimos nuestro enfoque híbrido de IA y compartimos las conclusiones de nuestros experimentos.
Integración de la detección en tiempo real con la verificación mediante IA generativa
Los modelos de detección de logotipos suelen entrenarse utilizando tecnología de detección de objetos, lo que les permite identificar símbolos de marca en una variedad de imágenes. Para gestionar eficientemente solicitudes a gran escala, se prefieren los algoritmos en tiempo real, que equilibran velocidad y precisión. Técnicas destacadas como YOLO, EfficientDet y RT-DETR han surgido como soluciones líderes en este ámbito. Si bien estos modelos logran un rendimiento impresionante, aún pueden tener dificultades con casos ambiguos en los que los logotipos aparecen en fondos complejos, están parcialmente ocultos o se asemejan a otras formas.
Para mejorar nuestro proceso de detección de logotipos y reducir los falsos positivos, introducimos un paso de verificación adicional. Después de que un logotipo es detectado con nuestro modelo existente, se utiliza un Modelo Multimodal Grande (LMM) para comparar el logotipo detectado con un logotipo de referencia. Los LMM amplían los tradicionales Modelos de Lenguaje Grande (LLM) al incorporar capacidades de visión, permitiéndoles analizar imágenes junto con texto. Dado que solo una pequeña fracción de dominios contiene el logotipo de interés, el volumen de este paso de verificación sigue siendo manejable. Aunque la verificación basada en LMM es más lenta en comparación con los modelos de detección en tiempo real, su mayor precisión justifica el tiempo de procesamiento adicional.
Descripción técnica: cómo funciona la verificación basada en LMM
La IA generativa ha hecho realmente sencillo el uso de tecnología de vanguardia. En esencia, nuestro enfoque consiste en enviar una instrucción con una imagen a un modelo multimodal, que luego analiza la entrada y determina si el logotipo detectado coincide con una referencia. Aquí tiene un ejemplo de cómo podemos enviar dicha solicitud a un endpoint de OpenAI que realiza esta verificación:


Esta simple llamada a la API demuestra lo fácil que resulta integrar la IA generativa en nuestro flujo de trabajo para tareas de verificación. Sin embargo, aunque el enfoque fundamental es sencillo, optimizarlo para el rendimiento en el mundo real es mucho más complejo. Adoptamos un enfoque orientado a los datos, creando un conjunto de datos de prueba completo con un número igual de verificaciones de logotipos coincidentes y no coincidentes. Esto nos permite ajustar sistemáticamente varios parámetros, entre ellos:
- Optimización de instrucciones: refinar cómo indicamos al modelo que evalúe la similitud de logotipos, como ajustar condiciones relacionadas con el color y los eslóganes para mejorar la exhaustividad.
- Composición de imágenes: experimentar con diferentes formas de presentar los logotipos de referencia y el logotipo detectado en una sola imagen o en varias imágenes.
- Estrategia de cómputo en tiempo de prueba: determinar la forma óptima para que el modelo “piense” antes de tomar una decisión.
- Selección de modelo: evaluar diferentes modelos de IA generativa para identificar la solución con mejor rendimiento.
Mediante una extensa experimentación, hemos obtenido información valiosa sobre cómo ajustar estos aspectos de manera efectiva. En la siguiente sección, compartimos nuestros principales hallazgos de los dos últimos experimentos: la estrategia de cómputo en tiempo de prueba y la selección de modelo.
Experimento 1: estrategia de cómputo en tiempo de prueba
Investigaciones recientes sugieren que aumentar el cómputo en tiempo de prueba puede mejorar la precisión de los modelos basados en LLM al permitir más tiempo para el razonamiento (fuente). Pusimos a prueba este concepto evaluando tres estrategias de respuesta diferentes:
- Solo resultado: el modelo proporciona una respuesta directa sin información adicional.


- Resultado → Explicación: el modelo proporciona una respuesta seguida de una explicación.


- Análisis → Resultado: el modelo genera un análisis antes de proporcionar una decisión.


Utilizamos el modelo GPT-4o y ejecutamos la prueba tres veces con las estrategias anteriores. Los resultados fueron consistentes y bastante sorprendentes: la estrategia Análisis → Resultado tuvo el peor rendimiento, mientras que hubo poca diferencia entre las otras dos. En esta tarea de verificación de logotipos, dar al modelo más tiempo para pensar no ayudó e incluso redujo ligeramente la precisión.


Experimento 2: modelos multimodales grandes
Hoy en día existen varios LMM disponibles, que abarcan tanto soluciones comerciales como de código abierto. Para evaluar su rendimiento, comparamos un conjunto diverso de modelos con distintos tamaños y arquitecturas de múltiples proveedores:
- GPT-4o y GPT-4o-mini: dos modelos de visión de OpenAI
- Claude 3.7 Sonnet: la última versión del modelo más inteligente de Anthropic con soporte de pensamiento extendido
- Gemini 2.0 Flash y Flash-Lite: la familia de modelos Flash 2.0 recientemente lanzada de Google Gemini
- Llama 3.2 90B: el modelo más grande que admite visión de Meta
- Qwen2.5-VL 7B: uno de los modelos de código abierto más reconocidos de Alibaba


Hicimos algunas observaciones:
- Entre los tres modelos insignia de OpenAI, Google y Anthropic, GPT-4o fue el líder definitivo en precisión. Claude 3.7 quedó en último lugar, pero al habilitar el pensamiento extendido con hasta 1024 tokens, ofreció una mejora significativa, reduciendo la brecha con GPT-4o.
- Entre los modelos más pequeños, GPT-4o-mini fue mejor que Gemini 2.0 Flash-Lite, superando ambos significativamente al modelo de código abierto de 90B parámetros Llama3.2.
- El resultado más impresionante lo obtuvo el modelo Qwen2.5-VL, con un rendimiento sobresaliente para un modelo de 7B parámetros.
Experimento 3: LMM de código abierto ajustados
Los datos
Inspirados por el rendimiento del modelo Qwen, decidimos ajustar LMM de código abierto para esta tarea específica y ver qué tan bien podían rendir. Para preparar el conjunto de datos de instrucciones, nos aseguramos de que los logotipos utilizados en el entrenamiento no aparecieran en el conjunto de prueba, evitando así la fuga de información o el sobreajuste. Creamos pares de instrucción-respuesta, probando dos enfoques: usar solo el resultado en la respuesta frente a un enfoque de Análisis → Resultado. Dado que un resultado por sí solo ofrece poca señal de aprendizaje, planteamos la hipótesis de que las respuestas de Análisis → Resultado serían más efectivas.
Primero experimentamos con el modelo disponible más pequeño, Qwen2.5-VL 3B, para comparar los dos enfoques. La línea base, sin ajuste, no logró proporcionar predicciones significativas, recurriendo por defecto a un único valor para todos los datos de prueba. El ajuste solo con resultados alcanzó una precisión de 0.75, mientras que el ajuste con Análisis → Resultado mejoró el rendimiento a 0.83, confirmando que el razonamiento estructurado ayuda al modelo a aprender mejor.
Los modelos
Con el conjunto de datos finalizado, pasamos al ajuste de modelos. LoRA, un método de ajuste que agrega pequeñas capas adaptadoras a un modelo congelado, permite un entrenamiento eficiente sin modificar los pesos originales. QLoRA mejora aún más la eficiencia de memoria mediante la cuantización, lo que nos permite ajustar el modelo de 7B en una GPU T4. El ajuste de Qwen2.5-VL 7B produjo una puntuación de 0.935, superando a modelos como Gemini 2.0 Flash. También ajustamos Llama 3.2 11B, logrando 0.88, significativamente mejor que la versión de 90B lista para usar evaluada anteriormente.
Finalmente, ajustamos Qwen2.5-VL 7B sin cuantización utilizando una GPU A100-40GB para obtener el máximo rendimiento. Este último esfuerzo resultó en una puntuación de 0.965, igualando a GPT-4o. Lograr un rendimiento al nivel de GPT-4o con un modelo especializado de 7B es un logro notable, que demuestra el potencial del ajuste dirigido.


Conclusión
Al combinar los modelos tradicionales de detección de logotipos con la verificación impulsada por LMM, hemos desarrollado un enfoque más sólido para identificar logotipos con alta confianza. Este método híbrido ayuda a mitigar los falsos positivos y mejora la fiabilidad de nuestras soluciones impulsadas por IA. En Red Sift, seguimos ampliando los límites de la investigación en IA, explorando formas innovadoras de mejorar la precisión y el rendimiento en diversos ámbitos. Hemos aprendido muchísimo durante este proceso y esperamos con interés seguir desarrollando soluciones innovadoras que permitan a nuestros clientes proteger mejor su presencia digital. Si desea obtener más información, ¡póngase en contacto con el equipo!
Phong's work explores a number of projects focused on NLP, anomaly detection, active learning and visualisation. He is a most known for his work behind Red Sift Radar.




