Résumé exécutif : Une détection de logo précise est essentielle pour protéger les marques contre les usages abusifs et les activités frauduleuses. L'approche IA hybride de Red Sift améliore la précision de détection, équilibrant efficacement la réduction des faux positifs avec l'identification des menaces réelles.
Cet article :
- Explore l'importance d'une détection de logo précise pour protéger les marques.
- Présente la méthode IA hybride innovante de Red Sift pour améliorer la précision de détection.
- Souligne l'importance d'équilibrer la réduction des faux positifs avec l'identification des menaces réelles.
Introduction
La détection de logo est cruciale pour la protection de marque, aidant à identifier l'usage abusif de logos sur des domaines similaires et des activités frauduleuses. Détecter la véritable apparition d'un logo tout en minimisant les faux positifs est tout aussi essentiel – les faux positifs gaspillent des ressources, déclenchent des actions d'application inutiles et masquent les véritables menaces.
Chez Red Sift, notre produit Brand Trust combat les abus de marque, la fraude et les attaques par domaines similaires en découvrant et surveillant les domaines frauduleux imitant des marques légitimes. Une détection de logo précise est essentielle pour fournir des informations fiables et des renseignements exploitables. Pour améliorer la précision, nous explorons diverses techniques, notamment la combinaison de modèles de détection d'objets par IA restreinte avec des modèles d'IA générative. Dans cet article de blog, nous décrivons notre approche IA hybride et partageons les enseignements de nos expérimentations.
Intégrer la détection en temps réel avec la vérification par IA générative
Les modèles de détection de logo sont souvent entraînés en utilisant la technologie de détection d'objets, leur permettant d'identifier des symboles de marque dans une variété d'images. Pour traiter efficacement des requêtes à grande échelle, les algorithmes en temps réel sont privilégiés, équilibrant vitesse et précision. Des techniques notables telles que YOLO, EfficientDet et RT-DETR se sont imposées comme des solutions de premier plan dans ce domaine. Bien que ces modèles atteignent des performances impressionnantes, ils peuvent encore rencontrer des difficultés dans des cas ambigus où les logos apparaissent sur des arrière-plans complexes, sont partiellement occultés, ou ressemblent à d'autres formes.
Pour améliorer notre processus de détection de logo et réduire les faux positifs, nous introduisons une étape de vérification supplémentaire. Après qu'un logo est détecté par notre modèle existant, un Grand Modèle Multimodal (LMM) est utilisé pour comparer le logo détecté à un logo de référence. Les LMM étendent les Grands Modèles de Langage (LLM) traditionnels en intégrant des capacités visuelles, leur permettant d'analyser des images en parallèle du texte. Puisque seule une petite fraction des domaines contient le logo recherché, le volume de cette étape de vérification reste gérable. Bien que la vérification basée sur les LMM soit plus lente que les modèles de détection en temps réel, sa précision améliorée justifie le temps de traitement supplémentaire.
Aperçu technique : comment fonctionne la vérification basée sur les LMM
L'IA générative a rendu vraiment simple l'utilisation de technologies de pointe. Au cœur de notre approche, il s'agit d'envoyer une invite avec une image à un modèle multimodal, qui analyse ensuite l'entrée et détermine si le logo détecté correspond à une référence. Voici un exemple de la façon dont nous pouvons envoyer une telle requête à un point de terminaison d'OpenAI effectuant cette vérification :


Cet appel API simple démontre à quel point il est facile d'intégrer l'IA générative dans notre pipeline pour des tâches de vérification. Cependant, bien que l'approche fondamentale soit simple, son optimisation pour des performances en conditions réelles est bien plus complexe. Nous adoptons une approche orientée données, en construisant un ensemble de données de test complet avec un nombre égal de vérifications de logos correspondants et non correspondants. Cela nous permet d'affiner systématiquement divers paramètres, notamment :
- Optimisation des invites : affiner la façon dont nous demandons au modèle d'évaluer la similarité des logos, comme ajuster les conditions liées à la couleur et aux slogans pour améliorer le rappel.
- Composition d'image : expérimenter différentes façons de présenter les logos de référence et le logo détecté dans une seule image ou plusieurs images.
- Stratégie de calcul au moment du test : déterminer la meilleure façon pour le modèle de « réfléchir » avant de prendre une décision.
- Sélection du modèle : évaluer différents modèles d'IA générative pour identifier la solution la plus performante.
Grâce à une expérimentation approfondie, nous avons acquis des connaissances précieuses sur la façon d'affiner efficacement ces aspects. Dans la section suivante, nous partageons nos principales conclusions issues des deux dernières expérimentations : la stratégie de calcul au moment du test et la sélection du modèle.
Expérimentation 1 : stratégie de calcul au moment du test
Des recherches récentes suggèrent qu'augmenter le calcul au moment du test peut améliorer la précision des modèles basés sur les LLM en accordant plus de temps au raisonnement (source). Nous avons testé ce concept en évaluant trois stratégies de réponse différentes :
- Résultat seul : le modèle fournit une réponse directe sans information supplémentaire.


- Résultat → Explication : le modèle fournit une réponse suivie d'une explication.


- Analyse → Résultat : le modèle génère une analyse avant de fournir une décision.


Nous avons utilisé le modèle GPT-4o et effectué le test trois fois avec les stratégies ci-dessus. Les résultats étaient cohérents et plutôt surprenants : la stratégie Analyse → Résultat a obtenu les moins bons résultats, tandis qu'il y avait peu de différence entre les autres. Dans cette tâche de vérification de logo, accorder plus de temps de réflexion au modèle n'a pas aidé et a même légèrement réduit la précision.


Expérimentation 2 : Grands Modèles Multimodaux
Il existe aujourd'hui plusieurs LMM disponibles, couvrant à la fois des solutions commerciales et open-source. Pour évaluer leurs performances, nous avons comparé un ensemble diversifié de modèles de tailles et d'architectures variées provenant de plusieurs fournisseurs :
- GPT-4o et GPT-4o-mini : deux modèles de vision d'OpenAI
- Claude 3.7 Sonnet : la dernière version du modèle le plus intelligent d'Anthropic avec prise en charge de la réflexion étendue
- Gemini 2.0 Flash et Flash-Lite : la famille de modèles Flash 2.0 récemment publiée par Google Gemini
- Llama 3.2 90B : le plus grand modèle prenant en charge la vision de Meta
- Qwen2.5-VL 7B : l'un des modèles open-source les plus réputés d'Alibaba


Nous avons fait quelques observations :
- Parmi les trois modèles phares d'OpenAI, Google et Anthropic, GPT-4o était le leader incontestable en précision. Claude 3.7 arrivait en dernier, mais en activant la réflexion étendue avec jusqu'à 1024 tokens, il a offert une amélioration significative, réduisant l'écart avec GPT-4o.
- Parmi les modèles plus petits, GPT-4o-mini était meilleur que Gemini 2.0 Flash-Lite, tous deux surpassant significativement le modèle open-source de 90 milliards de paramètres Llama3.2.
- Le résultat le plus impressionnant a été obtenu par le modèle Qwen2.5-VL, avec une performance exceptionnelle pour un modèle de 7 milliards de paramètres.
Expérimentation 3 : LMM open-source affinés
Les données
Inspirés par la performance du modèle Qwen, nous avons décidé d'affiner des LMM open-source pour cette tâche spécifique afin de voir dans quelle mesure ils pourraient performer. Pour préparer l'ensemble de données d'instructions, nous nous sommes assurés que les logos utilisés lors de l'entraînement n'apparaissaient pas dans l'ensemble de test, évitant ainsi toute fuite d'information ou surapprentissage. Nous avons créé des paires instruction-réponse, en testant deux approches : utiliser uniquement le résultat dans la réponse par rapport à une approche Analyse → Résultat. Puisqu'un résultat seul offre peu de signal d'apprentissage, nous avons émis l'hypothèse que les réponses Analyse → Résultat seraient plus efficaces.
Nous avons d'abord expérimenté avec le plus petit modèle disponible, Qwen2.5-VL 3B, pour comparer les deux approches. La référence, sans affinage, n'a pas réussi à fournir des prédictions significatives, se limitant à une seule valeur pour toutes les données de test. L'affinage avec les résultats seuls a atteint une précision de 0,75, tandis que l'affinage avec Analyse → Résultat a amélioré la performance à 0,83, confirmant que le raisonnement structuré aide le modèle à mieux apprendre.
Les modèles
Une fois l'ensemble de données finalisé, nous sommes passés à l'ajustement du modèle. LoRA, une méthode d'affinage qui ajoute de petites couches d'adaptateur à un modèle figé, permet un entraînement efficace sans modifier les poids d'origine. QLoRA améliore encore l'efficacité de la mémoire grâce à la quantification, nous permettant d'affiner le modèle 7B sur un GPU T4. L'affinage de Qwen2.5-VL 7B a donné un score de 0,935, surpassant des modèles comme Gemini 2.0 Flash. Nous avons également affiné Llama 3.2 11B, atteignant 0,88 – nettement mieux que la version 90B standard testée précédemment.
Enfin, nous avons affiné Qwen2.5-VL 7B sans quantification en utilisant un GPU A100-40GB pour une performance maximale. Cet effort final a permis d'obtenir un score de 0,965 — égalant GPT-4o. Atteindre le niveau de performance de GPT-4o avec un modèle spécialisé de 7B est un exploit remarquable, démontrant le potentiel de l'affinage ciblé.


Conclusion
En combinant les modèles traditionnels de détection de logo avec la vérification basée sur les LMM, nous avons développé une approche plus robuste pour identifier les logos avec une grande confiance. Cette méthode hybride aide à atténuer les faux positifs et améliore la fiabilité de nos solutions pilotées par l'IA. Chez Red Sift, nous continuons à repousser les limites de la recherche en IA, explorant des moyens innovants d'améliorer la précision et la performance dans divers domaines. Nous avons énormément appris au cours de ce processus et nous sommes impatients de développer des solutions innovantes qui permettent à nos clients de mieux sécuriser leur présence numérique. Si vous souhaitez en savoir plus, contactez l'équipe !
Phong's work explores a number of projects focused on NLP, anomaly detection, active learning and visualisation. He is a most known for his work behind Red Sift Radar.




