La COVID-19 a eu un effet majeur sur le monde. Avec des millions de personnes invitées à s'isoler, la journée de travail de nombreuses personnes a été complètement bouleversée. Le télétravail bat désormais son plein et les entreprises fonctionnent sans bureaux. Si cela est excellent pour la productivité, cela accroît le danger que représentent les cybercriminels pour les entreprises. Avec de plus en plus de communications réalisées par email, les opportunités d'attaques par phishing n'ont jamais été aussi nombreuses.
Chez Red Sift, nous avons conçu un modèle de machine learning pour distinguer les faux messages liés à la COVID-19 des véritables, en nous basant sur le contenu de l'email. Cet article de blog explique pourquoi nous avons adopté une approche de Machine Learning et comment nous avons construit ce modèle.
Pourquoi utiliser le Machine Learning ?
Une approche traditionnelle basée sur des règles pour classer l'intention d'un email n'est pas évolutive, car un grand nombre de règles doivent être créées et maintenues manuellement dans le temps. Les attaquants sont intelligents et trouveront constamment un moyen d'adapter leur stratégie de phishing. Par exemple, pour contourner un filtre de mot-clé « covid-19 », les attaquants peuvent simplement remplacer le mot-clé par un équivalent trompeur tel que « côvíd-19 ».
Le Machine Learning utilise les mathématiques et les statistiques pour apprendre des motifs à partir des données et faire des prédictions éclairées sur des données inconnues. Les modèles de Machine Learning ont besoin de données étiquetées plutôt que de règles élaborées manuellement. Les algorithmes de Machine Learning peuvent entraîner un modèle à apprendre des motifs sophistiqués et subtils à partir d'exemples d'emails de phishing. Le modèle peut être facilement mis à jour pour gagner en précision grâce à des données d'entraînement supplémentaires collectées au fil du temps. Ainsi, une approche basée sur le ML est plus robuste et dynamique.
Exemples concrets
Cette section présente quelques exemples concrets de vrais et de faux messages liés à la COVID-19. Notre modèle les classe tous correctement.
Exemple 1
Faux message de l'OMS avec pièce jointe malveillante utilisant des caractères accentués côvíd et le mot mal orthographié coronaaviris dans le document.


Exemple 2
Faux message gouvernemental contenant des liens malveillants.


Un email légitime lié à la COVID-19
Un véritable message lié à la COVID-19 envoyé par une organisation.


Comment nous avons construit le modèle
Un modèle de machine learning repose sur deux éléments fondamentaux : les données et l'algorithme.
Données
Pour entraîner efficacement un modèle, nous devons fournir une bonne collection d'exemples de messages, à la fois faux et véritables, liés à la COVID-19. Pour les messages véritables, nous rassemblons de manière collaborative des centaines de messages envoyés par un grand nombre d'organisations différentes. Pour les faux messages, nous les filtrons à partir de messages de phishing signalés et fiables. Pour accroître la diversité, nous recueillons des faux messages sous forme d'images dans plusieurs articles et en extrayons le texte. Heureusement, travailler dans une entreprise de cybersécurité signifie qu'il n'y avait aucune pénurie de messages frauduleux !
Algorithme
Nous étudions plusieurs techniques de prétraitement associées à différentes approches de modélisation. Les techniques de prétraitement incluent à la fois des méthodes génériques pour le texte (suppression des mots vides, lemmatisation) et des méthodes spécifiques aux emails (exclusion des signatures). Les techniques de modélisation vont des algorithmes classiques (régression logistique, naïve Bayes, SVM, forêt aléatoire) aux réseaux de neurones peu profonds (word2vec, fasttext) et à l'apprentissage profond (RNN, LSTM). En particulier, nous exploitons les recherches de pointe en apprentissage par transfert, notamment ULMFiT, transformer et BERT.
Chez Red Sift, nous permettons aux organisations qui placent la sécurité au premier plan de communiquer efficacement avec leurs employés, fournisseurs et clients, tout en garantissant leur confiance. Notre portefeuille comprend plusieurs produits de référence en matière de protection des emails et des domaines : OnDMARC et Brand Trust. Ils sont conçus pour fonctionner ensemble afin de bloquer les attaques de phishing sortantes et de fournir une défense contre l'usurpation de domaine, assurant ainsi une protection contre les menaces à l'échelle de l'entreprise.


Phong's work explores a number of projects focused on NLP, anomaly detection, active learning and visualisation. He is a most known for his work behind Red Sift Radar.




