Skip to content

Rilevare le email di phishing sul COVID-19 usando il Machine Learning

Il phishing a tema pandemico è aumentato vertiginosamente nel 2020. Ecco come Red Sift ha utilizzato il machine learning per rilevare e classificare in tempo reale le campagne di phishing legate al COVID-19.

Phong Nguyen·Data Scientist
Published: April 9, 2020·Updated: August 5, 2024·4 min read

Il Covid-19 ha avuto un effetto importante sul mondo. Con milioni di persone invitate ad auto-isolarsi, la giornata lavorativa di molti è stata completamente sconvolta. Il lavoro da remoto è ora in pieno svolgimento e le aziende operano senza uffici. Se da un lato ciò è ottimo per la produttività, dall'altro aumenta il pericolo che i criminali informatici rappresentano per le aziende. Con una comunicazione sempre più basata sull'email, l'opportunità per gli attacchi di phishing non è mai stata così alta.

Qui a Red Sift, abbiamo costruito un modello di machine learning per distinguere i falsi messaggi sul COVID-19 da quelli veri in base al contenuto dell'email. Questo articolo del blog spiega perché abbiamo adottato un approccio di Machine Learning e come abbiamo costruito il modello.

Perché usare il Machine Learning?

Un approccio tradizionale basato su regole per classificare l'intento di un'email non è scalabile, perché richiede la creazione manuale e il mantenimento nel tempo di un gran numero di regole. Gli attaccanti sono intelligenti e troveranno costantemente il modo di adattare la propria strategia di phishing. Ad esempio, per superare un filtro basato sulla parola chiave 'covid-19', gli attaccanti possono semplicemente modificarla in una parola simile come 'côvíd-19'.

Il Machine Learning utilizza la matematica e la statistica per apprendere schemi dai dati e formulare previsioni informate su dati non ancora osservati. I modelli di Machine Learning necessitano di dati etichettati invece di regole create manualmente. Gli algoritmi di Machine Learning possono addestrare un modello a riconoscere schemi sofisticati e sottili a partire da esempi di email di phishing. Il modello può essere facilmente aggiornato per diventare più accurato con dati di addestramento aggiuntivi raccolti nel tempo. Di conseguenza, un approccio basato su ML è più robusto e dinamico.

Esempi reali

Questa sezione mostra alcuni esempi reali di messaggi veri e falsi sul COVID-19. Il nostro modello li classifica tutti correttamente.

Esempio 1

Falso messaggio dell'OMS con allegato dannoso che utilizza caratteri accentati côvíd e la parola errata coronaaviris all'interno del documento.

Esempio 2

Falso messaggio governativo con link dannosi.

Un'email legittima sul Covid-19

Un vero messaggio sul COVID da parte di un'organizzazione.

Come abbiamo costruito il modello

Ci sono due elementi fondamentali di un modello di machine learning: i dati e l'algoritmo.

Dati

Per addestrare efficacemente un modello, dobbiamo fornire una buona raccolta di esempi sia per i messaggi falsi che per quelli veri relativi al COVID-19. Per i messaggi veri, raccogliamo tramite crowdsourcing centinaia di messaggi inviati da un gran numero di organizzazioni diverse. Per i messaggi falsi, li filtriamo da segnalazioni attendibili di phishing. Per aumentare la varietà, raccogliamo messaggi falsi in formato immagine da diversi articoli ed estraiamo il testo da essi. Fortunatamente, lavorare in un'azienda di cybersecurity significa che non c'è mai stata carenza di messaggi truffaldini!

Algoritmo

Abbiamo studiato diverse tecniche di preprocessing insieme a vari approcci di modellazione. Le tecniche di preprocessing includono sia elaborazione generica del testo (rimozione delle stop word, lemmatizzazione) che tecniche specifiche per le email (esclusione delle firme). Le tecniche di modellazione vanno dagli algoritmi standard (regressione logistica, naive Bayes, SVM, random forest) alle reti neurali superficiali (word2vec, fasttext) e al deep learning (RNN, LSTM). In particolare, facciamo uso della ricerca più avanzata nel transfer learning, tra cui ULMFiT, transformer e BERT.

In Red Sift, consentiamo alle organizzazioni orientate alla sicurezza di comunicare con successo e garantire la fiducia dei propri dipendenti, fornitori e clienti. Il nostro portafoglio include diversi prodotti di protezione email e dominio di livello eccellente: OnDMARC e Brand Trust. Questi sono progettati per lavorare in sinergia per bloccare gli attacchi di phishing in uscita e fornire una difesa contro l'impersonificazione del dominio per una protezione dalle minacce a livello aziendale.

Red Sift find out moreRed Sift find out more
Phong Nguyen
Phong Nguyen
Data Scientist

Phong's work explores a number of projects focused on NLP, anomaly detection, active learning and visualisation. He is a most known for his work behind Red Sift Radar.