Covid-19 hat die Welt maßgeblich beeinflusst. Da Millionen von Menschen angewiesen wurden, sich selbst zu isolieren, wurde der Arbeitsalltag vieler Menschen auf den Kopf gestellt. Remote-Arbeit ist inzwischen in vollem Gange, und Unternehmen betreiben ihren Geschäftsbetrieb ohne Büros. Zwar ist dies gut für die Produktivität, doch erhöht es auch die Gefahr, die Cyberkriminelle für Unternehmen darstellen. Da immer mehr Kommunikation per E-Mail erfolgt, war die Gelegenheit für Phishing-Angriffe nie größer.
Wir von Red Sift haben ein Machine-Learning-Modell entwickelt, um gefälschte COVID-19-Nachrichten anhand des E-Mail-Inhalts von echten zu unterscheiden. Dieser Blogbeitrag erklärt, warum wir uns für einen Machine-Learning-Ansatz entschieden haben und wie wir das Modell entwickelt haben.
Warum maschinelles Lernen einsetzen?
Ein traditioneller regelbasierter Ansatz zur Klassifizierung der E-Mail-Absicht ist nicht skalierbar, da eine große Anzahl von Regeln manuell erstellt und im Laufe der Zeit gepflegt werden muss. Angreifer sind clever und finden ständig Wege, ihre Phishing-Strategie anzupassen. Um beispielsweise an einem „covid-19“-Schlüsselwortfilter vorbeizukommen, können Angreifer das Schlüsselwort einfach durch ein ähnlich aussehendes ersetzen, wie etwa „côvíd-19“.
Maschinelles Lernen nutzt Mathematik und Statistik, um Muster aus Daten zu erlernen und fundierte Vorhersagen über unbekannte Daten zu treffen. Machine-Learning-Modelle benötigen gekennzeichnete Daten statt handgefertigter Regeln. Machine-Learning-Algorithmen können ein Modell trainieren, um anspruchsvolle und subtile Muster aus Beispiel-Phishing-E-Mails zu erlernen. Das Modell lässt sich leicht aktualisieren, um mit im Laufe der Zeit gesammelten zusätzlichen Trainingsdaten genauer zu werden. Dadurch ist ein ML-basierter Ansatz robuster und dynamischer.
Beispiele aus der Praxis
Dieser Abschnitt zeigt einige Beispiele aus der Praxis für echte und gefälschte COVID-19-Nachrichten. Unser Modell klassifiziert sie alle korrekt.
Beispiel 1
Gefälschte WHO-Nachricht mit bösartigem Anhang, die die Akzentzeichen côvíd und das falsch geschriebene Wort coronaaviris im Dokument verwendet.


Beispiel 2
Gefälschte Regierungsnachricht mit bösartigen Links.


Eine legitime Covid-19-E-Mail
Eine echte COVID-Nachricht von einer Organisation.


Wie wir das Modell entwickelt haben
Es gibt zwei wichtige Bausteine eines Machine-Learning-Modells: Daten und Algorithmus.
Daten
Um ein Modell effektiv zu trainieren, müssen wir eine gute Sammlung von Beispielen für sowohl gefälschte als auch echte COVID-19-bezogene Nachrichten bereitstellen. Für echte Nachrichten sammeln wir per Crowdsourcing Hunderte von Nachrichten, die von einer Vielzahl unterschiedlicher Organisationen versendet wurden. Für gefälschte Nachrichten filtern wir sie aus zuverlässig gemeldeten Phishing-Nachrichten heraus. Um die Vielfalt zu erhöhen, sammeln wir gefälschte Nachrichten im Bildformat aus einer Reihe von Artikeln und extrahieren daraus den Text. Zum Glück gehörte es zur Arbeit bei einem Cybersicherheitsunternehmen, dass es nie an Betrugsnachrichten mangelte!
Algorithmus
Wir untersuchen eine Reihe von Vorverarbeitungstechniken zusammen mit unterschiedlichen Modellierungsansätzen. Die Vorverarbeitungstechniken umfassen sowohl allgemeine Textverarbeitung (Entfernung von Stoppwörtern, Lemmatisierung) als auch E-Mail-spezifische Verfahren (Ausschluss von Signaturen). Die Modellierungstechniken reichen von Standardalgorithmen (logistische Regression, Naive Bayes, SVM, Random Forest) über flache neuronale Netze (word2vec, fasttext) bis hin zu Deep Learning (RNN, LSTM). Insbesondere nutzen wir die neuesten Forschungsergebnisse im Bereich des Transfer Learning, darunter ULMFiT, Transformer und BERT.
Bei Red Sift ermöglichen wir sicherheitsorientierten Unternehmen, erfolgreich mit ihren Mitarbeitern, Lieferanten und Kunden zu kommunizieren und deren Vertrauen zu sichern. Unser Portfolio umfasst eine Reihe erstklassiger E-Mail- und Domain-Schutzprodukte: OnDMARC und Brand Trust. Diese sind so konzipiert, dass sie gemeinsam ausgehende Phishing-Angriffe blockieren und Schutz vor Domain-Impersonation für unternehmensweite Bedrohungsabwehr bieten.


Phong's work explores a number of projects focused on NLP, anomaly detection, active learning and visualisation. He is a most known for his work behind Red Sift Radar.




