El Covid-19 ha tenido un gran impacto en el mundo. Con millones de personas a las que se les ha indicado que se autoaíslen, la jornada laboral de muchos se ha visto completamente transformada. El trabajo remoto está ahora en pleno auge y las empresas funcionan sin oficinas. Aunque esto es excelente para la productividad, incrementa el peligro que los ciberdelincuentes representan para las empresas. Con cada vez más comunicación realizada a través del correo electrónico, la oportunidad para los ataques de phishing nunca ha sido mayor.
Aquí en Red Sift, hemos construido un modelo de aprendizaje automático para distinguir los mensajes falsos sobre el COVID-19 de los verdaderos basándonos en el contenido del correo electrónico. Esta entrada de blog explica por qué adoptamos un enfoque de aprendizaje automático y cómo construimos el modelo.
¿Por qué usar aprendizaje automático?
Un enfoque tradicional basado en reglas para clasificar la intención de un correo electrónico no es escalable, ya que se necesita crear y mantener manualmente un gran número de reglas con el tiempo. Los atacantes son astutos y constantemente encontrarán una forma de adaptar su estrategia de phishing. Por ejemplo, para eludir un filtro de la palabra clave “covid-19”, los atacantes simplemente pueden cambiar la palabra clave por una similar como “côvíd-19”.
El aprendizaje automático utiliza matemáticas y estadística para aprender patrones a partir de los datos y hacer predicciones informadas sobre datos no vistos previamente. Los modelos de aprendizaje automático necesitan datos etiquetados en lugar de reglas hechas a mano. Los algoritmos de aprendizaje automático pueden entrenar un modelo para aprender patrones sofisticados y sutiles a partir de correos de phishing de ejemplo. El modelo puede actualizarse fácilmente para ser más preciso con datos de entrenamiento adicionales recopilados con el tiempo. Como resultado, un enfoque basado en aprendizaje automático es más robusto y dinámico.
Ejemplos de la vida real
Esta sección muestra algunos ejemplos reales de mensajes verdaderos y falsos sobre el COVID-19. Nuestro modelo los clasifica correctamente a todos.
Ejemplo 1
Mensaje falso de la OMS con archivo adjunto malicioso que utiliza caracteres acentuados côvíd y la palabra mal escrita coronaaviris dentro del documento.


Ejemplo 2
Mensaje falso del gobierno con enlaces maliciosos.


Un correo legítimo sobre el Covid-19
Un mensaje verdadero sobre el COVID de una organización.


Cómo construimos el modelo
Hay dos bloques importantes en la construcción de un modelo de aprendizaje automático: los datos y el algoritmo.
Datos
Para entrenar eficazmente un modelo, necesitamos proporcionar una buena colección de ejemplos tanto de mensajes falsos como verdaderos relacionados con el COVID-19. Para los mensajes verdaderos, recopilamos de forma colaborativa cientos de mensajes enviados por un gran número de organizaciones distintas. Para los mensajes falsos, los filtramos a partir de mensajes de phishing reportados de forma fiable. Para aumentar la variedad, recopilamos mensajes falsos en formato de imagen provenientes de varios artículos y extraemos el texto de ellos. Afortunadamente, parte de trabajar en una empresa de ciberseguridad significa que no faltaban mensajes fraudulentos.
Algoritmo
Investigamos varias técnicas de preprocesamiento junto con diferentes enfoques de modelado. Las técnicas de preprocesamiento incluyen tanto técnicas genéricas de texto (eliminación de palabras vacías, lematización) como específicas del correo electrónico (exclusión de firmas). Las técnicas de modelado abarcan desde algoritmos estándar (regresión logística, naive Bayes, SVM, random forest) hasta redes neuronales superficiales (word2vec, fasttext) y aprendizaje profundo (RNN, LSTM). En particular, hacemos uso de la investigación más avanzada en transferencia de aprendizaje, incluyendo ULMFiT, transformer y BERT.
En Red Sift, permitimos que las organizaciones que priorizan la seguridad se comuniquen con éxito y garanticen la confianza de sus empleados, proveedores y clientes. Nuestro portafolio incluye una serie de productos de referencia para la protección del correo electrónico y del dominio: OnDMARC y Brand Trust. Estos están diseñados para funcionar en conjunto y bloquear ataques de phishing saliente, además de ofrecer defensa contra la suplantación de dominio para la protección contra amenazas a nivel de toda la empresa.


Phong's work explores a number of projects focused on NLP, anomaly detection, active learning and visualisation. He is a most known for his work behind Red Sift Radar.




