Контекст
Классификация мобильного трафика важна для мониторинга сетей связи, контроля качества обслуживания и выявления аномалий. Проблема усугубляется структурными изменениями самих сетей: значительная часть трафика в современных мобильных сетях передаётся в зашифрованном виде.
Это существенно ограничивает использование сигнатурных методов анализа и технологии глубокого анализа пакетов (Deep Packet Inspection, DPI) — инструмента, позволяющего инспектировать содержимое сетевых пакетов. При шифровании содержимое пакетов становится недоступным для подобных инструментов, и традиционный арсенал сетевой аналитики в значительной мере перестаёт работать. В этих условиях востребованы методы машинного обучения, способные автоматически извлекать информативные признаки и выявлять сложные зависимости в сетевых данных.
Методология
В рамках исследования был проведён анализ научных публикаций по теме, реализован конвейер обработки данных (data pipeline) для подготовки и анализа сетевых наборов. На его основе построены модели машинного обучения.
Отдельно были разработаны модели глубокого обучения и выполнена их экспериментальная оценка. Авторы сосредоточились на подходах, способных автоматически извлекать информативные признаки из сетевых данных и выявлять в них сложные зависимости — то, что остаётся применимым даже в условиях шифрования содержимого пакетов.
Transfer learning как практический инструмент
Отдельным направлением исследования стало применение transfer learning. Этот подход предполагает предварительное обучение модели на исходном наборе данных с последующей адаптацией к новому домену посредством дообучения. Такой механизм позволяет использовать уже обученные модели и адаптировать их к новым условиям без необходимости полного переобучения и сбора больших объёмов новых размеченных данных.
Подход особенно актуален в контексте изменяющихся условий работы сетей и обновлений мобильных приложений, когда характеристики генерируемого трафика меняются, а полное переобучение модели трудоёмко и требует нового цикла разметки.
Выводы
«Сегодня значительная часть мобильного трафика передаётся в зашифрованном виде, что существенно усложняет применение традиционных методов анализа сетевых данных. В нашей работе мы исследовали, насколько методы глубокого обучения могут быть применимы для классификации такого трафика и как перенос обучения позволяет адаптировать модели к новым условиям без полного переобучения», — прокомментировал Александр Гетьман, ассистент кафедры системного программирования ВМК МГУ.
Полученные результаты позволяют оценить применимость методов глубокого обучения для классификации зашифрованного мобильного трафика и подтверждают возможность использования переноса обучения для адаптации моделей к изменяющимся условиям работы сетей и обновлениям приложений.