Библиографическое описание:Алгоритмическая обработка потокового сетевого трафика для обнаружения аномалий на основе адаптивной кластеризации : доклад, тезисы доклада / Л. А. Казаковцев, А. В. Черный. - [Б. м. : б. и.], 2026. - Текст : непосредственный // Российская наука, инновации, образование (РОСНИО-V-2026) : сборник научных статей по материалам V Всероссийской (национальной) научной конференции. - Красноярск, 2026. - С. 206-215. - ISBN 9785605323556.
Аннотация:Рассмотрена задача обнаружения аномалий в сетях передачи данных при последовательном поступлении многомерных сетевых наблюдений. Показано, что классические статистические и пакетные кластерные методы ограниченно применимы в условиях высокой скорости поступления трафика, изменения нормального режима и невозможности хранения полной истории наблюдений. Представлен алгоритмический подход, в котором нормальное состояние сети описывается системой центров кластеров в пространстве признаков сетевых соединений, а текущая степень отклонения определяется расстоянием наблюдения до ближайшего центра. Для предотвращения искажения модели выбросами используется правило обновления только по наблюдениям, признанным нормальными, а порог обнаружения задается квантилем окна последних оценок аномальности. Экспериментальная проверка выполнена на имитационном потоке и на фрагменте набора сетевых данных CIC-IDS2017. Установлено, что уменьшение квантиля адаптивного порога повышает полноту обнаружения и обобщенную меру, но одновременно увеличивает число ложноположительных решений, что подтверждает необходимость настройки порога под требования конкретной системы мониторинга.
The paper considers anomaly detection in data transmission networks under sequential arrival of multidimensional network observations. It is shown that classical statistical procedures and batch clustering algorithms are only partially applicable when traffic is high-rate, normal behavior changes over time, and storing the complete observation history is undesirable. An algorithmic approach is presented in which normal network behavior is represented by a set of cluster centers in the feature space of network flows, whereas the anomaly score of a current observation is determined by its distance to the nearest center. To prevent outliers from distorting the model, only observations classified as normal are used for updating the cluster structure, while the detection threshold is defined as a quantile of a sliding window of recent anomaly scores. The approach was evaluated on a simulated stream and on a fragment of the CIC-IDS2017 network data set. The experiments show that decreasing the adaptive threshold quantile increases recall and the F-score, but also increases the number of false positive decisions. This confirms the need to tune the threshold according to the monitoring system requirements.