Библиографическое описание:Выделение групп используемых Интернет-ресурсов для обнаружения внутренних источников киберугроз : научное издание / С. В. Исаев, Д. Ю. Донцов. - Текст : непосредственный // Информационные и математические технологии в науке и управлении. - 2023. - № 4. - С. 170-181. - ISSN 2413-0133, DOI 10.25729/ESI.2023.32.4.015.
Аннотация:Защищенность корпоративной сети является важным аспектом успешного функционирования организации. В данной работе исследуется безопасность внутреннего периметра сети на примере Красноярского научного центра СО РАН. Существуют различные средства для предотвращения киберугроз и анализа посещаемых Интернет-ресурсов, но их быстродействие и возможность применения сильно зависят от объема входных данных. В статье рассматриваются существующие методы определения сетевых угроз с помощью анализа журналов прокси-сервера. Исследовано разделение интернет-пользователей на тематические группы для выявления аномалий. Предложен метод кластеризации Интернет-ресурсов, направленный на снижение объема входных данных путем исключения групп безопасных Интернет-ресурсов или выбора только подозрительных Интернет-ресурсов. Предложенный метод состоит из этапов: предобработка данных, выделение сессий пользователей, анализ данных и интерпретация полученных результатов. Исходными данными являются записи журнала прокси-сервера. На первом этапе из исходных данных выбираются полезные для анализа данные, после чего непрерывный поток данных делится на небольшие порции (сессии) при помощи метода ядерной оценки плотности. На втором этапе выполняется мягкая кластеризация используемых Интернет-ресурсов путем применения метода тематического моделирования. Результатом второго этапа являются неразмеченные группы Интернет-ресурсов. На третьем этапе, с помощью эксперта, происходит интерпретация полученных результатов путем анализа наиболее популярных Интернет-ресурсов в каждой группе. Метод имеет множество настроек на каждом этапе, что позволяет сконфигурировать его под любой формат и специфику входных данных. Область применения метода не ограничена. Он может быть использован как в качестве дополнительного шага предобработки с целью снижения количества входных данных, так и при выявлении аномальных данных.
The protection of the corporate network is an important aspect of the successful functioning of the organization. In this paper, the cybersecurity of the internal network perimeter is studied using the example of the Krasnoyarsk Scientific Center of the Siberian Branch of the Russian Academy of Sciences. There are various tools for preventing cyber threats and analyzing visited Internet resources, but their performance and applicability strongly depend on the amount of input data. The article discusses existing methods for identifying network threats by analyzing proxy server logs. The division of Internet users into thematic groups to detect anomalies is investigated. A method for clustering Internet resources is proposed, aimed at reducing the volume of input data by excluding groups of safe Internet resources or selecting only suspicious Internet resources. The proposed method consists of the following steps: data preprocessing, user session selection, data analysis, and interpretation of the results. The source data is the log entries of the proxy server. At the first stage, useful data for analysis are selected from the initial data, after which the continuous data stream is divided into small portions (sessions) using the kernel density estimation method. At the second stage, soft clustering of the used Internet resources is performed by applying the topic modeling method. The result of the second stage are unallocated groups of Internet resources. At the third stage, with the help of an expert, the results obtained are interpreted by analyzing the most popular Internet resources in each group. The method has many settings at each stage, which allows you to configure it for any format and specifics of the input data. The scope of the method is not limited. It can be used both as an additional preprocessing step to reduce the amount of input data and to detect anomalous data.