Библиографическое описание:Лебедев, И. С. Использование информации о влияющих факторах для разбиения выборок данных в методах машинного обучения для оценки состояния = Influencing factors information usage for splitting data samples in machine learning methods to assess is state / И. С. Лебедев, М. Е. Сухопаров. - (Системы машинного обучения и управления базами данных). - Текст : непосредственный // Проблемы информационной безопасности. Компьютерные системы. - 2022. - № 2. - С. 125-134 : табл., граф., ил. - Библиогр.: с. 131-132 (18 назв.). - Список литературы представлен на русском и английском языках. - ISSN 2071-8217.
Аннотация:Повышение качественных показателей идентификации состояния информационной безопасности отдельных сегментов киберфизических систем связано с обработкой больших информационных массивов. Предлагается метод разбиения выборок данных для повышения показателей качества алгоритмов классификации состояний ИБ. Классификационные модели настраиваются на обучающих множествах примеров, в которых могут присутствовать выбросы, зашумленные данные, дисбаланс наблюдаемых объектов, что влияет на качественные показатели результатов. В определенные моменты времени под воздействием внешней среды могут изменяться частоты появления наблюдаемых событий, диапазоны регистрируемых значений, что существенно влияет на качественные показатели. Показано, что ряд событий в выборках возникает в результате действий внутренних и внешних факторов.
Improving the qualitative indicators of identifying the state of information security of individual cyber-physical systems segments is associated with the processing of large information arrays. A method of splitting data samples is proposed to improve the quality of algorithms for classifying information security states. Classification models are configured on training sets of examples in which outliers, noisy data, and an imbalance of observed objects may be present, which affects the qualitative indicators of the results. At certain points in time, under the influence of the external environment, the frequency of occurrence of observed events, the ranges of recorded values may change, which significantly affects the quality indicators. It is shown that a number of events in the samples occur as a result of the actions of internal and external factors.
Ключевые слова:cyberphysical systems, data sampling, formation of data samples, information security, large information arrays, machine learning, большие информационные массивы, выборка данных, информационная безопасность, киберфизические системы, машинное обучение, формирование выборок данных