Библиографическое описание:Сравнение методов кластеризации данных для автоматического определения грануляции в генетической нечеткой системе : научное издание / Т. С. Плешкова, В. В. Становов. - Текст : непосредственный // Сибирский аэрокосмический журнал. - 2022. - Т. 23, № 1. - С. 33-42. - ISSN 2712-8970, DOI 10.31772/2712-8970-2022-23-1-33-42.
Аннотация:В статье предлагается применение методов кластеризации для определения наиболее подходящего количества нечетких термов при построении генетической нечеткой системы. При этом система на нечеткой логике применяется для решения задач классификации данных и автоматически формируется генетическим алгоритмом. В работе использовался генетический алгоритм с кодировкой термов и классов в бинарную строку, при этом каждый индивид кодировал базу правил. Для построения базы правил необходимо задавать такой параметр, как количество нечетких термов, так как он существенно влияет на качество сформированных классификаторов. Для выявления лучшего метода кластеризации данных было проведено сравнение наиболее известных алгоритмов: DBSCAN, k-средних и алгоритм среднего сдвига. Для оценки эффективности подобранного количества нечетких термов были проведены вычислительные эксперименты на нескольких наборах данных. По результатам было определено, что алгоритм среднего сдвига подбирает такое количество термов, которое позволяет строить более точные классификаторы в сравнении с двумя другими методами, участвовавшими в тестировании. Также было проведено сравнение с альтернативными методами классификации, такими как k ближайших соседей, метод опорных векторов и нейронные сети, в результате которого предложенный метод показал сравнимое качество классификации. Разработанный подход к автоматизации определения количества термов позволяет исключить ручной подбор грануляции для различных данных, снижая затраты на создание эффективной нечеткой системы для задачи классификации.
The paper proposes applying clustering methods to determine the most appropriate number of fuzzy terms to design a genetic fuzzy system. The fuzzy logic system in this study is used to solve data classification problems and is automatically generated by a genetic algorithm. In this study we used a genetic algorithm with encoding of terms and classes into a binary string, while each individual encoded a rule base. It is necessary to set the number of fuzzy terms parameter to build a rule base, since it significantly affects the quality of the generated classifiers. To determine the best method of data clustering, the most well-known algorithms were compared: DBSCAN, k-means and the mean shift algorithm. To evaluate the efficiency of the selected number of fuzzy terms, computational experiments were performed on several data sets. Based on the results, it was determined that the mean shift algorithm selects such a number of terms that allows building more accurate classifiers in comparison to the other two methods involved in testing. A comparison was also made with alternative classification methods such as k nearest neighbors, support vector machine and neural networks, as a result of which the proposed method showed comparable classification quality. The developed approach to automating the determination of the number of terms makes it possible to exclude manual selection of granulation for various data, reducing the cost of creating an effective fuzzy system for solving classification problems.