Сравнительный анализ алгоритмов глубокого обучения с подкреплением DDPG, PPO и SAC для управления беспилотным автомобилем в симуляторе CARLA : научное издание
Библиографическое описание:Сравнительный анализ алгоритмов глубокого обучения с подкреплением DDPG, PPO и SAC для управления беспилотным автомобилем в симуляторе CARLA : научное издание / М. К. Тихонов. - Текст : непосредственный // Научный результат. Информационные технологии. - 2024. - Т. 9, № 2. - С. 69-74. - ISSN 2518-1092, DOI 10.18413/2518-1092-2024-9-2-0-8.
Аннотация:В данной статье представлен сравнительный анализ трех передовых алгоритмов глубокого обучения с подкреплением: Deep Deterministic Policy Gradient (DDPG), Proximal Policy Optimization (PPO) и Soft Actor-Critic (SAC), реализованных в библиотеке Stable Baselines 3. Целью исследования является оценка эффективности и применимости каждого из алгоритмов для задачи управления беспилотным автомобилем в сложной и динамичной среде, предоставляемой симулятором CARLA, с акцентом на такие ключевые показатели, как суммарная дистанция, суммарное вознаграждение, средняя скорость, отклонение от центра дорожной полосы и доля успешных эпизодов. Авторы подробно описывают методологию экспериментального тестирования, включая настройку параметров обучения и критерии оценки производительности. Результаты экспериментов демонстрируют различия в производительности алгоритмов, выявляя их сильные и слабые стороны в контексте автономного вождения. Статья вносит вклад в понимание преимуществ и ограничений каждого алгоритма в контексте автономного вождения и предлагает рекомендации по их практическому применению.
This paper presents a comparative analysis of three advanced deep reinforcement learning algorithms: Deep Deterministic Policy Gradient (DDPG), Proximal Policy Optimization (PPO) and Soft Actor-Critic (SAC) implemented in the Stable Baselines 3 library. The aim of the study is to evaluate the performance and applicability of each of the algorithms for the task of driving an unmanned vehicle in the complex and dynamic environment provided by the CARLA simulator, focusing on key metrics such as total distance, total reward, average speed, deviation from the center of the roadway, and success rate of episodes. The authors describe the experimental testing methodology in detail, including the tuning of training parameters and performance evaluation criteria. Experimental results demonstrate differences in the performance of the algorithms, revealing their strengths and weaknesses in the context of autonomous driving. The paper contributes to the understanding of the advantages and limitations of each algorithm in the context of autonomous driving and offers recommendations for their practical application.