Алгоритмы адаптивного управления каскадными динамическими объектами на базе метода обучения с подкреплением
https://doi.org/10.17587/mau.27.115-126
Аннотация
Рассматриваются алгоритмы адаптивного управления динамическими объектами каскадной структуры, базирующиеся на методе градиента стратегии. Используется структура обучения с подкреплением, известная как Actor-Critic. Разрабатывается базовый алгоритм, применяемый для объекта первого порядка. Новизна предлагаемого алгоритма адаптивного управления заключается в предложенном аналитическом способе вычисления оценки ценности состояния (алгоритм Critic). Алгоритм Actor базируется на заданной структуре закона управления и методе временных различий. Предложена модификация алгоритма, обеспечивающая ограничение роста настраиваемого коэффициента. Приводится анализ устойчивости и сходимости процессов стабилизации управляемой переменной и оценок ценности состояния. Получены условия, при которых управляемая переменная в процессе обучения не выходит за заданные ограничения и асимптотически устойчива относительно нулевого состояния. Предложены два подхода к учету ограничений на управляющее воздействие. В первом подходе используется нейросетевая аппроксимация коэффициента алгоритма управления и предложено обнулять дельта-ошибку при выходе управления на ограничения. Данный подход реализован с помощью логистических функций и позволяет учитывать несимметричные ограничения. Однако он вычислительно затратен из-за необходимости использования нейронной сети. Во втором подходе управление ищется в виде аналитической функции с ограничениями. Получены условия устойчивости системы относительно нулевого положения, учитывающие ограничения на управляющее воздействие. Полученные алгоритмы обобщаются на многомерный объект, представленный в канонической форме. Предложенные алгоритмы отличаются высокой вычислительной эффективностью, они не требуют численных оценок ценности состояния и оптимизации управления с использованием нейронных сетей. Разработанные алгоритмы обеспечивают нахождение переменных состояния и управляющих воздействий в заданной области в процессе обучения, что позволяет применять их без предварительного обучения. Приводятся три численных примера синтеза и моделирования адаптивных систем управления. При этом один из примеров демонстрирует структурную настройку алгоритма управления.
Ключевые слова
Об авторах
М. Ю. МедведевРоссия
М. Ю. Медведев, д-р техн. наук, доц.
г. Таганрог
В. Х. Пшихопов
Россия
В. Х. Пшихопов, д-р техн. наук, проф.
г. Таганрог
И. М. Медведев
Россия
И. М. Медведев, студент
г. Таганрог
Список литературы
1. Sutton R., Barto A. Reinforcement Learning. An Introduction. London: The MIT Press, 2018.
2. Xu B., Yang C., Shi Z. Reinforcement Learning Output Feedback NN Control Using Deterministic Learning Technique // IEEE Transactions on Neural Networks and Learning Systems. 2014. Vol. 25, N. 3. P. 635—641. DOI: 10.1109/TNNLS.2013.2292704
3. Mu C., Ni Z., Sun C., He H. Data-driven tracking control with adaptive dynamic programming for a class of continuous-time nonlinear systems // IEEE Transactions on Cybernetics. 2016. Vol. 47, N. 6. P. 1460—1470. DOI: 10.1109/TCYB.2016.2548941
4. Wang A., Liao X., Dong T. Event-driven optimal control for uncertain nonlinear systems with external disturbance via adaptive dynamic programming // Neurocomputing. 2018. Vol. 281. P. 188—195. DOI: 10.1016/j.neucom.2017.12.010
5. Kim J. W., Oh T. H., Son S. H., Jeong D. H., Lee J. M. Convergence analysis of the deep neural networks based globalized dual heuristic programming // Automatica. 2020. Vol. 122. DOI: 10.1016/j.automatica.2020.109222
6. Luo B., Yang Y., Liu D., Wu H.-N. Event-Triggered Optimal Control With Performance Guarantees Using Adaptive Dynamic Programming // IEEE Transactions on Neural Networks and Learning Systems. 2020. Vol. 31, N. 1. P. 76—88. DOI: 10.1109/TNNLS.2019.2899594
7. Yang X., Xu M., Wei Q. Dynamic Event-Sampled Control of Interconnected Nonlinear Systems Using Reinforcement Learning // IEEE Transactions on Neural Networks and Learning Systems. 2024. Vol. 35, N. 1. P. 923—937. DOI: 10.1109/TNNLS.2022.3178017
8. Zhang H., Zhao X., Wang H., Zong G., Xu N. Hierarchical Sliding-Mode Surface-Based Adaptive Actor—Critic Optimal Control for Switched Nonlinear Systems With Unknown Perturbation // IEEE Transactions on Neural Networks and Learning Systems. 2024. Vol. 35, N. 2. P. 1559—1571. DOI: 10.1109/TNNLS.2022.3183991
9. Dong C., Chen L., Dai S.-L. Performance-Guaranteed Adaptive Optimized Control of Intelligent Surface Vehicle Using Reinforcement Learning // IEEE Transactions on Intelligent Vehicles. 2024. Vol. 9, N. 2. Pp. 3581—3592. DOI: 10.1109/TIV.2023.3338486
10. Dao P. N., Phung M. H. Nonlinear robust integral based actor—critic reinforcement learning control for a perturbed threewheeled mobile robot with mecanum wheels // Computers and Electrical Engineering. 2025. Vol. 121. P. 109870. DOI:10.1016/j.compeleceng.2024.109870
11. Wang D., Xin P., Ren J., Qiao J. Adaptive Critic Tracking Design for Data-Based Nonaffine Predictive Control // IEEE Transactions on Automation Science and Engineering. 2024. Vol. 21, N. 4. P. 5534—5545. DOI: 10.1109/TASE.2023.3313159
12. Berkenkamp F., Turchetta M., Schoellig A., Krause A. Safe model-based reinforcement learning with stability guarantees // Advances in Neural Information Processing Systems. 2017. Vol. 30. P. 908—918. DOI: 10.48550/arXiv.1705.08551
13. Han M., Zhang L., Wang J., Pan W. Actor-critic reinforcement learning for control with stability guarantee // IEEE Robotics and Automation Letters. 2020. Vol. 5, N. 4. P. 6217—6224. DOI: 10.1109/LRA.2020.3011351
14. Zhou Z., Liu A., Wang D. Improved adaptive-criticbased dynamic event-triggered control for non-affine systems // Mechatronics Tech. 2024. Vol. 1, N. 1. DOI: 10.55092/mt20230002
15. Cheng R., Orosz G., Murray R. M., Burdick J. W. Endto end safe reinforcement learning through barrier functions for safety critical continuous control tasks // The Thirty-Third AAAI Conference on Artificial Intelligence. 2019. P. 3387—3395.
16. Choi J., Castaneda F., Tomlin C. J., Sreenath K. Reinforcement learning for safety-critical control under model uncertainty, using control Lyapunov functions and control barrier functions // Conference Robotics: Science and Systems. 2020.
17. Карапеев А. Н., Косенко Е. Ю., Медведев М. Ю., Пшихопов В. Х. Исследование интеллектуального адаптивного алгоритма управления на базе метода обучения с подкреплением // Известия ЮФУ. Технические науки. 2025. № 2. С. 162—175. DOI: 10.18522/2311-3103-2025-2-162-175
18. Медведев М. Ю., Пшихопов В. Х., Евдокимов И. Д. Алгоритм робастного управления одномерным динамическим объектом на основе табличного Q-метода обучения с подкреплением // Информатика и автоматизация. 2025. Т. 24 (3). С. 717—744. DOI: 10.15622/ia.24.3.1
19. Боровик В. С., Шидловский С. В. Обучение с подкреплением в системах управления объектами с транспортным запаздыванием // Автометрия. 2021. Т. 57, № 3. С. 48—57. DOI: 10.15372/AUT20210306
20. Галяев А. А., Медведев А. И., Насонов И. А. Нейросетевой алгоритм перехвата машиной Дубинса целей, движущихся по известным траекториям // Автоматика и телемеханика. 2023. № 3. С. 3—21. DOI: 10.31857/S0005231023030017
21. Хапкин Д. Л., Феофилов С. В. Синтез устойчивых нейросетевых регуляторов для объектов с ограничителями в условиях неполной информации // Мехатроника, автоматизация, управление. 2024. Т. 25, № 7. С. 345—353. DOI: 10.17587/mau.25.345-353
22. Шашев Д. В., Шатравин В. В. Реализация сигмоидной функции активации с помощью концепции перестраиваемых вычислительных сред // Вестник Томского государственного университета. Управление, вычислительная техника и информатика. 2022. № 61. DOI: 10.17223/19988605/61/12
23. Гайдук А. Р., Медведев М. Ю., Пшихопов В. Х., Гисцов В. Г. Синтез неаффинных нелинейных систем управления на основе квазилинейных моделей // Мехатроника, автоматизация, управление. 2025. Т.26, № 5. С. 223—232. DOI: 10.17587/mau.26.223-232
24. Gaiduk A. R., Medvedev M. Y., Pshikhopov V. K. Design Method of Quasilinear Nonaffine Nonlinear Control Systems of General Structure // IEEE Transactions on Automation Science and Engineering. 2025. Vol. 22. P. 20208—20220. DOI: 10.1109/TASE.2025.3599894
25. Пятницкий Е. С. Управляемость классов лагранжевых систем с ограниченными управлениями // Автоматика и телемеханика. 1996. № 12. С. 29—37.
26. Пшихопов В. Х., Медведев М. Ю. Блочный синтез робастных систем при ограничениях на управления и координаты состояния // Мехатроника, автоматизация и управление. 2011. № 1. С. 2—8.
27. Медведев М. Ю. Синтез субоптимальных управлений нелинейными многосвязными динамическими системами // Мехатроника, автоматизация и управление. 2009. № 12. С. 2—8.
28. Бойчук Л. М. Метод структурного синтеза нелинейных систем автоматического управления. М.: Энергия, 1971.
29. Колесников А. А. Синергетическая теория управления. М.: Энергоатомиздат, 1994.
30. Kokotović P. V., Sussman H. J. A positive real condition for global stabilization of nonlinear systems // Systems Control Letters. 1989. Vol. 13. P. 125—133. DOI: 10.1016/0167-6911(89)90029-7
31. Zhang Y., Niu B., Zhao X., Duan P., Wang H., Gao B. Global predefined-time adaptive neural network control for disturbed pure-feedback nonlinear systems with zero tracking error // IEEE Transactions on Neural Networks and Learning Systems. 2023. Vol. 34, N. 9. P. 6328—6338. DOI: 10.1109/TNNLS.2021.3135582
Рецензия
Для цитирования:
Медведев М.Ю., Пшихопов В.Х., Медведев И.М. Алгоритмы адаптивного управления каскадными динамическими объектами на базе метода обучения с подкреплением. Мехатроника, автоматизация, управление. 2026;27(3):115-126. https://doi.org/10.17587/mau.27.115-126
For citation:
Medvedev M.Y., Pshikhopov V.Kh., Medvedev I.M. Adaptive Control Algorithms for Pure-Feedback Plants Based on the Reinforcement Learning Method. Mekhatronika, Avtomatizatsiya, Upravlenie. 2026;27(3):115-126. (In Russ.) https://doi.org/10.17587/mau.27.115-126
JATS XML

















.png)






