国内刊号:32-1668/N
国际刊号:1671-7775
发布日期:
作者:刘向武,刘久富,解晖,徐清雯,范胜林
单位:南京航空航天大学 自动化学院, 江苏 南京 211106
关键词:路径规划, 强化学习, 贝叶斯优化, 贝叶斯求积, 避免碰撞
基金:国家自然科学基金资助项目(61473144)
针对智能体在环境信息未知情况下与障碍物碰撞将会产生巨大成本的问题,提出一种基于贝叶斯优化与求积的鲁棒强化路径规划算法.首先建立环境的栅格地图,设置环境奖励函数.其次根据历史动作集,采用贝叶斯优化建立高斯过程代理模型,奖励的均值和方差由高斯过程进行估计,选择置信区间上界(upper confident bound, UCB)方法来平衡探索和开发,选择动作序列,从而避免探索过度和开发过度.然后利用贝叶斯求积方法主动对环境进行学习,通过最小化Q值期望的后验方差来减小环境信息的不确定性,以达到避免碰撞、提高鲁棒性的目的.再迭代更新Q表,使用Q学习方法规划路径.最后对该算法与经典的Q学习路径规划算法进行仿真试验对比.结果表明:该算法对环境学习效率更高,发生碰撞的概率更小,最优路径步数收敛速度更快,能够更有效地实现路径规划.
来源:2025年第5期
《江苏大学学报(自然科学版)》期刊编辑部