文章正式出版即时开放获取 (CC BY-NC-ND 4.0)
四足机器人单目视觉循迹与强化学习步态控制方法研究
论文摘要
为解决四足机器人在结构化赛道环境下的自主循迹问题,提出一种“视觉循迹—强化学习步态”分层控制方法。上层以单目图像为输入,经颜色区间阈值分割得到赛道二值图,用三点模板逐行扫描左右边界并以行间连续性筛选有效行,取中线均值构造横向偏差,再由横移—转向复合比例控制律解算机体速度命令;同时以彩色路标掩膜像素数为触发量完成任务切换。下层将步态生成建模为马尔可夫决策过程,以本体感受与上层速度命令构成观测、以关节目标位置为动作,设计含速度跟踪与多项约束的加权奖励,采用近端策略优化在并行仿真中训练策略网络,再经域随机化迁移至实机以50Hz前向推理。两层以机体速度命令为唯一接口,实现感知语义与全身动力学的解耦。对现场采集的64幅图像离线复算表明:赛道中线提取成功率100%,平均有效中线点数136.2(上限150),横向偏差均值46.4px;5类彩色路标掩膜像素数最小值为3614,达触发阈值的7.2倍,检出率100%,判决裕度充分,所取控制增益与底层指令限幅相容。
参考文献
- [1]王旭.四足机器人运动及稳定控制关键技术综述[J].吉林大学学报(工学版),2025,55(5):1483-1496.
- [2]唐力强,韦宇轩,胡海东,等.基于深度强化学习的月面四足机器人控制方法综述[J].空间控制技术与应用,2025,51(5):1-15.
- [3]HWANGBO J, LEE J, DOSOVITSKIY A, et al. Learning agile and dynamic motor skills for legged robots[J].Science Robotics,2019,4(26):eaau5872.
- [4]MIKI T, LEE J, HWANGBO J, et al. Learning robust perceptive locomotion for quadrupedal robots in the wild[J].Science Robotics,2022,7(62):eabk2822.
- [5]岳俊峰,李秀梅.基于机器视觉的智能小车自动循迹及避障系统[J].杭州师范大学学报(自然科学版),2020,19(2):200-207.
- [6]HUANG A S, OLSON E, MOORE D C. LCM: lightweight communications and marshalling[C]//2010 IEEE/RSJ International Conference on Intelligent Robots and Systems.Taipei:IEEE,2010:4057-4062.
- [7]SCHULMAN J, WOLSKI F, DHARIWAL P, et al. Proximal policy optimization algorithms[EB/OL].(2017-08-28)[2026-08-18].arxiv.org
- [8]RUDIN N, HOELLER D, REIST P, et al. Learning to walk in minutes using massively parallel deep reinforcement learning[C]//Proceedings of the 5th Conference on Robot Learning.London:PMLR,2022:91-100.
出版声明与信息公开
基金项目:北华航天工业学院创新资助项目“基于四足机器人的复杂地形适应性优化及强化学习算法研究”(YKY-2026-037)
利益冲突声明:作者声明不存在利益冲突。
数据可用性:相关研究数据可在合理学术要求下向通讯作者索取。
版权与许可:© 2026 作者与 求真学术出版有限公司 · CC BY-NC-ND 4.0
标准学术引用格式
葛景仲, 关皓轩, 李思奇. 四足机器人单目视觉循迹与强化学习步态控制方法研究[J]. 南太湖新工科产业学报, 2026, 1(2): 18-24。https://doi.org/10.68249/jstnei.2026.0016