<?xml version="1.0" encoding="UTF-8"?>
<article xmlns:xlink="http://www.w3.org/1999/xlink" article-type="research-article" dtd-version="1.3" xml:lang="zh-CN">
  <front>
    <journal-meta>
      <journal-title-group><journal-title>南太湖新工科产业学报</journal-title></journal-title-group>
      <issn>3136-2249</issn>
      <publisher><publisher-name>求真学术出版</publisher-name></publisher>
    </journal-meta>
    <article-meta>
      <article-id pub-id-type="publisher-id">3d8bdd59-3404-4015-904e-c821fc8b2b12</article-id>
      <article-id pub-id-type="doi">10.68249/jstnei.2026.0016</article-id>
      <elocation-id>0016</elocation-id>
      <title-group><article-title>四足机器人单目视觉循迹与强化学习步态控制方法研究</article-title></title-group>
      <contrib-group>
        <contrib contrib-type="author" corresp="yes"><name><surname>葛景仲</surname></name><aff>北华航天工业学院电子与控制工学院</aff></contrib>
        <contrib contrib-type="author"><name><surname>关皓轩</surname></name><aff>北华航天工业学院电子与控制工学院</aff></contrib>
        <contrib contrib-type="author"><name><surname>李思奇</surname></name><aff>北华航天工业学院电子与控制工学院</aff></contrib>
      </contrib-group>
      <pub-date publication-format="electronic"><year>2026</year><month>8</month><day>29</day></pub-date>
      <volume>1</volume><issue>2</issue>
      <fpage>18</fpage><lpage>24</lpage>
      <abstract><p>为解决四足机器人在结构化赛道环境下的自主循迹问题，提出一种“视觉循迹—强化学习步态”分层控制方法。上层以单目图像为输入，经颜色区间阈值分割得到赛道二值图，用三点模板逐行扫描左右边界并以行间连续性筛选有效行，取中线均值构造横向偏差，再由横移—转向复合比例控制律解算机体速度命令；同时以彩色路标掩膜像素数为触发量完成任务切换。下层将步态生成建模为马尔可夫决策过程，以本体感受与上层速度命令构成观测、以关节目标位置为动作，设计含速度跟踪与多项约束的加权奖励，采用近端策略优化在并行仿真中训练策略网络，再经域随机化迁移至实机以50Hz前向推理。两层以机体速度命令为唯一接口，实现感知语义与全身动力学的解耦。对现场采集的64幅图像离线复算表明：赛道中线提取成功率100%，平均有效中线点数136.2（上限150），横向偏差均值46.4px；5类彩色路标掩膜像素数最小值为3614，达触发阈值的7.2倍，检出率100%，判决裕度充分，所取控制增益与底层指令限幅相容。</p></abstract>
      <kwd-group><kwd>四足机器人</kwd><kwd>单目视觉循迹</kwd><kwd>中线提取</kwd><kwd>强化学习</kwd><kwd>步态控制</kwd></kwd-group>
      <permissions><license><license-p>CC BY-NC-ND 4.0</license-p></license></permissions>
      <self-uri xlink:href="https://www.qiuzhenpress.com/articles/jstnei-2026-0016" />
    </article-meta>
  </front>
  <back>
    <ref-list>
      <ref id="R1"><mixed-citation>[1] 王旭.四足机器人运动及稳定控制关键技术综述[J].吉林大学学报(工学版),2025,55(5):1483-1496.</mixed-citation></ref>
      <ref id="R2"><mixed-citation>[2] 唐力强,韦宇轩,胡海东,等.基于深度强化学习的月面四足机器人控制方法综述[J].空间控制技术与应用,2025,51(5):1-15.</mixed-citation></ref>
      <ref id="R3"><mixed-citation>[3] HWANGBO J, LEE J, DOSOVITSKIY A, et al. Learning agile and dynamic motor skills for legged robots[J].Science Robotics,2019,4(26):eaau5872.</mixed-citation></ref>
      <ref id="R4"><mixed-citation>[4] MIKI T, LEE J, HWANGBO J, et al. Learning robust perceptive locomotion for quadrupedal robots in the wild[J].Science Robotics,2022,7(62):eabk2822.</mixed-citation></ref>
      <ref id="R5"><mixed-citation>[5] 岳俊峰,李秀梅.基于机器视觉的智能小车自动循迹及避障系统[J].杭州师范大学学报(自然科学版),2020,19(2):200-207.</mixed-citation></ref>
      <ref id="R6"><mixed-citation>[6] HUANG A S, OLSON E, MOORE D C. LCM: lightweight communications and marshalling[C]//2010 IEEE/RSJ International Conference on Intelligent Robots and Systems.Taipei:IEEE,2010:4057-4062.</mixed-citation></ref>
      <ref id="R7"><mixed-citation>[7] SCHULMAN J, WOLSKI F, DHARIWAL P, et al. Proximal policy optimization algorithms[EB/OL].(2017-08-28)[2026-08-18].https://arxiv.org/abs/1707.06347.</mixed-citation></ref>
      <ref id="R8"><mixed-citation>[8] RUDIN N, HOELLER D, REIST P, et al. Learning to walk in minutes using massively parallel deep reinforcement learning[C]//Proceedings of the 5th Conference on Robot Learning.London:PMLR,2022:91-100.</mixed-citation></ref>
    </ref-list>
  </back>
</article>
