|
|
|
|
|
AISY | 华南理工大学喻婷婷团队:基于深度强化学习与路径规划协同的微型机器人自适应自主控制 |
|
|


研究背景:
微型机器人因其体积小、可无线操控等特性,在生物医学(如靶向药物递送、微创手术)及环境修复领域展现出巨大的应用潜力。然而,在人体血管等复杂、动态且受限的微环境中实现微型机器人的精确运动控制,一直是制约其临床应用的关键瓶颈。传统的控制方法往往依赖于精确的物理建模,但在微观尺度下流体动力学复杂,难以建立准确模型。近年来兴起的深度强化学习(DRL)技术为解决这一难题提供了新思路,但直接在物理系统中训练 DRL 往往面临样本效率低、训练时间长以及设备磨损大等挑战 。因此,探索一种既能提高训练效率,又能适应动态环境变化的智能控制策略,具有重要的科学意义和应用价值。

文章概述:
近日,由华南理工大学喻婷婷副教授领导的科研团队提出了一种数据驱动的自适应自主控制框架,显著提升了磁性微型机器人在复杂动态环境中的导航能力。该技术结合了监督学习、无模型深度强化学习(DRL)与经典 A* 路径规划算法。团队首先在物理环境中利用软演员-评论家(SAC)算法收集有限的交互数据,训练出一个监督人工神经网络(SuANN)作为替代环境(Surrogate Environment),以此模拟微型机器人与环境的动力学交互。随后,在 SuANN 中高效训练截断分位数评论家(TQC)算法,并将其与 A* 路径规划器集成。实验结果表明,该方法将物理环境中的训练时间从约 35 小时大幅缩减至约 7 小时,物理数据需求减少 50% 以上。相比基准模型,该框架将轨迹偏差降低了 30.69%,任务完成速度提升了 23.43%,并成功在模拟毛细血管、动态障碍物及移动目标等高难度场景中实现了100% 的导航成功率。该研究为微型机器人的智能化与自主化控制提供了新的范式。
图文导读:
图1 a. 闭环控制流程图。系统通过图像处理获取环境信息,A* 算法生成全局路径及局部航点(Waypoints),DRL 算法根据航点生成磁场控制信号,驱动微型机器人运动。 b. 微型机器人导航系统的自主性分级。本研究处于“自适应控制”层级,操作者仅需指定目标,感知、规划与控制均由系统自主完成。

图1.DRL-A* 控制系统架构与自主性分级
图2 a-c. 微型机器人在动态障碍物、移动目标以及二者共存的极端环境下的导航轨迹。实验显示,集成的 A* 路径规划算法能实时重构路径(重规划时间约 0.002s),配合 TQC 控制器的高精度追踪,使微型机器人能够灵活“追逐”动态目标并规避突发障碍,表现出极强的鲁棒性与适应性。

图2.动态复杂环境中的导航性能验证
结论:
团队提出了一种基于深度强化学习的训练策略的自适应自主控制框架,用于解决微型机器人控制中样本效率低与环境适应性差的难题。该框架利用 SuANN 高精度模拟物理环境,极大地降低了 DRL 算法在物理系统上的训练成本。通过将全局路径规划(A*)与局部高频控制(TQC)有机结合,实现了微型机器人在复杂动态环境(如模拟血管)中的稳定导航。研究成果不仅大幅提升了控制精度与响应速度,更为未来微型机器人在体内靶向给药等实际医疗场景中的应用奠定了坚实的技术基础。
该项目研究获得国家自然科学基金(52405474)、中央高校基本科研业务费(2024ZYGXZR076)及广东省基础与应用基础研究基金(2022A1515110906)等项目的资助,谨此感谢。
论文信息:
Adaptive Autonomy in Microrobot Motion Control via Deep Reinforcement Learning and Path Planning Synergy
Amar Salehi, Bairong Zhu, Haoyu Liu, Tingting Yu*
Advanced Intelligent Systems
DOI:10.1002/aisy.202501053
原文链接:https://advanced.onlinelibrary.wiley.com/doi/10.1002/aisy.202501053
期刊简介:

Advanced Intelligent Systems是Wiley旗下智能系统领域开放获取旗舰刊。期刊收录关于具有刺激或指令响应智能的人造装置系统的研究,包括机器人、自动化、人工智能、机器学习、人机交互、智能传感和程序化自组装等前沿应用。

特别声明:本文转载仅仅是出于传播信息的需要,并不意味着代表本网站观点或证实其内容的真实性;如其他媒体、网站或个人从本网站转载使用,须保留本网站注明的“来源”,并自负版权等法律责任;作者如果不希望被转载或者联系转载稿费等事宜,请与我们接洽。