Computational Design of Terrestrial Robots with Anisotropic Friction
Tsinghua University; Shanghai Qi Zhi Institute; Carnegie Mellon University
一句话总结
针对给定拓扑的地面机器人,本文提出一套”仿真—协同优化—制造”的计算设计流水线,用信赖域方法把各体节各向异性摩擦的朝向与神经网络控制器一起优化出来,让机器人靠摩擦实现蛇行、转向、滑雪等运动。
研究背景
- 领域现状:蛇、蜥蜴等许多陆生动物靠各向异性摩擦(沿不同方向摩擦系数不同)产生推进力完成高效运动,仿生机器人也常给蛇形机器人贴上带方向性的鳞片。机器人协同设计(co-design)领域已有不少工作联合优化形态(连杆-关节结构、形状)与控制。
- 核心痛点:现有协同设计几乎只优化”结构”,很少考虑摩擦分布,尤其是各向异性摩擦的设计;而摩擦与控制之间存在复杂耦合。这类问题通常是双层优化:要评价一个摩擦设计的好坏,必须先为它从头训练一个控制器(昂贵的强化学习),在外层优化循环里反复重训代价高到不可承受。
- 本文 idea:借鉴信赖域方法,把摩擦设计的更新限制在一个动态局部区域内。因为摩擦只做小幅改动,机器人动力学变化平缓,上一轮训好的控制器就能作为可靠的”热启动”,只需少量微调而非完整重训,从而打破双层优化的评价瓶颈。
方法
整体框架分四个阶段:设计(Design)确定各连杆各向异性摩擦剖面与朝向、以及作用在关节上的控制器;仿真(Simulation)用定制的物理仿真器评估运动表现;优化(Optimization)用两层框架交替做信赖域摩擦优化与强化学习控制优化;制造(Fabrication)测量 3D 打印鳞片的摩擦特性,装配机器人并部署学到的闭环策略做真机实验。
flowchart LR
A["设计: 摩擦剖面朝向 d + 控制器 w"] --> B["定制 MuJoCo 仿真: 各向异性摩擦 + LCP 接触"]
B --> C["信赖域协同优化: 交替更新 d 与共享控制器"]
C -->|"迭代直到收敛"| A
C --> D["制造与真机部署: 3D 打印鳞片 + 闭环控制"]
关键设计:
- 摩擦设计空间——只优化朝向。 每个连杆的摩擦剖面用”8 点雷达图”描述,即接触面上间隔 45 度的 8 个方向摩擦系数。作者从大量仿真与硬件实验中发现:旋转整个摩擦剖面的方向,比扰动 8 个分量对运动影响大得多(连杆剖面转一个角度,轨迹大约也偏转同样角度)。因此固定剖面形状,只给每个连杆赋一个朝向 \(d_i \in [0, 2\pi)\),设计变量即所有连杆的朝向集合 \(\boldsymbol{d} = \{d_i \mid V_i \in V\}\),大幅提升优化效率。
- 各向异性摩擦仿真。 以 MuJoCo 为骨架,但其 3.3.0 版本不支持这种摩擦剖面,作者在其半隐式欧拉积分中覆写摩擦力项:碰撞检测后对每个接触点求接触速度与法向力,再按最大耗散原理求解各向异性摩擦力 \(\boldsymbol{f}_c = \arg\min_{\boldsymbol{f} \in \mathcal{F}} \boldsymbol{v}_c \cdot \boldsymbol{f}\),作为显式力加入动力学。他们复现了各向异性摩擦的反直觉现象:受等大不同方向冲量的方块,轨迹会朝低摩擦方向弯曲,摩擦力不一定与速度方向相反,以此验证模块正确。
- 信赖域机器人协同优化(核心贡献)。 优化问题是双层的:外层选朝向 \(\boldsymbol{d}^* = \arg\max_{\boldsymbol{d}} f(\boldsymbol{d}, \pi^*_{\boldsymbol{d}})\),内层为该设计求最优控制器 \(\pi^*_{\boldsymbol{d}} = \arg\max_{\pi} f(\boldsymbol{d}, \pi)\)。二者自由度极不平衡:连杆数通常小于 20,控制器参数却常超过 2 万维。每轮迭代中,围绕当前最优摩擦参数从其邻域采样候选设计,用新摩擦下生成的运动数据做少量 PPO 微调控制器,再对新的”设计—控制器”对打分。连续成功达到 \(\delta_{succ}\) 次就把信赖域边长翻倍,连续失败达到 \(\delta_{fail}\) 次就减半;每次协同优化重复 \(n\) 次。
- 与信赖域贝叶斯优化(TRBO)的区别。 标准 TRBO 仍把控制优化当黑箱、在每个采样点内部重训控制器。本文把控制器从采样点里剥离出来,将其作为信赖域模型的一部分在整个优化过程中逐步更新——正是这个”共享控制器 + 只做微调”的改造带来了效率与性能的双重提升。
实验结果
评测用三个拓扑分别形似字母 “S”“I”“Y” 的机器人做点导航任务:随机在头部朝向约一个身长处设目标,到达后再生成新目标。每个连杆的 8 个摩擦系数取自 \(\{0.2, 1.0\}\) 二值集合以模仿动物鳞片。所有方法都训练 1000 万控制步(50 亿仿真步),每种方法在每个机器人上跑 3 个随机种子。对比的是运动速度随训练进程的变化,主要结论如下。
| 对比方法 | 类型 | 相对本文的表现 |
|---|---|---|
| 本文(信赖域协同设计) | 双层 + 信赖域 | 三个机器人上整体最优,部分提升显著 |
| BO + RL | 朴素双层 | 明显弱于本文,凸显信赖域的价值 |
| BodyGen / BodyGen-MLP | SOTA 联合优化 | 具竞争力但整体不及本文双层方法 |
| LLM-GPT-5 / LLM-Qwen3 | 大模型驱动 | 意外地强,有时超过 SOTA 协同设计方法 |
一个有意思的发现是:尽管对 LLM 的用法很”粗暴”(把当前问题上下文写进提示,让模型直接给摩擦调整建议),GPT-5 与 Qwen3 仍表现出很强竞争力,作者据此主张机器人协同设计研究应把 LLM 当作强基线看待。此外,没有任何单一方法在三个机器人上都占优,说明该协同优化问题本身的复杂性,各机器人的字母拓扑可能天然偏好不同算法。
下游示例进一步验证流水线:I 型机器人在 2D 栅格迷宫中用 BFS 生成目标序列,完成含直线蛇行与急转 U 弯的平滑导航;S 型机器人做非抓取式物体操纵(胶囊、立方体、哑铃、T 形、俄罗斯 Z 形),学出”围笼”“推挤”等随状态灵活切换的策略,并让部分连杆低阻力、部分作为高摩擦”虚拟锚点”;3D 双滑板机器人在倾斜不平地形上滑雪,摩擦朝向出现高达 103 度的重定向以实现急转加精准急停。真机方面,作者 3D 打印并测量了 55 种鳞片:各向同性鳞片的三连杆机器人几乎无法前进或转向,而部署优化后的各向异性鳞片(如转向任务各连杆朝向 256/138/95 度)后,机器人能有效前进、转向、并跟踪直线上的点;对朝向做最多 10 度随机扰动时,转角从 122 度平均只降到 112 度,表明对小制造误差鲁棒。
亮点与局限
- 亮点:
- 据作者所述是首个针对”各向异性摩擦 + 控制”协同设计的计算流水线,填补了协同设计只关注结构的空白。
- 把信赖域方法引入机器人协同设计,用”共享控制器 + 微调”绕开每个候选都要重训控制器的双层优化瓶颈,简单却有效。
- 覆盖仿真到真机的完整闭环:定制 MuJoCo 各向异性摩擦模块、55 种鳞片测量、真机验证,且发现了不走寻常蛇行、靠扭身侧移的非常规步态。
- 指出 LLM 驱动协同设计是被低估的强基线,给出有价值的实验证据。
- 局限:
- 只优化给定拓扑下摩擦剖面的朝向,既不优化拓扑,也不优化自由形态的摩擦剖面本身,设计空间受限。
- 对 LLM 的用法尚属初步(直接提示、暴力式),未挖掘更高级的使用方式。
- 真机的连杆与关节类型有限,任务也主要集中在运动,尚未拓展到更广的结构与任务。
延伸思考
这项工作把”摩擦”这一常被当作固定环境参数的量,变成了可协同优化的设计变量,思路上与可微仿真驱动的软体游泳/多旋翼计算设计一脉相承,但把落点放在接触主导的地面运动。信赖域”共享并微调控制器”的做法,本质是在形态-控制双层优化中用局部性换取控制器复用,这个思想或许可推广到更一般的形态协同设计(如同时优化连杆形状与摩擦),关键在于如何度量设计改动导致的动力学漂移是否仍在控制器可迁移的范围内。另一个值得追问的方向是 LLM 基线为何”粗暴却有效”——它究竟是在利用问题的低维结构(朝向数量少),还是提供了某种隐式的先验,这对如何设计更强的 LLM 协同设计器有直接启发。