薛思远

B-Spline Policy

2026 年 7 月至 8 月 · 极智深诣公司实习

本人角色: 论文复现、模型训练与推理、仿真及真机实验、算法改进

2026 年 7 月至 8 月,我在极智深诣公司实习期间完成了这个具身智能 Demo。基于仿真环境和公司的真机实验场景,我尝试复现 Han、Xiong 等人的 B-spline Policy 研究,并针对复现中发现的问题进一步改进算法。这个项目让我从实践中了解了具身模型的训练、推理、机械臂控制,以及这些环节之间的工程衔接。下面展示模拟器中的不同速度结果,以及真机上动作片段切换时的平滑度对比。

模拟器结果

将 1×、2×、4× 三档模拟器结果放在一起比较:适度加速能带来明显的效率提升,但超过一定限度后,效果会适得其反。每个视频保留原始结果,可分别播放或下载。

1×

浏览器无法播放此视频时,可使用下方链接下载。
参考速度下的模拟器演示。下载视频

2×

浏览器无法播放此视频时,可使用下方链接下载。
提高执行速度后的模拟器演示。下载视频

4×

浏览器无法播放此视频时,可使用下方链接下载。
继续加速后的演示,观察加速过度带来的效果退化。下载视频

真机实验

B-Spline Policy 真机实验记录与片段衔接跳变对比:baseline 直接接管和 BSP 最近点接管的最大单关节跳变、14 关节 RMS 跳变均值及方差
真机实验:上方记录 4× 执行时的异步推理与控制状态;下方对比 baseline 直接接管与 BSP 最近点接管在动作片段衔接处的跳变。点击图片可放大查看。

这组真机数据中,BSP 最近点接管的两项跳变均值与方差均低于 baseline 直接接管,体现了更平滑的片段衔接。结果对应本次实验,不代表所有任务或速度设置下的表现。

相关资料

  • GitHub 仓库
  • B-spline Policy 论文 · Han、Xiong 等