随着LLM和VLM的兴起与发展,同样需要生成长序列的VLA自然水涨船高。本文作为笔记,希望记录个人初识VLA的过程与其大致的发展与挑战。
0.原理
ACT作为VLA的开山之作之一,提出了分块生成长序列的操作,可以说是借助Transformer的东风把机器人智能拉上了车。原文链接:arxiv.org/pdf/2304.13705

ACT提出使用Transformer作为CAVE,投喂机器人关节空间信息和动作序列,生成压缩后的z。推理时再使用z(文中z=0)和关节信息解压缩成未来可能的动作序列。同样的,单纯的生成恰好的动作序列会导致衔接处出现卡壳。所以作者朴素的使用了加权平均。
ACT同样提出了机器人使用主动臂遥操作的好处,相比于VR手柄精度更高,相比于脚本省时省力。
1.环境
个人使用Lerobot学习ACT的操作。Lerobot比较无脑好上手,很适合学习。
一般建议使用Linux系统,我这边使用的是双系统(Win+Ubuntu),后来Win也安装了wsl。建议所有经常接触python的都下一个miniconda/anaconda,管理很方便(
然后就是pull仓库,pip install,记得换清华源
个人电脑CPU缩缸,导致运算时经常出现段错误。如果有一样的问题可以考虑外部散热和降频,跑模型对CPU要求不会那么高
2.设备,校正
舵机校正使用Feetech舵机和调试工具,Linux上不全,建议还是Windows,本来训练也可以上服务器的,推理上Linux就行
Lerobot校正时注意Lerobot校正的时候不要超过越界0~4096的情况,如果出现了那就再进行一次中位校正吧。以及Lerobot校正时可能会出现机械臂抽风的情况,建议把机械臂放在一个平面上。
个人只有一个不锈钢台子,固定时注意台子的上台面下台面是不是平齐的,有的桌子下台面是镂空的需要垫东西。木桌子可以打孔,应该好得多(本科生没有实验室的痛)
3.遥操作

遥操作没有想象的那么有趣(,记得安装好摄像头,摄像头的序号可能不是连续的。总的来说这段没有太多问题,唯一要注意的是录制时不要出现主动臂。
这个软件挺炫酷的
HuggingFace的上传则比较麻烦,由于科学上网的一些端口问题,个人还是直接把token写到bashrc里了。手动上传其实也是很好很适合科学上网的。
4.训练与推理
没啥好说的,Lerobot很傻瓜,租一个服务器即可。建议featurize.cn,方便个人使用。有实验室的话就实验室吧,我只是一个穷本科生(
5.未来的挑战
无论是ACT还是DP(扩散策略)都是早期对单个任务的探索,然而事至如今的探索仍未达到比较高水平的泛化。目前几条路线有:1.多层模型,大脑+小脑。2.数据集开发,第一人称视角视频用于学习,让数据飞轮转起来。3.融入世界模型,早期用于生成数据,未来可能直接用于机器人决策;4.强化学习,目前对强化学习的探索较少,多为模仿学习。路线繁多说明了机器人智能的未来可期,没有一条路线是被证明不可能的。
评论(0)
暂无评论