AI机器人三大突破:会写代码、有记忆、看懂铰链
AI技术

AI机器人三大突破:会写代码、有记忆、看懂铰链

机器人想变聪明,光靠堆数据不够。最近arXiv上三篇论文各走了一条路:让大模型直接写控制代码、给机器人配一块轻量记忆、从几张单目照片里还原关节结构。方向不同,问的是同一件事:怎么让机器人在没见过的场景里也别掉链子。

第一篇讲Coding Agent。思路很直白:语言模型不输出动作,它输出一段程序当控制器,机器人照着跑。这类agent不用专门做机器人训练,也能操作真机。难点在安全,作者就加了一层障碍感知框架,代码执行前先把可能撞上障碍的指令拦下来。代码写错可以重来,机械臂撞上去没得撤销。

第二篇盯的是记忆。复杂操作得记住之前发生过什么,可要把完整历史一股脑喂给策略网络,模型容易学到假关联,性能反而下滑。Workspace Models用显著性监督,只留真正重要的那部分信息,把记忆做轻。相当于给机器人一张便签纸,不是一整本日记。

第三篇FAMOS解决的是另一类问题:从稀疏单目视角重建可动关节物体。每次观察只能看到局部几何和运动线索,多数前馈方法都猜不准。FAMOS用前馈网络,从少量观测直接推断关节结构,省掉逐物体的优化过程,速度快、部署也轻。

三篇放一起看,路子是一致的:机器人学习和LLM工程在互相渗透,一边是程序化控制加安全约束,一边是记忆和三维感知的轻量化。不指望一个通用大模型包打天下。每个环节做扎实。