物理AI的前沿探索,正在加利福尼亚州圣莱安德罗的一个仓库里以一场积木游戏的方式展开。
这个仓库属于Encord公司,一家专门构建用于训练AI模型的数据工具的企业。安德鲁·塞哈(Andrew Ceja)是该公司的"飞行员"——这是Encord对机器人训练师的内部称谓——他头戴一顶配有摄像头的头盔,正小心翼翼地从摇摇欲坠的积木塔中抽取木块。头盔上的摄像头会追踪他的视线,这在***集机器人训练数据时已相当常见。但这顶头盔还额外配备了传感器,能够在他拆解积木塔的过程中实时测量他的脑电波。
Encord是一批数量不多、但正在快速增长的初创企业之一。这些企业押注认为,人形机器人与仓储机器人领域真正的瓶颈,不在于模型架构,而在于现实世界物理训练数据的严重匮乏。Encord不只是帮助机器人公司管理已有数据,而是将业务重心放在"制造"那些尚不存在的数据上。
塞哈头戴的脑电波头盔由德国神经科学初创公司Zander Labs研发。该公司相信,通过测量大脑活动来推断"出错""意图""惊讶"等心理状态,能够为模型训练提供更具价值的数据集。Encord与Zander的合作目前仍处于试验阶段——Encord表示,此次的目标是先构建一个带有脑电波标注的初始数据集,再将其导入客户的机器人模型中,评估是否真正提升了性能,然后再决定是否扩大规模。
负责督导此项工作的Zander神经科学家卢卡斯·格尔克(Lucas Gehrke)表示,在特定任务的不同执行阶段,大脑活动的强度变化能够为模型构建者提供重要线索,帮助他们判断何时需要调用算力最高的模型。
Encord机器人学习负责人维内特·维尔穆鲁甘(Vineeth Velmurugan)将此称为解决机器人数据瓶颈问题的"前沿探索"。他曾任职于OpenAI机器人实验室及仓储自动化公司Berkshire Grey,加入Encord后主导组建了公司内部的数据创建团队。
Encord最初成立时,是为构建机器视觉应用的公司提供数据标注和模型评估服务。随着客户——维尔穆鲁甘表示公司与多家领先机器人企业合作,但不便透露具体名称——开始将端到端学习应用于机器人操作任务,公司管理层意识到,他们必须自行生产训练数据,而不只是做数据的"搬运工"。"这些数据根本不存在,"维尔穆鲁甘说。
生成式AI能否像改变聊天机器人领域那样改变机器人领域,这一愿景不断撞上同一堵墙。大语言模型是在整个互联网乃至更广泛的文本数据上训练而来的,但要找到同等量级的原材料来教会神经网络理解物理操作,难度极大:自动驾驶公司自己***集数据,但这种方式难以规模化;从***中训练有一定可行性,但其精度远不及真实世界的数据。维尔穆鲁甘估计,突破这一瓶颈所需的数据集,规模大约是YouTube***库的五倍——这一体量足以解释为何数据生成本身已从研究问题演变为一门商业生意。
目前,机器人"大脑"的构建者主要依赖两大数据来源:一是工人佩戴摄像头***集的"自我中心视角"(Egocentric)***,通常辅以多角度摄像和其他指标;二是通过远程操控机器人***集的数据。Encord两者兼顾,既从全球多家工厂***集自我中心视角数据,也利用圣莱安德罗的设施探索脑电波等新数据模态,或***集特定技能的数据用于模型微调。
TechCrunch到访时,"飞行员"们正在使用"主从机械臂"——一套配对机械臂,一只由人类操作员直接控制,另一只同步模仿其动作——来生成诸如从咖啡壶向杯中倒咖啡(液体晃动明显)、叠放***筹码等任务的数据。"每一家人形机器人公司都向我们要过这些数据,"维尔穆鲁甘说。
储物架上摆满了装在花瓶里的人造花、书籍、塑料蔬菜、猫砂盆和铲子、各种线缆捆包——这些都是训练机器人完成家务任务的标准"道具"。
在其中一个工位,另一位"飞行员"索菲亚·因凡特(Sofia Infante)正操控机械臂,将网线插入服务器背面再拔出——这是数据中心运营商梦寐以求实现自动化的操作,前提是机器人能具备足够的精准度。亲自上手体验后,我切实感受到了这一目标为何仍遥不可及:夹爪的灵活度远不及人类手指,手臂的自由度也无法与人类相比。
Encord目前还在开发另一种新型数据***集方式:将一组传感器绑在前臂上,用于检测肌肉中的电信号。用于拍摄人手操作物体的***,往往无法完整捕捉手部全貌,而维尔穆鲁甘希望借助手臂传感器,构建出手部在任意时刻的三维位置图,从而让模型对手部动作形成更全面的理解。
Encord的数据集会附加文字描述标注,说明每段***的具体内容,例如"右手拧紧螺栓",帮助基于大语言模型的模型理解***中发生的事情。维尔穆鲁甘估计,这种精细标注对于训练特定任务的价值,是"粗糙自我中心数据"的100倍,而其生产成本仅高出约20倍,从账面上看是一笔划算的买卖。
但"高出20倍"依然意味着真实的资金投入,这正是问题所在:大语言模型的构建者从互联网上抓取文本,从Stack Overflow等网站批量获取数据,成本几乎可以忽略不计。而生成物理训练数据的成本则截然不同——这是物理AI与大语言模型类比的根本局限。这类数据必须被"制造"出来,而不仅仅是"收集",这从根本上改变了构建此类模型的经济逻辑。
维尔穆鲁甘表示,进展正在稳步推进。凭借Encord在行业内的广泛视野,他能够观察到初创公司和前沿实验室各自在摸索哪些方法有效、哪些行不通,以持续改进物理AI模型。这种"置身于多家机器人公司之间"的位置,也是Encord的核心竞争力之一——它能够在任何单一客户察觉之前,率先发现哪些数据技术正在行业层面获得认可。
这也将让Encord设施里的十余位"飞行员"持续保持忙碌状态。因凡特和塞哈都是这支正在快速壮大的神经网络基础数据构建队伍中的一员,此前两人均供职于另一家AI数据标注公司Scale,后来加入Encord。
塞哈曾在一家废物管理公司工作,凭借对技术的热情,他当时负责维护一台机器人垃圾分拣机的正常运转。如今,当积木塔轰然倒下,他说自己很享受为机器人解决训练任务的挑战——"每天都有新鲜事!"
Q&A
Q1:Encord公司为什么要***集脑电波数据来训练机器人?
A:Encord认为,物理AI领域当前最大的瓶颈不是模型架构,而是高质量训练数据的严重匮乏。与Zander Labs合作引入脑电波***集,是为了在训练数据中加入"出错""意图""惊讶"等人类心理状态的标注,帮助机器人模型更精准地判断何时需要调用高算力推理,从而提升整体性能。目前这一方案仍处于试验阶段,需评估实际效果后才会决定是否扩大规模。
Q2:物理AI训练数据为什么这么难获取,和大语言模型有什么区别?
A:大语言模型可以从互联网上海量抓取文本数据,成本极低。但物理AI需要的是真实世界中的操作数据,这类数据无法从现有***中直接获取,必须专门"制造"——包括让人穿戴摄像头***集自我中心视角***、远程操控机械臂录制动作数据等。Encord估计,突破现有瓶颈所需的数据集规模约为YouTube***库的五倍,生产成本远高于文本数据,这从根本上改变了构建物理AI模型的经济逻辑。
Q3:Encord的数据标注方式有什么特别之处?
A:Encord除了***集***外,还会对每段***进行精细的文字描述标注,例如"右手拧紧螺栓",帮助基于大语言模型的机器人模型理解***内容。此外,公司还在探索前臂肌肉电信号传感器,通过捕捉肌肉电活动构建手部三维位置模型,弥补***无法完整记录手部动作的不足。维尔穆鲁甘估计,这种精细标注数据的训练价值是普通粗糙数据的100倍,尽管生产成本也高出约20倍。返回搜狐,查看更多