行业 · 为人工智能采集数据
机器没见过一双手是怎么干活的,眼镜让它看见了
这一页里几乎全是数据集,而不是产品。第一人称的人类视频,正是机器人学习一直缺的东西,而眼镜是最便宜的录制方式。这里还写了亚马逊发布配送员眼镜的那一天,以及中国厂商共同签下的那份公约。
机械臂可以靠遥操作来教:人来操纵,机器照做。这条路走得通,但又慢又贵,因为每一分钟训练都要有人坐在操作台前付出一分钟。另一条路,是录下一个人用自己的双手、从自己的眼睛出发完成任务的过程,让模型从中学习。二十年来,没有人拥有规模化的这类素材。带摄像头、眼动追踪和手部追踪的眼镜,是它开始存在的方式。
Meta 的 Project Aria 是这台发动机里看得见的部分。它不对外销售:Meta 把眼镜借给研究伙伴,目前有 290 多家伙伴在 27 个国家运行 1000 多台设备,累计记录超过 8000 小时。由此产生了 Ego-Exo4D:740 人戴着 Aria 眼镜,并同步四台外部摄像机,完成烹饪、运动、修自行车和医疗操作,公开了 1286 小时素材。还有 EgoVerse,由佐治亚理工、斯坦福、加州大学圣迭戈分校、苏黎世联邦理工、麻省理工、Meta、Mecka AI 和 Scale AI 组成的联合体:1362 小时、1965 项任务、240 个场景、2087 名示范者。微软的 HoloAssist 换了一种形态:222 人组成指导者与执行者的搭档,执行者头显同步记录七路数据流。
唯一一个衡量结果的数字
这些项目公布的几乎都是时长,而不是成效。例外是佐治亚理工的 EgoMimic:用 Aria 眼镜录下约 90 分钟的日常人类任务,与一套低成本双臂机械手协同训练,报告称相比仅用遥操作数据训练提升了 400%。请按它本来的分量来读:这是实验室自选任务上的一次基准测试,发表于 CoRL 2024 和 ICRA 2025,硬件、数据集和代码均已开源。它不是一台在仓库里干活的机器人。
不属于研究的那一部分
2025 年 10 月 22 日,亚马逊在米尔皮塔斯配送中心展示了面向配送员的 AI 眼镜。它能识读包裹、指引路线、提示危险和院子里的狗,并且不必掏手机就能拍下签收凭证照片。而每一次识读,同时也是训练数据。这场发布,发生在《纽约时报》报道其内部计划到 2033 年少雇 60 万人以上、内部目标是把多达 75% 的作业自动化之后的第二天。亚马逊没有随这副眼镜公布任何效率数字。
行业清楚这看起来是什么样子。2026 年 6 月,包含雷鸟、Rokid 和中兴在内的中国厂商联盟签署了《AI眼镜可信视界自律公约》,共 15 条:传感器启用前须有清晰告知与授权,人脸、虹膜和语音尽量在本地处理,全链路数据合规。那是一份公约,不是法律。同一季,中国多地教育部门禁止 AI 眼镜进入高考考场,无论开机与否,随身携带即按作弊处理。