跳到正文
订阅 · $99.00

行业 · 为人工智能采集数据

机器没见过一双手是怎么干活的,眼镜让它看见了

这一页里几乎全是数据集,而不是产品。第一人称的人类视频,正是机器人学习一直缺的东西,而眼镜是最便宜的录制方式。这里还写了亚马逊发布配送员眼镜的那一天,以及中国厂商共同签下的那份公约。

机械臂可以靠遥操作来教:人来操纵,机器照做。这条路走得通,但又慢又贵,因为每一分钟训练都要有人坐在操作台前付出一分钟。另一条路,是录下一个人用自己的双手、从自己的眼睛出发完成任务的过程,让模型从中学习。二十年来,没有人拥有规模化的这类素材。带摄像头、眼动追踪和手部追踪的眼镜,是它开始存在的方式。

Meta 的 Project Aria 是这台发动机里看得见的部分。它不对外销售:Meta 把眼镜借给研究伙伴,目前有 290 多家伙伴在 27 个国家运行 1000 多台设备,累计记录超过 8000 小时。由此产生了 Ego-Exo4D:740 人戴着 Aria 眼镜,并同步四台外部摄像机,完成烹饪、运动、修自行车和医疗操作,公开了 1286 小时素材。还有 EgoVerse,由佐治亚理工、斯坦福、加州大学圣迭戈分校、苏黎世联邦理工、麻省理工、Meta、Mecka AI 和 Scale AI 组成的联合体:1362 小时、1965 项任务、240 个场景、2087 名示范者。微软的 HoloAssist 换了一种形态:222 人组成指导者与执行者的搭档,执行者头显同步记录七路数据流。

唯一一个衡量结果的数字

这些项目公布的几乎都是时长,而不是成效。例外是佐治亚理工的 EgoMimic:用 Aria 眼镜录下约 90 分钟的日常人类任务,与一套低成本双臂机械手协同训练,报告称相比仅用遥操作数据训练提升了 400%。请按它本来的分量来读:这是实验室自选任务上的一次基准测试,发表于 CoRL 2024 和 ICRA 2025,硬件、数据集和代码均已开源。它不是一台在仓库里干活的机器人。

不属于研究的那一部分

2025 年 10 月 22 日,亚马逊在米尔皮塔斯配送中心展示了面向配送员的 AI 眼镜。它能识读包裹、指引路线、提示危险和院子里的狗,并且不必掏手机就能拍下签收凭证照片。而每一次识读,同时也是训练数据。这场发布,发生在《纽约时报》报道其内部计划到 2033 年少雇 60 万人以上、内部目标是把多达 75% 的作业自动化之后的第二天。亚马逊没有随这副眼镜公布任何效率数字。

行业清楚这看起来是什么样子。2026 年 6 月,包含雷鸟、Rokid 和中兴在内的中国厂商联盟签署了《AI眼镜可信视界自律公约》,共 15 条:传感器启用前须有清晰告知与授权,人脸、虹膜和语音尽量在本地处理,全链路数据合规。那是一份公约,不是法律。同一季,中国多地教育部门禁止 AI 眼镜进入高考考场,无论开机与否,随身携带即按作弊处理。

引用的案例

  • Meta Reality Labs Research,Project Aria 合作伙伴计划
    做了什么
    Meta 把 Project Aria 研究用眼镜(第一人称摄像头、SLAM、眼动追踪与手部追踪)出借给 290 多家高校和企业合作伙伴,这些伙伴在 27 个国家运行 1000 多台设备,录制用于机器感知、情境 AI 和机器人学习的第一人称视频。
    结果如何
    合作伙伴累计记录超过 8000 小时第一人称数据;该平台成为下文所列数据集(Ego-Exo4D、EgoMimic、EgoVerse)的标准采集基础。Aria Gen 2 于 2025 年 2 月发布,面向研究者开放申请,更大批次预计在 2026 年第二季度供货。

    www.projectaria.com

  • Meta FAIR 与 Project Aria,联合 15 所高校(含布里斯托大学)
    做了什么
    740 人佩戴 Aria 眼镜,并与 4 台外置 GoPro 相机同步,录制烹饪、运动、音乐、修自行车和医疗操作等需要技能的人类活动,构成第一人称加第三人称的 Ego-Exo4D 数据集,用于训练多模态感知模型。
    结果如何
    公开视频超过 1286 小时(2023 年 11 月发布,2024 年 3 月扩充),成为第一人称视频理解与机器人学习研究的参考基准。

    ai.meta.com

  • Simar Kareer,佐治亚理工机器人学习与推理实验室博士生(EgoMimic 项目)
    做了什么
    他用 Project Aria 眼镜录制了约 90 分钟的日常人类任务(第一人称视频加三维手部追踪),并把这些数据与一套低成本双臂机械手结合,协同训练机器人的模仿策略,而不是只依赖遥操作。
    结果如何
    在测试任务上,机器人表现比仅用遥操作数据训练提升了 400%;成果发表于 CoRL 2024 和 ICRA 2025,硬件、数据集和代码均已开源。

    ai.meta.com

  • 佐治亚理工、斯坦福、加州大学圣迭戈分校、苏黎世联邦理工、麻省理工、Meta Reality Labs、Mecka AI 与 Scale AI(EgoVerse 数据集)
    做了什么
    由高校与企业组成的联合体构建了 EgoVerse,这是一个协作式第一人称操作数据集,包含 1362 小时、1965 项任务、240 个场景和 2087 名示范者,统一采用 Project Aria 眼镜作为采集平台(21 点手部姿态与 6 自由度头部姿态),用于训练机器人操作策略。
    结果如何
    2026 年 4 月发布,是迄今专门面向机器人学习构建的最大规模第一人称数据集之一。

    arxiv.org

  • 微软研究院(HoloAssist 数据集)
    做了什么
    222 名参与者组成 350 对“指导者与执行者”搭档:执行任务的一方佩戴混合现实头显,在真人远程实时指导下完成 20 项物体操作任务,头显同步采集 7 路数据(第一人称视频、注视、手部姿态、IMU、音频)。
    结果如何
    公开了超过 160 小时的第一人称交互视频,并配有错误检测、介入时机预测和手部动作预测的基准任务,作为面向物理世界 AI 助手的训练素材。

    www.microsoft.com

  • Ege Ozsoy、Arda Mamur 及其团队(慕尼黑工业大学),EgoExOR 数据集
    做了什么
    他们录制了两台模拟脊柱手术(超声引导穿刺和微创手术)共 94 分钟的过程,把可穿戴眼镜的第一人称视频(RGB、注视、手部追踪、音频)与第三人称 RGB-D 相机和超声图像结合,并标注了含 36 类实体、22 种关系的场景图。
    结果如何
    该数据集被 NeurIPS 2025 接收并公开,作为训练实时手术辅助 AI 和评估外科医生技能的资源。

    arxiv.org

  • 亚马逊
    做了什么
    该公司在米尔皮塔斯配送中心发布了面向配送员的 AI 智能眼镜。眼镜可识读包裹、指引路线、提示危险和院内犬只,并在不使用手机的情况下拍摄签收凭证照片。每一次识读、每一步导航和每一张照片同时也成为训练数据,与 Blue Jay 机器人平台和名为 Project Eluna 的 AI 运营管理系统配套。
    结果如何
    发布日期为 2025 年 10 月 22 日,就在《纽约时报》报道其内部自动化计划、拟到 2033 年少雇 60 万名以上员工、内部目标是把多达 75% 的作业自动化的第二天。

    ppc.land

  • 中国 AI 眼镜行业联盟(雷鸟、Rokid、中兴等参与)
    做了什么
    在 2026 AI 眼镜生态大会上,该联盟发布《AI眼镜可信视界自律公约》,共 15 条,涵盖用户隐私保护、终端技术管控(传感器启用前须有清晰告知与授权,人脸、虹膜、语音优先本地处理)以及全链路数据合规,回应外界对摄像头眼镜沦为“全景监控工具”的担忧。
    结果如何
    该公约获主要厂商采纳;与此同时,中国多地教育部门禁止 AI 眼镜进入 2026 年高考考场,无论开机与否,随身携带即按作弊处理。

    finance.sina.com.cn

  • Mentra(MentraOS,面向智能眼镜的开放系统)
    做了什么
    这是一个带有 Miniapp Store 的开放平台,可运行在多个品牌的兼容眼镜上,分发实时字幕、AI 笔记等应用,并提供“主动式 AI”模式,持续把用户的第一人称摄像头与音频流交给第三方模型处理(通过 OpenRouter 接入谷歌、OpenAI、Anthropic、xAI、DeepSeek)。
    结果如何
    该公司融资 800 万美元,并发布 MentraOS 2.0,配备公开应用商店和开放 SDK,使任何开发者都能在普通眼镜硬件上构建消费第一人称数据的 AI 应用。

    gamesbeat.com

使用的设备

联系我们

返回应用场景

智能眼镜资讯门户。

价格

$99.00 每月

R$ 549,00 每月 · 结算货币按账户语言决定。

价格核实于

2026 · 保留所有权利。