Ego火了第一视角数据开始走向规模化100万小时。今年8月Dyna Robotics发布Dyna-2披露其WAM使用了超过100万小时的人类第一视角视频进行预训练。不仅仅是dyna1x、skiled ai这些公司也都在把ego数据作为重要燃料。那这个数量用了多久达到的2021年Meta联合多所高校推出Ego4D公开数据已超过3670小时。当时采集设备包括GoPro、Vuzix Blade、Pupil Labs等七类头戴设备重点还是通过第一视角完成理解模型能否看懂人看到了什么、做过什么。往机器人端走徐丹飞团队的EgoMimic更是把Project Aria采集的人类第一视角示范与机器人遥操作数据放进同一套模仿学习框架里。到后面Egoscale等各类工作在第一人称上的数据规模与能力涌现的验证越来越多。整条发展线上可以看到Ego数据已经从“记录人的视角”走向“记录人如何在空间里完成操作”。这也是它开始被机器人团队认真接纳的原因。现在这个跃迁的迹象更明确了人类第一视角视频正在从学术数据集进入具身基础模型的预训练pipeline。而作为采集终端的设备也开始分化出几条路线。GoPro这类通用运动相机成熟、轻便、成本低但空间位姿、手部轨迹和多传感器同步通常需要后补。UMI、头环设备、腕部相机等专用设备会主动增加手部视角、末端位姿或动作映射让数据更接近机器人训练所需的形式。Meta Project Aria、Apple Vision Pro这类XR设备则天然集成多目相机、IMU、定位、手部追踪和传感器标定。它们拿到的不只是视频还有视频发生时的空间结构。后者正是我们今天想重点聊的。我们发现早期很多代表性的Ego项目都有XR商VR/AR的影子。原文链接反直觉为什么VR/AR公司都开始做Ego数采设备了01 海外早期的规模化Ego采集最早一批设备来自XR公司2020年Facebook发布Project Aria。这副眼镜并不是为机器人设计的。Meta对它的定位是一套面向Ego-centric multimodal AI研究的可穿戴平台未来的AR眼镜要理解佩戴者所处的环境就需要同时知道人看到了什么、听到了什么、正在看向哪里以及头部如何在空间中移动。所以从一开始就集成了RGB相机、两路SLAM相机、IMU、音频和眼动等传感器并配套Machine Perception Services输出相机标定、设备轨迹、6DoF位姿和环境点云等结果。后来的Ego-Exo4D直接沿用了这套设备体系。当前V2版本包含约1286小时视频、5035个take其中约221小时为第一视角数据。这套数据的结构很有价值。不仅仅是一段视频Aria能够进一步提供人在哪里、看向哪里、头部如何移动以及动作发生在怎样的三维环境中。之后徐丹飞团队在EgoMimic里把这条路线继续推向机器人策略训练。采集者佩戴Project Aria完成叠衣服、整理物品等操作设备同步记录第一视角视频、3D手部轨迹和SLAM信息这些人类示范再与机器人遥操作数据进行跨域对齐共同训练统一策略。这也直接证明了人类Ego数据已经可以作为燃料进入动作策略学习不再只用于视觉预训练。所以XR与Ego之间关联很深。第一视角、多传感器同步和空间定位本来就是XR研究的主问题。02 XR厂商做Ego很难说成是一场跨界如果只站在机器人行业看Meta、Apple这些XR公司进入Ego采集像是从消费电子突然转向机器人数据。但从XR自己的技术栈往回看这条线并不突兀。XR设备要长期戴在人的头上第一件事就是理解“人”和“空间”的相对关系用户正在看哪里头部如何移动双手处在什么位置周围哪些物体可能被交互。为了让一副眼镜在现实世界里稳定运行它必须同时处理多路相机、IMU、SLAM/VIO、手部追踪、音频、标定、时间同步、功耗和散热。这些能力放在XR里服务的是空间计算体验。但放到Ego数据采集里直接变成了数据质量的一部分。普通第一视角视频记录的是一段画面。XR设备记录的是画面发生时的空间上下文相机位姿、头部运动、手的位置、传感器之间的时间关系以及部分可恢复的三维环境结构。看上去是采集设备。实际更像一套穿戴式空间感知系统。这也是我们说XR做Ego很难算跨界的原因。那XR厂商为什么能做好这个事情优势在哪里03 Ego设备的门槛到底在哪里这个问题如果只问机器人团队答案很容易停在“多加几颗摄像头”。但真正做过头戴整机的人看到的是另一套约束佩戴、散热、同步、标定、供应链、批量一致性。国内的创维是一个很适合观察的样本它过去几年一直在做VR/XR整机处理的正是这些穿戴式空间计算设备里的工程问题。为了更深入的调研我们和创维团队做了一次深度访谈。对方反复强调的是几个很工程的细节1发热会不会掉帧2掉帧后时间戳还能不能对齐3VIO/6DoF能不能在端侧直接输出4几百上千台设备能不能保持一致。对成熟的厂商来说采集数据本身只是业务需求产品端他们更关注的是能否在真实场景下持续产出可训练的数据。线上和他们团队沟通了2小时发现有几个突出问题或者说门槛。1第一个门槛是时间同步。相比画面细节损失动作和画面对不上更麻烦。头部相机、灰度相机、IMU、腕部设备、夹爪或手套传感器如果各自按自己的时钟记录后面就很难判断“这一帧看到的手”和“这一刻记录的位姿”是否属于同一个动作瞬间。数据量越大这类误差越容易变成系统性噪声。2第二个门槛是空间基准。Ego视频真正进入具身训练不能只知道人看到了什么还要知道摄像头在三维空间里怎么运动。VIO/SLAM、6DoF位姿、相机内外参、头手坐标系对齐这些决定一段视频能否从“可观看”变成“可学习”。现场技术负责人还说“如果采集端没有把空间信息记录清楚后处理当然能补。但规模越大补救成本越高而且很多误差在采集那一刻已经发生了”。3第三个门槛是长时间佩戴和稳定运行。采集员要戴着设备进入货架、厨房、办公室、工厂连续几个小时做真实任务。设备一发热就掉帧续航跟不上存储写入不稳Wi-Fi上传慢都会直接影响数据管线。他们还提到过一个点部分平台的高性能芯片功耗不低整机散热做不好掉帧和时间戳同步会一起出问题。这个问题虽然听起来很工程但任何做过大规模采集的人都会知道它最终会变成算法问题。4第四个门槛是批量一致性。一两台样机能跑通不代表几百台、上千台设备采出来的数据能放在同一条训练pipeline上。这个就是量产里面经常会遇到的问题。每台设备的相机标定、视场覆盖、传感器时钟、固件版本、存储与回传方式都要尽量统一。否则扩大的只是素材量训练管线里会混入大量分布各异、质量参差的原始数据。这也是XR厂商真正值得被放到Ego语境里讨论的地方。XR过去多年训练的能力恰好是这些约束的集合多传感器融合、低功耗嵌入式计算、头戴佩戴结构、散热、无线传输、供应链管理、批量生产和售后交付。Ego设备更接近一台没有显示任务、但要稳定理解真实空间的穿戴式终端。这件事一旦进入规模化竞争点就会从“参数表好不好看”转向“这批设备能不能稳定生产同一种数据”。标品化交付的意义也在这里。客户拿到的应当是一批参数一致、接口统一、能接入既有数据流程的采集终端。04 把Ego设备当成一条产品线来做这是和创维团队对话中他们提到的一个概念。第一次听感觉是众所周知的样子没什么特殊的但之后觉得很有道理。因为很少有人这样说或者说大家好像都是“在做产品”。用他们的话说“一家长期做XR整机的公司把原来用于空间计算和头显量产的工程能力迁移到具身数据采集里”。创维自研双目数采设备/创维自研6目数采设备/创维自研9目数采设备访谈中我们还获取到一些信息。创维的Ego产品从4月开始交付到8月交付数量已经超过1万台。对方根据客户侧反馈估算这批设备带动的数据采集时长已经在几十万小时量级。这个现象和我们上次去觅峰现场拿到的结论一致。Ego采集设备已经开始按硬件产品的节奏出货。一旦有节奏出货后面就会有几个很关键的点需要重点关注。1生产速度足够吗2原材料缺货时供应链能不能稳住3不同批次的标定和固件能不能保持一致4采集员戴几个小时会不会明显不舒服数据能不能稳定存下来、传上去等。这些问题很难靠一个camera解决。创维这类XR厂商的优势就是来自它的制造底子。他们团队在访谈里还说到“创维本身是老牌生产制造型企业供应链管理和整机生产能力是他们判断自己适合做Ego的重要原因”。尤其在元器件涨价、缺货的情况下能不能保证设备稳定出货、批量一致本身就是数据采集能力的一部分。价格也是一个很重要的变量。这也是具身智能之心一直在追问的点。创维团队没有直接报出具体数字但给了“只有行业头部那几家价格的一半”。不过低价只是其中一个变量。很多公司做ego数采设备很难长期维持下去迭代。创维团队说“我们没有把这个设备作为一次性外包项目是把Ego当成产品线来做”。就像我们用高通的芯片做很难但是这就是产品的最优解。不懂工程和嵌入式的团队短期内根本做不好。他们在访谈里说得很直接“我们不希望只是客户提一个需求就临时改一套摄像头模组创维会按照自己的节奏把Ego作为主线产品持续迭代。客户找到我们时很多轻量化AR眼镜、UMI手套、腕部相机、灯环定位之类的方案已经在内部做过预研。像现在有很多头戴设备和腕部设备的配套需求找上来创维的Ego头环和腕部相机就已经可以实现无线连接50us以内的同步时间差”。腕部相机灯环定位模组这背后的逻辑和普通定制开发不一样。项目制思路更像“客户要什么我补什么”。产品线思路则会提前定义接口、版本、硬件边界和后续迭代路线。比如头戴设备负责第一视角和空间轨迹腕部相机补手部信息灯环定位模块解决6DoF位姿SDK和Wi-Fi上传能力负责接入客户自己的数据流程。这些模块不一定每个客户都会全量使用但它们共同指向一个方向Ego设备要从单点硬件变成可以被规模部署的数据入口。XR这类背景的公司正在提供更可靠和稳定的因素。05 Ego下一步会从“采多少小时”转向“每小时留下多少可用数据”100万小时当然有冲击力。它说明人类第一视角视频已经进入具身模型的规模化预训练阶段Ego数据不再只是paper数据集里的小样本实验。但规模化之后行业很快会遇到第二个问题一小时数据到底能给模型留下多少东西一小时普通第一视角视频可以记录人的操作过程。它的价值在于自然、真实、便宜、可扩展。但如果这段视频缺少稳定时间戳、缺少空间轨迹、缺少手部位姿、缺少设备标定后续模型真正能利用的部分就会被压缩。采集多少小时固然重要。没有规模基础模型很难学到足够丰富的人类操作分布。但只追求小时数会把问题简化得太早。真正影响模型上限的是单位时间里的信息密度和可用比例。