过去两年具身智能从一个实验室概念快速变成一级市场最拥挤的赛道之一。但细看这一轮融资和产品发布会明显感觉到资本的口味变了早期大家更愿意为机械臂、双足机器人、四足机器人这些“身体”买单现在越来越多资金涌向模型、数据、仿真和软件栈——也就是机器人背后的“大脑”。本文结合具身智能投资转向的背景拆解“造身体”和“造大脑”两种模式的技术差异、资本逻辑以及开发者和工程师在这轮转向中的应对思路。1. 从“造身体”到“造大脑”具身智能投资转向意味着什么1.1 先理解具身智能是什么具身智能Embodied Intelligence的核心思想是智能不能只存在于云端或大模型里它必须有一个“身体”能感知环境、做出决策、执行动作。和传统聊天机器人、内容生成模型不同具身智能强调“感知—决策—执行”的完整闭环。一个典型的具身智能系统至少包含三部分本体硬件机械臂、轮式底盘、双足机器人等。传感器摄像头、激光雷达、IMU、力传感器、触觉传感器。算法与模型视觉感知模型、运动规划算法、强化学习策略、语言-动作模型。过去几年市场对具身智能的关注更多集中在本体硬件上。四足机器人能在复杂地形行走、机械臂能完成插拔和抓取这些成果很容易被看到也容易打动投资人。但从 2024 年开始一个明显的变化是单纯秀硬件已经不够了资本开始追问“你的机器人能替客户完成多少真实任务”以及“模型迭代速度到底有多快”。1.2 “身体”和“大脑”在投资语境里的区别在投资语境里“造身体”和“造大脑”并不是完全对立的而是两个阶段的侧重不同。“造身体”阶段核心壁垒是机电系统、结构设计、运动控制、硬件成本控制。代表产品包括各类机械臂、四足机器人、人形机器人原型机。这个阶段比拼的是“能不能把机器人做得稳定、可靠、便宜”。“造大脑”阶段核心壁垒变成了数据、模型、算法和软件工程能力。比如视觉-语言-动作模型VLA需要海量真实操作数据强化学习策略需要高效的仿真环境训练完成的模型还需要在资源受限的机器人本体上实时推理。比拼的是“机器人能不能像人一样理解任务、泛化场景”。资本转向的本质是意识到硬件本体的差距正在缩小而模型和数据才决定最终产品形态的上限——这正是从“造身体”转向“造大脑”的核心逻辑。2. 复盘“造身体”阶段硬件本体为什么是起点2.1 早期投资为什么集中在硬件本体早期的具身智能公司大部分从硬件切入原因其实很朴素机器人首先得能动、能抓、能走才有后续的智能可言。投资人容易理解“我造了一台能跑能跳的四足机器人”这种叙事清晰、可展示、可传播。硬件本体也确实解决了很多真实问题。例如工业场景里机械臂的重复定位精度可以达到 0.02mm已经能完成装配、分拣、上下料等工作。物流场景里轮式机器人可以替代人工进行仓库巡检和搬运。这些能力都很“硬”容易形成壁垒也容易获得订单。所以 2022 年到 2023 年大量具身智能初创企业都在秀本体机械臂灵活度、双足机器人的步态、四足机器人的越障能力。资本在这个阶段更看重“身体”的技术含量因为那时候没有足够的大模型能力来支撑复杂决策。2.2 硬件同质化与成本困境但“造身体”模式的瓶颈很快暴露出来。第一是硬件同质化严重供应链成熟之后机械臂和机器人底盘的核心零部件差距越来越小电机、减速器、传感器基本都是国内外厂商的成熟产品很难靠“堆料”建立长期壁垒。第二是成本压力极大一台人形机器人的整机成本动辄几十万元甚至上百万元量产规模没有上去之前毛利很难转正。更重要的是硬件能力只是“能做”不代表“做得聪明”。相同的机械臂配上不同的算法和模型完成任务的效率和泛化能力可能天差地别。在许多走访调研中客户反馈最多的痛点不是机器人“动不起来”而是“换个环境就不知道怎么干”。这直接推动了资本从“身体”向“大脑”的转移。3. “造大脑”成了新主线模型、数据与软件栈3.1 大脑的技术栈怎么拆现在所说的“机器人大脑”并不仅仅是一个大语言模型而是一整套软件和算法栈。按功能可以拆成四层感知层负责识别物体、理解场景、定位自身。常见的技术包括目标检测、语义分割、深度估计、视觉 SLAM。决策层根据感知结果和任务目标生成动作序列。这里最热门的路线是 VLAVision-Language-Action模型把视觉、语言、动作统一到一个模型里输入图片和指令输出机械臂或移动底盘的执行动作。控制层把高层决策转变为低层电机指令。涉及运动学解算、动力学控制、MPC 模型预测控制、强化学习策略等。数据与仿真层为前面几层提供训练数据和验证环境。包括真实遥操作采集、数据清洗与标注、仿真环境生成例如 Isaac Sim、MuJoCo以及数据回放与管理平台。对开发者来说感知层和数据层相对容易复用现成方案真正拉开差距的是决策层的模型设计与控制层的策略优化。资本投向“大脑”本质上就是在押注这几层有公司能突破瓶颈。3.2 为什么资本这次聚焦“数据闭环”一个很常见的误区是认为具身智能最大的难点是模型算法。但真正在产业一线做落地的人会告诉你最大的瓶颈其实是数据。大语言模型可以靠互联网文本训练但机器人操作数据非常稀缺而且每台机器人的本体参数不一样传感器布局不一样采集的数据很难直接互相复用。现在头部公司普遍在构建“数据飞轮”第一步用遥操作设备让人类操作机器人完成某个任务同时记录传感器信息、关节角度、动作指令。 第二步对采集到的原始数据做清洗和标注筛选掉失败轨迹对齐时间戳统一坐标格式。 第三步用清洗后的数据训练 VLA 模型或强化学习策略。 第四步把模型部署到本体上到真实环境里测试发现失败场景再补充采集。这个闭环跑通之后模型能力才有持续提升的可能。资本投资“大脑”核心目标就是帮被投企业把这条数据闭环真正跑起来而不是只买一堆算力卡。3.3 仿真环境与真实环境的差距也在缩小仿真曾经被吐槽为“只在论文里好用”因为 sim-to-real 的迁移损失太大。但最近两年基于物理引擎的仿真平台越来越成熟渲染真实度、物理真实度都有了明显提升。像 Isaac Sim、MuJoCo 这类工具已经能在合成数据、强化学习训练、机器人评测中发挥实际作用。资本对仿真能力的态度也在变化早期认为仿真只是辅助验证现在则把高质量仿真当成必须的基础设施。逻辑也很简单——真实采集一条有效轨迹可能要几分钟但仿真环境里可以几分钟生成上千条。谁的数据生产速度快谁的模型迭代就快。当然这不是说仿真可以完全替代真实数据。当前的主流做法依然是用仿真做预训练和策略探索用真实数据做微调和评估。4. 从趋势到技能开发者如何应对具身智能投资转向4.1 三类核心岗位画像资本转向“大脑”带来的最直接变化是岗位需求结构变了。结合业内招聘趋势至少三类岗位会持续走热。第一类是具身智能算法工程师负责 VLA 模型、模仿学习、强化学习策略、感知模型的训练与部署。要求具备多模态模型经验熟悉 PyTorch、Deepspeed、vLLM 等工具链同时要了解机器人 URDF、运动控制基础。第二类是具身智能数据工程师负责数据采集管道设计、数据清洗、标注、增强和数据集管理。这个岗位经常被低估但在数据闭环里非常关键也是很多车企和机器人公司正在重金招聘的方向。第三类是具身智能应用运维工程师负责把训练好的模型部署到机器人本体上处理推理延迟、内存占用、传感器标定、网络通信等问题。这个岗位更像“机器人时代的 DevOps”需要同时懂 Linux、ROS/ROS2、容器化部署以及基础的硬件调试。4.2 硬件选型入坑树莓派小车到底选 4GB 还是 8GB很多初学者入门具身智能会选择树莓派小车作为第一个平台。一个高频问题是树莓派该选 4GB 内存还是 8GB 内存如果只是做最简单的巡线、避障、遥控4GB 完全够用因为跑的是轻量 Python 脚本和 OpenCV 基础功能。但如果想在车端运行视觉语言模型、轻量目标检测网络或者跑 ROS2 视觉 SLAM强烈建议直接上 8GB。原因不是 CPU 性能差距而是内存决定了你能不能在板端加载大一点的模型。我见过不少新手为了省钱买了 4GB 版本结果跑一个 YOLOv8n 加 ROS2 节点就频繁 OOM最后只能把模型放到 PC 端走 WiFi 远程推理体验很差。入门可以先用 4GB 做基础实验但如果你明确了要学视觉语言模型或者端侧部署起步选 8GB 更省心。一个小经验在树莓派上做项目一定要先开启 zram 或 swap并且养成查看内存占用的习惯free -h htop如果发现内存长期占用超过 80%就要清理掉不需要的 ROS2 节点或者降低图像分辨率不要硬扛。4.3 人体数据采集与清洗一个最小可运行示例数据清洗是具身智能数据工程师的基本功。这里给一个非常简化的示例模拟清洗一批机械臂遥操作采集到的轨迹数据。原始数据可能有时间戳、六个关节角度、末端坐标、是否成功标志、失败原因等字段。完整的采集数据往往包含大量重复帧、异常跳变和未标注片段直接喂给模型会严重影响训练效果。下面的代码演示了最简单的清洗流程去重、剔除失败样本、平滑跳变。# 文件路径data_cleaning/demo_clean.py import pandas as pd import numpy as np def clean_robot_trajectory(raw_csv: str, output_csv: str): df pd.read_csv(raw_csv) # 1. 剔除未完成轨迹 df df[df[success] True] # 2. 按时间戳排序并去重 df df.sort_values(timestamp).drop_duplicates(subset[timestamp]) # 3. 去除关节角度跳变过大的异常帧 joint_cols [fjoint_{i} for i in range(6)] df[joint_cols] df[joint_cols].apply(pd.to_numeric, errorscoerce) diff df[joint_cols].diff().abs() abnormal_mask (diff 30).any(axis1) # 每帧关节变化超过 30 度视为异常 df df[~abnormal_mask].reset_index(dropTrue) # 4. 简单线性插值补齐全缺失的时间戳简化版 df df.resample(20ms, ontimestamp).interpolate().reset_index() df.to_csv(output_csv, indexFalse) print(f清洗完成保留 {len(df)} 帧已输出到 {output_csv}) if __name__ __main__: clean_robot_trajectory(raw_teleop.csv, clean_trajectory.csv)生产环境的数据清洗会复杂很多比如需要人工抽帧校验、多传感器时间对齐、失败轨迹的回放分析但思路是共通的先保证数据“干净”再追求数据“量大”。4.4 在树莓派上部署一个极简“大脑”示例如果你已经有一台树莓派小车想体会“大脑”部署到“身体”上的过程可以从一个轻量目标检测模型开始。下面用一个 Python 脚本读取摄像头画面对画面中的待抓取物进行检测然后输出抓取目标的像素坐标。这个坐标可以进一步交给运动控制模块驱动小车前移或机械臂下探。# 文件路径raspberry_pi_demo/perception_node.py import cv2 import torch # 这里以 YOLOv5s 的简化用法为例 model torch.hub.load(ultralytics/yolov5, yolov5s, devicecpu) cap cv2.VideoCapture(0) cap.set(cv2.CAP_PROP_FRAME_WIDTH, 640) cap.set(cv2.CAP_PROP_FRAME_HEIGHT, 480) target_class cup # 假设目标物体是杯子 while True: ret, frame cap.read() if not ret: break results model(frame, size640) detections results.pandas().xyxy[0] for _, row in detections.iterrows(): if row[name] target_class and row[confidence] 0.6: x_center int((row[xmin] row[xmax]) / 2) y_center int((row[ymin] row[ymax]) / 2) cv2.circle(frame, (x_center, y_center), 5, (0, 255, 0), -1) print(f目标中心坐标: ({x_center}, {y_center})) cv2.imshow(frame, frame) if cv2.waitKey(1) 0xFF ord(q): break cap.release() cv2.destroyAllWindows()这个示例的技术含量不高但它完整呈现了“感知—坐标输出”的最小闭环。后续可以在坐标基础上加一个比例换算把像素坐标映射成机器人坐标系的位置指令再调用底盘控制库就形成了一个最简单的“看见然后行动”的具身智能系统。5. 常见误区与避坑清单5.1 常见误区第一个误区是把“大模型”直接当成“大脑”。很多人以为给机器人接一个大语言模型它就能像人一样干活。实际上语言模型只解决“理解任务”的一部分问题真正操作还需要视觉定位、运动规划、控制指令下发这些环节任何一步出错任务都会失败。第二个误区是忽视仿真到真实之间的鸿沟。仿真里成功率 90% 的策略迁移到真实机器人上可能只有 30%主要原因包括传感器噪声、机械结构弹性、延迟不一致。做 sim-to-real 迁移时必须从第一天就考虑域随机化例如随机改变光照、纹理和物理参数。第三个误区是只重视模型不重视数据工程。头部公司已经在用几十万甚至上百万条真实操作数据训练模型而很多团队还停留在手工编写规则的阶段。数据采集管线的稳定性、清洗流程的一致性直接决定模型训练迭代速度。5.2 避坑清单问题现象常见原因解决思路训练时 loss 不降数据标签错误、时间戳未对齐检查数据清洗流程抽样可视化标签仿真效果好真机失败sim-to-real 迁移不足增加域随机化引入真实传感器噪声模型树莓派端模型推理卡顿内存不足或模型过大换轻量模型、降低输入分辨率、开启 swapROS2 节点频繁丢失网络不稳定、QoS 配置不一致统一 QoS 策略检查无线网络丢包机械臂抓取漂移标定参数不准重新标定相机到机器人坐标系的变换矩阵数据清洗的坑尤其值得多说一句。很多团队急着采集大规模数据结果训练出来的模型过拟合到采集现场的光照和背景换一个厂房就失灵。建议每次采集都在不同光照、不同背景、不同物体位姿下进行同时人工抽帧质检避免“脏数据”进入训练集。6. 最佳实践与学习路线6.1 面向具身智能算法工程师的工程建议如果你准备进入具身智能方向下面几条工程建议越早落实越好。首先版本管理不要只盯代码数据和模型也要纳入管理。建议每个数据集都记录采集时间、机器人型号、传感器配置、天气光照条件。模型训练前要固定数据和代码版本避免“训练完不知道用了哪批数据”。其次端侧部署要从模型选型阶段就开始考虑。训练时精度再高部署到机器人上实时性不够也没有意义。建议在训练前就设定推理延迟目标例如移动底盘避障要控制在 30ms 以内机械臂抓取规划可以放宽到 100ms然后用 TensorRT、ONNX Runtime 或 TFLite 做端侧加速验证。第三日志和调试能力比模型调参能力更稀缺。具身智能系统涉及传感器、通信、控制、AI 多个模块一个看不见的问题可能来自 WiFi 延迟而不是算法逻辑。要养成把每个节点的输入输出都记录日志的习惯否则线上出问题只能靠猜。6.2 具身智能学习路线建议如果你是从零开始建议按“硬件感知—基础算法—大模型—系统集成”的顺序推进。阶段一熟悉机器人本体的基本组成买一套树莓派小车或低成本机械臂掌握电机控制、传感器读取、ROS2 基础通信。目标不是造硬件而是建立对“身体”的直觉。阶段二学习计算机视觉和机器人运动规划。掌握目标检测、语义分割、坐标系变换、逆运动学解算能完成“识别到物体—计算出抓取点”的简单闭环。阶段三学习模仿学习和强化学习。了解行为克隆、Diffusion Policy、PPO、SAC 等算法在 MuJoCo 或 Isaac Sim 里训练一个机械臂抓取任务并尝试迁移到真实设备上。阶段四学习视觉-语言-动作模型理解如何把预训练的多模态模型与机器人动作输出连接起来。这一阶段需要接触大规模数据处理、模型微调、端侧推理优化。每条路线都有完整的公开资源关键是多做项目、多写日志、多复盘失败案例。资本从“造身体”转向“造大脑”对开发者来说意味着同样的技能结构不能只停留在机械层面而要把模型、数据、系统部署能力都补上。7. 写在最后具身智能的投资转向表面上是资本热点切换本质上是一条产业规律的体现硬件走到一定阶段后软件和数据开始决定产品上限。对技术人来说这反而是更友好的趋势——模型的迭代、数据的整理、系统的部署靠的是大量工程实践而不是昂贵的大型设备。一个实用建议是不要等待“完美的人形机器人”出现才开始动手。从桌面的机械臂、树莓派小车、开源的仿真环境开始把“感知—决策—控制”的最小闭环跑通再逐步扩展任务复杂度。这个过程踩过的每个坑都会成为你在具身智能方向最扎实的积累。