大语言模型可以把提示词变成文本。视觉语言模型可以理解图像并回答相关问题。而一台真正有用的机器人还需要再往前走一步把感知和指令转换成物理动作。这正是 **NVIDIA Isaac GR00T** 要解决的问题。GR00T全称是 **Generalist Robot 00 Technology**通用机器人00技术。人们常把Isaac GR00T说成一个机器人模型这个说法并不完整。这个名字同时覆盖- **Isaac GR00T**用于构建、训练、测试和部署通用机器人的开放参考平台。- **GR00T N模型**该平台中的视觉–语言–动作vision-language-action基础模型系列。这个区分很重要。模型负责预测动作而一台能工作的机器人还需要数据采集、仿真、后训练、评估、优化推理、中间件以及考虑安全的控制。---## 1. 什么是Isaac GR00T[NVIDIA将Isaac GR00T](https://developer.nvidia.com/isaac/gr00t)描述为面向通用人形机器人的开放参考平台。该平台汇集了- 开放的机器人基础模型- 真实与合成机器人数据集- 数据准备与后训练流水线- 用于采集示教的遥操作工具- 用于仿真与策略训练的NVIDIA Isaac Sim和Isaac Lab- 用于合成数据的NVIDIA Omniverse与Cosmos技术- 中间件以及经CUDA-X加速的运行时库- 面向NVIDIA Jetson Thor的部署支持因此该平台覆盖了机器人开发的全生命周期text采集示教↓准备并增强数据↓对GR00T模型做后训练↓在仿真中评估↓优化并部署↓在实体机器人上运行GR00T模型是这条工作流的核心但并不是工作流的全部。---## 2. 什么是视觉–语言–动作模型GR00T N是一种 **视觉–语言–动作****VLA**vision-language-action模型。VLA模型连接三个域- **视觉** 机器人看到了什么- **语言** 机器人被要求做什么- **动作** 机器人应该如何运动推理时GR00T模型主要消费三类输入text机载相机画面 自然语言指令 机器人本体感觉状态→ 预测的机器人动作本体感觉proprioceptive状态描述的是机器人自身例如关节位置、夹爪状态或其他控制器观测。以这条指令为例text拿起红色杯子放到托盘上。普通语言模型可以解释该怎么做。VLA模型则必须把“红色杯子”和“托盘”对应到相机图像中的像素结合机器人当前构型并生成机器人能够执行的运动。于是输出从文本token变成了动作值textLLM提示词 → 文本tokenVLM图像 提示词 → 文本tokenVLA图像 提示词 机器人状态 → 动作序列---## 3. GR00T预测动作块GR00T不必在每次推理时只预测一个瞬时指令。它预测的是 **动作块**action chunk一段未来动作序列。概念上text时刻t的当前观测↓GR00T策略↓[动作(t), 动作(t1), ... 动作(tH-1)]这里的H是动作视野action horizon。动作分块有若干实际好处- 减少昂贵的模型前向次数。- 提供时间上相关的动作而不是孤立指令。- 有助于产生更平滑的机器人运动。- 让推理和控制可以按不同频率运行。具体的动作表示取决于机器人和训练配置。它可能描述相对关节运动、末端执行器指令或其他策略特定的动作空间。模型输出通常由机器人控制器消费除非所部署的策略被明确设计成那样否则不要把它理解成原始电机电流或力矩指令。---## 4. GR00T模型架构当前的GR00T N1.7系列把高层多模态理解与连续动作生成结合在一起。主要概念组件如下textRGB图像 ───────────────┐│语言指令 ───────────────┼─→ 多模态表示│机器人状态 ─────────────┘↓流匹配动作模型↓动作块### 视觉–语言骨干GR00T N1.7使用基于Qwen3-VL架构的 **Cosmos-Reason2-2B** 作为视觉–语言骨干。这部分模型提取视觉特征、理解指令并构建任务与场景的表示。### 机器人状态编码机器人状态是数值而不是视觉或文本。它会被编码并与视觉–语言表示融合从而使动作预测以机器人当前物理构型为条件。### 流匹配动作Transformer流匹配flow-matching动作Transformer在视觉、语言和本体感觉的条件下生成连续动作块。这不同于LLM的下一token预测机器人动作是连续、时间相关的数值。[GR00T N1.7模型卡](https://huggingface.co/nvidia/GR00T-N1.7-3B)描述的模型约有30亿参数。不同GR00T版本的模型细节可能变化因此架构表述应始终对应到具体版本。---## 5. “跨本体”是什么意思机器人并不都有同样的身体。它们可能在以下方面不同- 关节数量与顺序- 手臂与手部几何- 相机安装位置- 夹爪设计- 状态向量维度- 动作向量维度- 控制频率与控制器语义GR00T被设计为 **跨本体**cross-embodiment模型一个预训练基础模型可以适配到多种机器人本体而不是每个机器人开发者都从随机权重开始。跨本体 **并不** 意味着任意机器人都可以在不做配置或训练的情况下安全使用基础checkpoint。目标机器人仍然需要- 图像、状态和动作的正确映射- 模型所期望的本体描述或标识- 能代表其运动学与任务的示教- 针对目标本体与环境的后训练- 评估以及与控制器的集成基础模型的价值是更强的起点和可复用的操作知识——而不是取消机器人特定工程。---## 6. GR00T的训练数据从哪来通用机器人行为需要多样性。真实机器人示教很有价值但采集昂贵且缓慢。GR00T结合了多种数据来源### 真实机器人示教遥操作示教把相机观测和指令与在实体硬件上成功执行的动作连在一起。它们提供真实的动力学、接触、传感器噪声和控制器行为。### 合成仿真数据仿真可以在物体、环境、光照条件和任务变化上生成大量轨迹。Isaac Sim和Isaac Lab有助于在物理建模环境中创建、训练和测试策略然后再做实体部署。### 人类视频互联网规模和第一人称人类视频提供关于物体、环境以及任务如何展开的广泛视觉与语义知识。人类视频并不直接包含目标机器人的关节指令因此还需要额外学习方法才能把视觉行为变成有用的机器人先验或带标注轨迹。### 生成与增强数据NVIDIA Cosmos世界模型以及GR00T数据生成工作流有助于扩展场景与行为的多样性。合成生成用来补充——而不是自动替代——真实示教和真实世界验证。根据NVIDIA对GR00T N1.7的介绍其预训练混合数据包含大规模真实人类示教、第一人称数据以及仿真rollout。具体配比因版本而异。---## 7. 针对某台机器人后训练GR00T预训练模型包含广泛先验但可部署策略通常仍需要在目标机器人和任务上做后训练。典型工作流如下### 步骤1定义任务与动作空间明确策略应观测和预测什么text观测- 头部相机- 腕部相机- 关节位置- 夹爪状态- 语言指令动作- 相对手臂关节指令- 夹爪指令动作语义含糊时即使每个张量形状都正确数据集也没法用。### 步骤2采集示教使用遥操作或现有控制器记录成功轨迹。每条轨迹应对齐text带时间戳的图像 机器人状态 指令动作或已执行动作 任务指令### 步骤3转换并校验数据集公开的GR00T工作流支持与Hugging Face LeRobot生态兼容的数据集。校验应在训练前捕获缺失帧、时间戳错位、维度错误、无效episode以及不一致的归一化。### 步骤4对基础模型做后训练在目标本体的示教上微调模型。数据集质量和覆盖范围往往比单纯增加梯度步数更重要。### 步骤5在仿真和离线评估不要只看训练损失。有用的度量包括- 任务成功率- 碰撞与安全违规- 完成时间- 动作平滑度- 对相机与物体变化的鲁棒性- 对未见初始状态的泛化### 步骤6带着安全约束部署先用保守的速度、工作空间和力限制。在扩大运行包络之前先验证感知、策略输出、控制器行为、急停和恢复路径。---## 8. GR00T平台各组件如何配合GR00T周围有多项NVIDIA技术它们扮演不同角色。### Isaac Teleop在仿真或实体系统上采集人类示教。结果是用于模仿学习和策略后训练的数据。### Isaac Sim提供高保真机器人仿真与渲染。用于创建环境、测试集成以及在不立刻拿实体硬件冒险的情况下验证行为。### Isaac Lab提供模块化的机器人学习环境包括围绕仿真构建的强化学习和模仿学习工作流。### Omniverse与CosmosOmniverse支持仿真与数字世界构建。Cosmos提供世界基础模型与工具可参与物理AI数据生成与推理工作流。### GR00T-WholeBodyControl提供全身控制组件和策略。VLA模型可以决定执行什么行为而全身控制器负责动态稳定的执行。它们是相关的不同层不是同一个模型的可互换名称。### CUDA-X与TensorRTCUDA-X库加速感知、张量运算和AI推理。TensorRT针对NVIDIA GPU优化模型执行。GR00T N1.7增加了用于部署工作流的ONNX与TensorRT导出路径。### Jetson ThorJetson Thor在边缘提供Blackwell GPU算力用于多模态推理和机器人控制使机器人不必把每一帧相机画面都送到远端服务器。---## 9. 训练、仿真和部署是不同工作负载完整工作流通常在不同阶段使用不同计算平台text大型GPU系统 / DGX模型预训练和大规模后训练任务RTX工作站或服务器仿真、合成数据、开发、评估Jetson Thor机载推理与实时机器人集成这不是硬性规则。小实验可以在更少资源上运行部署拓扑也取决于机器人。关键点是最适合训练数千条轨迹的硬件未必是应该装进机器人内部的硬件。---## 10. GR00T不是完整的机器人控制器GR00T策略是重要的决策组件但量产机器人周围仍需要常规系统text传感器与时间戳同步↓感知与状态估计↓GR00T策略推理↓动作校验与安全过滤↓轨迹 / 全身控制器↓电机控制器与硬件还可能包括- 定位与建图- 碰撞检测- 关节、速度、力和工作空间限制- 故障检测与看门狗- 确定性底层控制回路- 人员安全系统- 日志、回放与事故分析基准测试中一次成功的模型rollout本身并不能证明机器人已可无监督运行。---## 11. GR00T适合做什么GR00T旨在为如下技能提供可复用基础- 抓取与移动物体- 单臂与双臂操作- 双手之间传递物体- 由语言条件化的抓取放置- 多步操作- 物料搬运、包装与检测工作流- 在不同机器人本体上做后训练当项目需要把视觉理解、语言指令和连续机器人动作结合起来而不是为每个单独任务各建一个模型时它尤其有用。GR00T并不保证- 在任意硬件上零样本运行- 从仿真到现实的完美迁移- 对未见的安全关键情形行为正确- 可以不做示教或后训练- 可以替代底层实时控制---## 12. GR00T N1.7与更早版本GR00T N系列经历了N1、N1.5、N1.6、N1.7等版本。架构细节、数据集、支持的本体、许可证、导出工具和发布支持都可能不同。对N1.7NVIDIA描述的显著变化包括- Cosmos-Reason2-2B / Qwen3-VL视觉–语言骨干- 灵活的图像分辨率与原生宽高比处理- 流匹配动作Transformer- 更强的长视野任务推理与分解- 更强的跨本体泛化- 用于部署的ONNX与TensorRT导出- 与Hugging Face LeRobot工作流集成务必让文档、模型卡、代码分支和checkpoint版本互相匹配。不要把N1.5或N1.6的安装说明与N1.7 checkpoint混用并假定接口相同。发布状态和支持条款可能变化。在为生产环境选择版本前请查看当前官方页面、仓库和模型许可证。---## 13. 如何开始从官方资源入手- [Isaac GR00T平台概览](https://developer.nvidia.com/isaac/gr00t)- [NVIDIA Isaac GR00T GitHub仓库](https://github.com/NVIDIA/Isaac-GR00T)- [GR00T N1.7 3B模型卡](https://huggingface.co/nvidia/GR00T-N1.7-3B)- [GR00T基础模型论文](https://arxiv.org/abs/2503.14734)- [NVIDIA GR00T开发工作流](https://developer.nvidia.com/blog/develop-humanoid-robot-policies-end-to-end-with-nvidia-isaac-gr00t/)合理的第一个项目不是不受约束的人形机器人部署。先从一台机器人、一两路相机、明确定义的动作空间以及可重复的操作任务开始。在扩大任务多样性之前先建立数据采集、回放、评估和安全限制。---## 结语Isaac GR00T既是机器人开发平台也是NVIDIA GR00T机器人基础模型的所在。其VLA模型把相机观测、语言指令和机器人状态连接到连续动作块。模型周围平台还提供数据、仿真、训练、运行时和部署组件帮助从研究checkpoint走向可工作的机器人。核心想法很直接text看见世界 理解指令 知道机器人当前状态→ 生成有用的物理动作难的工程在于让这个闭环可靠采集正确的示教、把模型适配到本体、在仿真和现实中验证、集成确定性控制并落实安全。GR00T提供了强起点但完整的机器人仍然是一个系统——而不只是一个模型。