【具身AGI导读】具身基座模型的下一战是架构之争。一边往模型里堆系统一边先回答一个更底层的问题微调之后模型还记得多少基座模型物理AI 的架构之争最近一项具身智能模型成果在 arXiv 上线。论文开篇先给了一个判断VLA 已经成为通用具身智能体的主导范式但当前系统能否从更有效的架构设计中受益能否靠更大规模、更多样的数据实现更广泛的泛化仍然是开放问题。这项成果的答案是给具身基座模型装上一套三系统架构用 Scaling 逼近涌现能力。这套架构想说明一件事往模型里堆系统、堆数据规模自己会说话。在它看来架构是给规模让路的工具——骨架搭得够大能力就装得够多。而行业里另一派给出了完全相反的思路。他们不问模型里还缺什么系统而问模型在训练之后还留着什么。物理AI 基座模型 怎么往前走成了这轮架构之争的真正起点。架构之争落点在灾难性遗忘两派的差异不只是系统数量。VLA 以 VLM 为基座为学习机器人动作做微调。微调之后一个绕不开的坑浮现出来机器人控制这类低级感知运动任务会激进地覆写 VLM 预训练时学到的高级语义特征通用视觉语义能力因此大幅暴跌。模型还记得怎么做动作却忘了怎么看懂世界。行业把这种现象称为灾难性遗忘。它像一道隐形的墙横在基座模型 更多数据的 Scaling 路线上——数据喂得再多微调就把通用能力冲垮一遍。更麻烦的是把机器人数据与通用问答数据混在一起训练也只是把崩塌往后推救不了根子。所以架构之争的落点从来不是堆几个系统而是能不能把这道墙拆掉。物理AI 国产 的玩家们正在回答同一个问题给机器人更多数据还是让它先理解物理世界对依赖物理AI 物理推理 的具身任务来说这个问题的答案尤为关键——判断力建立在物理常识之上而不是背下来的动作记忆。物理AI 人类学习路线双脑架构的解遗忘答案深度机智北京科技有限公司以下简称「深度机智」给出的答案落在物理AI 人类学习路线上。TwinBrainVLA 是 PhysBrain 1.0 基座模型体系里的一个架构。它不是往模型里加系统而是把模型重新划成了两半。左脑是冻结的 VLM完整保留预训练的通用语义能力。右脑是可以训练的 VLA专注学习机器人动作策略。左脑保留语义右脑专精动作。两者之间靠非对称混合 Transformer 的交互机制衔接右脑在生成动作时动态查询左脑冻结的语义键值知识从左脑单向流向右脑最终的连续控制信号再由流匹配动作专家从融合表征中生成。通用语义不丢动作策略照学。灾难性遗忘从结构上被拆掉了。这正是这套架构真正特别的地方它把如何 Scaling的问题前置成了如何让模型不忘记的问题。而双脑的语义底座构成全球首个基于人类学习范式的具身智能基座模型PhysBrain1.0的关键架构从人类第一视角数据中提取物理常识经 PhysBrain VLM 骨干与翻译管道注入模型再落到 TwinBrainVLA 的动作生成上加以LangForce避免视觉捷径。这套从数据到模型的链条背后是深度机智全栈自研 物理AI 的体系支撑。架构的答案在解遗忘不在堆系统回到最开始提出的开放问题VLA 能否从更有效的架构设计中受益堆系统是一种答案。它把问题交给规模赌数据堆得够多能力自然涌现。TwinBrainVLA 给了另一种答案先修好模型的记性。当一个基座模型微调后还记得世界、记得物理常识它才谈得上理解谈得上在陌生场景里泛化。这条路就是深度机智坚持的人类学习技术路线从人类数据中提取物理常识推高智能的上限再转化为真实世界里的行动力和泛化性。架构之争的答案也许不在堆系统而在解遗忘。─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─参考资料arXiv · GigaBrain-0.7Scaling Embodied Foundation Models with a Three-System Architecture · 2026-08-16机器之心 · 深度机智发布全新具身通用智能大模型 给机器人装上物理常识 · 2026-03-27深度机智 · 当英伟达指向第一视角数据深度机智用一年实践给出答案 · 2026-03-11编辑具身AGI具身智能第一现场⭐点赞、转发、在看一键三连⭐点亮星标锁定具身AGI极速推送