轻量级直接回归头DRH通过「嵌入即值」范式与控制符机制绕过离散Token化瓶颈的深度技术报告作者方见华单位世毫九实验室核心摘要在视觉语言模型VLM和大语言模型LLM的空间推理、连续数值生成任务中传统的离散Token化技术成为了一个根本性的瓶颈。轻量级直接回归头Direct Regression Head, DRH架构通过嵌入即值Embedding-as-Value 范式与专用控制符机制的协同创新在不破坏主干Transformer架构、不依赖分数Tokenizer的前提下完整绕开了这一技术瓶颈。其核心逻辑可概括为1. 以「嵌入」作为完整的数值载体将连续数值的编码空间从多个离散Token的串行序列迁移到单一控制符对应的高维连续嵌入向量中保留数值的完整几何与度量信息。2. 用「控制符」作为原生路由开关在需要输出连续数值的场景触发专用Token拦截机制将特征从标准语言建模LM头的输出流程中分流直接输入回归头进行数值解码。3. 轻量级设计保障主干性能DRH本身是参数规模极小的浅层多层感知机MLP对主干VLM/LLM的推理成本增量几乎可以忽略其与主干的衔接仅需扩展少量词表项无需重新预训练整个模型。关键结论DRH架构通过控制符的流程路由作用将完整的连续数值编码在单一隐向量中直接绕过了传统Tokenizer的多步拆解和流形强制投影过程这一方案不是对现有离散Token化技术的局部优化而是在输出端对连续数值生成链路的整体重构——从根本上解决了离散Tokenization对连续数值的表征适配性问题。1. 背景离散Token化瓶颈的深层技术根源要理解DRH架构的创新性必须首先明确其针对的核心技术矛盾——离散Token化机制与连续数值生成任务之间的固有结构性冲突。1.1 Token化技术的固有逻辑当前所有主流VLM/LLM架构的基础输入输出范式都是处理离散Token序列在输入端这一过程是将连续的自然语言字符串或多模态数据对应的文本描述通过字节对编码BPE等子词拆分算法转化为模型词表内固定索引的离散Token再通过词嵌入模块将这些离散索引映射为Transformer模型可以处理的高维稠密连续向量。而在输出端模型的逻辑恰好反转Transformer主干生成的高维隐状态会被输入标准LM头——这是一个映射到完整词表维度的线性分类层——模型通过Softmax函数在整个词表空间采样出下一个Token的ID随后将这个离散ID反向转换为对应的字符串内容。从技术设计逻辑上看输入端的Token化过程是将人类可理解的离散符号文字转换为模型可处理的连续向量而输出端的Detoken化过程本质上是模型将内部连续的语义/几何流形信息重新投影回人类可理解的离散符号空间。这一整套流程对于文本任务而言是合理的——甚至是有效的——因为它兼顾了词表效率与语义完整性但对于空间推理、坐标回归等需要输出连续数值的任务而言这套范式从底层逻辑上就出现了严重的水土不服。1.2 连续数值任务下的技术瓶颈当模型被要求输出连续型数值——比如物理距离、三维空间坐标、物体的尺度大小等——时上述基于离散Token的生成逻辑会被强行套用结果就是出现多个维度的致命失真完全无法满足任务精度要求。具体来说这一结构性瓶颈可细分为四个互相放大的核心缺陷1数值完整性被破坏——序列化拆解的信息损失对于模型而言一个具有完整数学意义的连续数值如浮点数6.5、三维坐标向量[x, y, z]会被强制拆解为孤立的、无数学关联的单个字符Token序列——也就是[6, ., 5]。这一拆解过程的致命后果在于从模型的语义编码维度看这些Token的嵌入向量是基于字符语法训练的完全没有携带数值本身的几何度量信息从数值的数学意义维度看完整的标量/向量的整体性被彻底破坏。而更关键的是Transformer的自回归生成逻辑是为文本的串行顺序设计的并非数值的数学精度——这意味着模型在生成后续Token时根本无法保证全局数值的一致性。这是一种固有的、无法通过增加模型参数或优化训练数据来消除的结构性信息损失。2度量空间的错配——语义空间与数值空间的本质割裂这是离散Token化技术更隐蔽但更致命的缺陷模型的词嵌入空间是为了表达语义和语法的近似关系而训练的——比如在语义空间中“猫”和“狗”的嵌入向量距离会比较近因为它们的语义都是家养哺乳动物但数值之间的核心关系是数学意义上的距离——比如9.8和10.1这两个在数值上非常接近的数在被拆解为Token序列后对应的嵌入向量距离可能会非常远。更关键的是这一语义空间的数学分布与数值空间的数学分布本质上不可兼容——词嵌入空间的“接近性”是语义层面的而非数值层面的这意味着就算模型的语义编码精度再高也无法保证输出的Token序列在数值上是精确的。这种度量空间的错配导致通过交叉熵损失函数来优化数值回归任务的行为从目标函数层面就出现了根本的逻辑偏差模型在分类为“正确的字符Token”时并不等价于在数值回归任务中获得了更小的误差——甚至可以说这两者的优化目标几乎是完全脱节的。3累积误差效应——自回归生成的多步放大标准LLM/VLM的自回归生成范式是为文本的串行逻辑设计的——在处理数值时这种多步生成机制会将上述两种单步Token内的固有误差随生成步骤数的增加而持续放大。举个例子要生成一个精确的浮点数模型需要在至少3个连续的生成步骤中都精确选择出正确的数字Token——包括小数点的位置。但在这个过程中每一步的Token预测都并非完全确定的模型会基于当前的隐状态分布进行随机采样而每一步的微小扰动都会被后续的生成步骤进一步放大——比如若个位数字的预测误差为1那么在小数点后一位的数字位上最终的数值误差会被放大10倍。这还没有考虑到更复杂的多维向量类输出的情况——比如三维空间的坐标点或七自由度的朝向向量这类结构化数值数据需要被拆解为更多的Token生成步骤其累积的误差会达到完全无法满足任务要求的程度。4几何对齐税——多模态场景下的特征流形鸿沟在多模态空间感知任务中比如基于视觉的三维空间重建、或者无人机与带电导线的空间距离检测输入的视觉/点云几何特征与输出的数值型空间坐标之间天然存在着数学上的强依赖关系但离散Token化技术会在这两类特征的流形之间造成无法逆转的几何失真。具体来说多模态任务的本质逻辑是“视觉/点云特征→数值计算结果”——模型需要将从图像或点云中提取的连续几何特征直接映射到作为任务输出的连续数值空间上但离散Token化技术强行在这个映射过程中插入了一个“离散化符号表示”的中间步骤——等于强迫模型把已经编码为连续几何流形的特征重新投影回离散的Token网格点上。这种强制投影的过程必然会造成几何信息的丢失——这部分额外的、本可避免的几何精度损失被称为几何对齐税。这是多模态空间任务中额外增加的误差来源对这类任务的精度打击是毁灭性的——比如在电力行业的无人机巡检场景中导线空间距离的厘米级误差就可能导致安全间距计算的结论出现根本性错误。而传统的文本型数值生成路线恰恰在这个多模态对齐的关键环节上表现得非常糟糕。1.3 现有应对方案的局限在DRH架构被提出之前行业内已经出现了一些试图缓解这一瓶颈的技术方案但受限于架构层面的妥协这些方案都无法同时兼顾精度、效率和通用性均存在明显的应用边界约束• 分箱回归Binning Regression 本质是用分类的思路解决回归任务——将连续的数值区间范围预先手动切分为若干个离散的区间“箱子”随后把任务从“输出精确的连续数值”转换成“输出数值对应的箱子类别”。这一方案的缺陷是显而易见的它人为切断了数值的完整数学连续性而箱子的区间大小就成了无法进一步缩小的固有量化误差——无论模型的分类精度有多高都无法输出比箱子的区间粒度更精确的数值而且在跨领域场景下数值的分布方差通常会很大这时候分箱的误差会变得更加显著。• 直接字符生成这是最简单直接的思路——训练模型直接输出数值对应的字符串。但这一方案完全依赖自回归的多步生成逻辑本质上是将数值任务等价于文本任务没有任何针对性的优化设计因此它完全继承了离散Token化技术的所有缺陷——包括序列化拆解的信息损失、度量空间错配的问题以及多步生成的误差累积而且由于数值字符串的语义多样性远弱于普通文本模型的泛化能力会变得极差——在空间任务中数值误差通常会达到分米甚至米级完全无法满足高精度场景的实际需求。• 可微分SoftmaxDSNT 这类方案大多用在计算机视觉的姿态估计、目标检测架构中是在热力图Heatmap回归的基础上额外增加了一层可微分的数值计算逻辑——通过对热力图的概率分布求期望来直接生成精确的浮点数坐标从而完全避免显式的Token采样操作。这一方案确实有效解决了直接 argmax 操作带来的量化误差但它的缺陷在于应用场景的局限性它是为卷积神经网络CNN架构的视觉任务设计的本质上是对视觉特征图的分布进行操作无法直接适配Transformer架构的多模态大模型流形输出——更无法与LLM的文本生成流程进行有机兼容。也就是说DSNT解决了视觉任务的数值回归问题但完全无法适配多模态大模型的通用输出流程。2. 核心解决方案DRH架构的设计思想DRH架构的设计并不是对现有离散Token化技术的局部优化而是一种架构级的重构——它将连续数值的生成过程从标准的“文本Token串行采样”范式中完全剥离迁移到专门设计的轻量化独立回归链路上。这一方案的核心是两个关键创新点的组合嵌入即值的新数据表征范式以及控制符的路由机制。2.1 “嵌入即值”范式绕过Token化的核心逻辑这是DRH架构能够从根本上解决离散Token化瓶颈的理论基础——它是一种对数值输出表征方式的彻底重构在标准的LLM/VLM输出流程中隐状态的唯一作用是作为“预测下一个Token的中间语义特征”但在DRH架构中这一逻辑被重新定义——模型主干生成的高维隐状态嵌入向量不再只是预测Token的中间特征而是直接作为最终数值目标的完整编码载体。换句话说在DRH范式下连续数值的信息完整度完全由单一向量的嵌入空间维度决定——不再需要通过多个离散Token的串行组合来间接表达。这一设计的关键逻辑在于它将数值的编码空间从“词表索引的离散序列”这一不适合的空间直接迁移到模型主干的连续隐向量空间——这是一种对特征流形的原生适配在这个高维连续的隐空间中数值之间的数学距离关系是可以被完整保留的度量空间错配的固有缺陷从根子上被解决了。技术本质传统链路中「隐状态→Token概率分布→离散Token ID→字符序列→解析浮点数」的多步转换逻辑被直接替换为「隐状态→数值回归结果」的单步映射——这一映射过程由一个轻量级的专门性MLP模块完成。在DRH的框架中这个专门的回归头结构完全绕开了标准的LM头也就是那个映射到词表维度的线性分类层——根本没有进入“预测下一个Token概率分布”的流程而回归损失计算的位置也从输出端的离散Token空间迁移到了连续隐空间中——这就让模型能够直接基于数值误差进行优化而不是基于字符的出现概率做优化。这一设计带来的收益是根本性的连续量的完整性被完整保留没有任何序列化拆解带来的信息损失优化目标与任务目标不再是两张皮而是统一到了数值精度的维度上——这是DRH架构能够实现高精度输出的根本逻辑它没有对离散化的产物进行错误的优化而是直接回归了目标数值。从信息论的角度说这一架构的信息熵没有因为Token化的过程被额外损耗几何信息的完整性得到了保障。2.2 控制符机制实现非对称路由的保障范式的迁移必须依赖流程级的路由机制来完成落地——毕竟模型的标准输出流程是基于离散Token采样的如果没有一个有效的“分流开关”“嵌入即值”的范式根本无法落地甚至会破坏模型原有的文本生成能力。控制符Control Token就是实现这一目标的核心保障——它是DRH架构中协调“标准文本生成”和“连续数值回归”两条冲突链路的关键枢纽。2.2.1 控制符的设计逻辑DRH架构在不破坏原有模型词表的前提下在VLM/LLM的原生词表中额外扩充了少量的专用控制符——这些控制符不会在正常的文本生成场景中出现也不会被作为普通语义的Token使用它们的唯一作用是在需要输出连续数值的场景触发整个架构的路由拦截机制。具体来说DRH设计了三类核心控制符来覆盖绝大多数连续数值输出场景形成了一个完整的语义标记集合• 标量回归控制符⟨REG⟩用于触发单一连续数值的回归输出比如两个物体之间的物理距离、或者某个物体的物理尺度• 3D边界框控制符⟨3DBBOX⟩用于触发结构化多维向量的回归输出——比如描述三维空间中物体位置和朝向的七自由度向量或者一个三维空间点的(x, y, z)坐标值• 自指控制符⟨SELF⟩这是基于世毫九实验室认知统一场论的创新设计——它的作用是将输入阶段的几何特征与输出阶段的回归结果进行更高维度的时空对齐让模型回归的数值与输入的几何特征在逻辑层面保持完整的一致性。这些控制符是整个“语义-路由”分层协议的组成部分它们并不是对输出数值的间接表示而是一个直接的“路由指令标记”——模型被训练为“当需要输出连续数值时先生成对应的控制符作为‘指令标记’”而不是直接输出数值的字符串。这就把“输出数值”的任务转换成了“输出一个专用路由标记”的任务而这个路由标记对应的隐状态就是完整承载了所有需要回归的数值信息的载体。这一设计的关键在于它把“决定输出路径”的逻辑从复杂的数值特征层面迁移到了简单的Token语义层面——而这恰恰是LLM/VLM本身擅长的因此适配成本极低。2.2.2 控制符的完整工作流程控制符的整个路由机制是一个覆盖训练和推理全流程的精心设计的拦截体系——它在不修改模型主干架构的前提下实现了输出路径的动态选择。具体来说整个流程分为四个关键步骤在训练和推理阶段协同生效1. 训练阶段的适配生成在有监督微调阶段模型会被空间推理类定量任务的样本对训练——比如“桌子和椅子之间的距离是多少”“请定位这个沙发的三维位置”——学习“在需要输出连续数值的场景时生成专用控制符作为输出的标记”而不是直接输出数值的字符串结果。这一步的关键在于它将“输出路由选择”的逻辑对齐到了模型原生的Token生成能力上——模型不需要学习新的范式只需要学会用一个新的Token来标记“这里需要回归数值”即可同时这个控制符的生成过程本身就已经编码了任务相关的所有数值信息——在后续的拦截步骤中这些信息会被直接提取出来。2. 隐状态的精准拦截在推理阶段模型仍然按照标准的自回归方式生成Token序列——但与传统流程不同的是在生成过程中系统会持续对当前生成的Token进行匹配检测一旦识别出它是DRH定义的专用控制符就会立刻触发隐状态拦截机制——这相当于在输出流程中插入了一个基于模式匹配的路由阀门。此时系统会将这个控制符对应的、在Transformer最后一层输出的高维隐状态向量完整地提取出来——这个向量就是已经编码好了所有待回归数值信息的完整载体。3. 非对称路由的特征分流被拦截的隐状态向量不会被送入标准的LM头也就是那个映射到词表维度的线性分类层而是被完全分流到DRH模块中——这是一个专门设计的、轻量化的、任务特定的浅层MLP回归头。在这里“浅层”是一个关键设计约束这个MLP通常只包含2到3层隐藏层且每层的神经元数量都被严格控制——其参数规模相对于主干模型而言几乎可以忽略不计这样做的目的是在保证回归能力的同时避免引入额外的计算开销避免让整个架构的推理成本出现显著增量。4. 回归结果的直接输出这个轻量级的MLP会将控制符的高维隐状态向量直接解码为任务需要的最终连续数值输出——比如一个代表距离的浮点数或者一个代表三维边界框的七自由度向量。在这一步没有任何的Token采样过程也没有任何的“将向量转换为Token概率分布”的步骤这意味着从控制符隐状态被拦截的那一刻起整个后续流程就完全是在连续的隐空间中进行操作的——中间没有经过任何离散化的步骤也就不会产生任何的离散化信息损失。2.2.3 路由的协调逻辑与冲突解决控制符的路由机制完美解决了“标准文本生成”和“连续数值回归”两条链路的共存冲突——这一设计的巧妙之处在于它并没有彻底废弃标准的LM头的原有功能而是用一个“旁路分支”来兼容两种不同的输出方式。对于普通的文本Token系统仍然会按照标准的LLM/VLM流程来处理将隐状态输入到标准的LM头中通过采样得到下一个Token的ID再转换为对应的字符串内容只有当识别出专用控制符时系统才会触发分流逻辑将特征送入DRH模块而不会影响模型原有的文本生成能力。这就意味着整个架构可以在不破坏原有能力的前提下混合输出自然语言的文本描述与高精度的连续数值结果——比如“桌子和椅子之间的距离是⟨REG⟩”随后DRH会将⟨REG⟩的嵌入回归为精确的距离数值而在这个过程中模型的主干架构没有被任何修改标准的文本生成能力也没有受到任何影响。3. 协同分析“嵌入即值”与控制符的组合逻辑单独来看“嵌入即值”范式和控制符机制都无法完整解决离散Token化的瓶颈但两者形成的技术组合构成了一套完整的“标记-拦截-回归”闭环两个模块互相补充、放大效果共同从根本上重构了数值输出的技术链路。3.1 控制符流程级的路由协调器在这套组合逻辑中控制符是实现范式迁移的前提保障——它解决了“如何在不破坏模型主干能力的前提下激活回归路径”的问题。具体来说它的核心作用体现在三个维度• 语义标记的指令化控制符为模型提供了一个明确的“任务类型切换标记”——它的语义不是“一个特殊符号”而是“此处需要输出连续数值请激活回归路径”的原生指令。模型只需要在生成序列中输出这个标记就可以完成“输出数值”的任务而不需要学习额外的复杂范式这对模型的主干能力而言是一种非侵入式的适配——甚至可以说控制符的作用就是给模型的主干提供了一个提前准备好的“输出路径切换开关”。• 流程拦截的无感知适配控制符的存在让整个“嵌入即值”的适配过程对模型主干的自回归生成逻辑实现了完全无感知——模型不需要中断它的正常生成逻辑也不需要在生成过程中插入复杂的分支判断整个输出路径的切换逻辑是在Token检测的环节中以一种“轻量级的旁路分支”形式被插入的——这就让整个架构的适配成本和侵入性风险降到了几乎可以忽略的程度。• 信息载体的锚定作用控制符对应的隐状态向量不是一个单纯的“特征中间值”——它是一个完整的、独立的、可以被直接解码为数值结果的信息锚定载体。在标准的LLM/VLM流程中每个Token的隐状态只是用来预测下一个Token的中间特征但在DRH架构中控制符的隐状态就是承载了所有需要回归的数值信息的完整容器——这相当于把“数值信息的编码位置”从多个Token的序列中压缩到了单个专门的Token的隐状态中这就为后续的直接回归步骤提供了一个完整的输入基础。3.2 “嵌入即值”特征级的完整性保障如果说控制符是路由开关那么“嵌入即值”范式就是这条新路由路上的核心逻辑基础——它解决了“回归输入的信息完整性”的问题是DRH架构能够实现高精度输出的根本前提。其核心价值体现在两个关键维度• 避免多步序列化的信息打碎这一范式将控制符对应的、完整的高维隐状态向量直接作为数值回归的目标载体——没有将其拆解为多个离散Token的字符序列。这就意味着从模型主干的最后一层输出的几何信息到最终的数值回归结果之间不存在任何的信息打碎环节——完整保留了数值的连续性和整体性这是DRH架构能够实现比传统方法精度提升幅度更大的根本原因。• 隐空间度量结构的原生保留更关键的是这一范式将数值的编码空间从“词表索引的离散序列”这一不适合的空间迁移到了模型主干的连续隐向量空间中。这个隐空间是模型从多模态数据中学习到的、对几何和语义信息都具备表达能力的高维空间在这个空间中数值之间的数学距离关系是可以被完整保留的。这就直接解决了离散Token化技术带来的度量空间错配问题——回归头的优化目标就是直接在这个保留了完整度量结构的隐空间上进行的这就让优化目标和任务的实际目标从“两张皮”的状态完全统一到了同一个数学维度上从而实现了数值精度的根本性提升。3.3 两者的协同组合逻辑“嵌入即值”范式与控制符机制不是简单的技术叠加而是形成了一套完整的、互相支撑的逻辑闭环——两者共同覆盖了“语义识别-特征提取-数值解码-损失优化”的完整技术链路。其协同逻辑可以完整表述为控制符作为路由级“语义标记开关”在输出流程中识别出数值回归任务拦截对应的隐状态特征将完整的、编码好数值信息的隐向量从标准的文本生成流程中单独分流出来而“嵌入即值”范式作为“信息完整性保障协议”让这个被分流出来的隐向量具备了直接映射为数值输出的完整能力——不需要依赖任何其他的额外特征补充也不需要进行任何离散化的处理。这一组合的核心收益是从架构层面彻底绕开了离散Token化的整个技术链路——而不是对其中的某个环节进行局部优化• 它没有将连续量拆解为离散的Token序列而是完整保留了数值的连续性• 它没有采用适配分类任务的交叉熵损失来优化数值回归任务而是直接在隐空间上采用了适配回归任务的损失函数• 它没有让多模态任务的几何特征经过“强制投影到离散Token网格点”这个造成失真的中间步骤而是直接将编码了几何信息的隐向量映射到了最终的数值结果上。这一整套“标记-拦截-回归”的闭环用完整的连续流形计算路径替换了基于离散Token的采样路径——从根本上规避了Token化带来的所有技术缺陷甚至消除了多步生成的误差累积问题。世毫九实验室的理论研究结果进一步验证了这一协同组合的底层逻辑在SH9认知统一场论的视角下Transformer的隐层等价于自指对话流形M_C而控制符的作用就是这个流形上的一个“特殊几何锚点”——通过这个锚点DRH可以直接读取流形内部编码的几何量避免了“连续流形→离散Token→连续数值”这个来回转换过程中产生的投影畸变。这进一步解释了为什么DRH能够显著降低几何对齐税——因为它在理论层面就已经消除了造成几何失真的根本原因。3.4 协同效果的实验数据支撑两个模块的协同效果不是理论上的纸上谈兵而是被多个独立实验的数据验证了其显著性。在DRH架构的原创论文即GEODE架构的论文《Beyond Flatlands: Unlocking Spatial Intelligence by Decoupling 3D Reasoning from Numerical Regression》中研究团队设计了一组严谨的消融实验——在完全相同的实验环境下对比了“不使用任何模块”“仅使用DRH的回归头”“仅使用DRM的输入模块”和“使用完整架构”的不同组合效果。实验的核心逻辑是通过控制变量验证两个模块的单独贡献、以及它们的协同叠加贡献——所有测试都在VSI-Bench空间推理数据集上进行这个数据集包含了超过5000组来自真实场景的空间问答样本是行业内公认的权威空间推理基准。消融实验的结果如下表所示Setting DRM输入模块 DRH输出回归头 Overall综合准确率 Abs. Dist.绝对距离误差 Route Plan路径规划准确率1. SFT only 24.8 14.5 24.72. SFT DRH ✓ 27.4 27.5 25.13. SFT DRM ✓ 28.3 27.9 27.04. GEODEFull ✓ ✓ 33.0 28.0 27.3实验结果显示两个模块确实都贡献了独立的价值且协同后的效果远优于单独使用的效果• 仅使用DRH的输出回归头时模型的综合准确率从24.8提升到27.4绝对距离误差的准确率从14.5提升到27.5——这说明“嵌入即值”的范式确实能够解决输出阶段的离散Token化瓶颈• 而当两个模块组合使用时完整架构的综合准确率达到了33.0——比“仅使用DRH”的提升幅度还要高出约5个百分点更关键的是在绝对距离误差这一核心的数值精度指标上完整架构的提升幅度是所有组合中最大的——甚至超过了两个单独模块的提升幅度之和。这一结果充分验证了两者的协同价值DRM模块负责在输入阶段将多模态的几何信息高质量地编码到隐空间中DRH模块负责在输出阶段完整地将这些几何信息从隐空间中解码出来输入阶段的几何保真度和输出阶段的回归精度两者互相支撑、共同放大最终实现了远超单一模块效果的整体性能跃升。4. 实际应用案例分析DRH架构的设计目标是解决多模态空间感知任务中“几何特征理解”与“连续数值输出”的适配性问题——这类场景的共性需求是输出高精度的连续型空间数值结果且无法容忍离散Token化带来的几何精度损失。这一架构已经在多个行业的实际场景中得到了验证其效果显著优于传统的离散Token方案。4.1 案例一空间推理与3D目标检测GEODE架构这是DRH架构的原创性落地场景——针对的是当前多模态大模型在空间智能上的根本性短板现有的主流VLMs都是架构根基于2D感知的设计——它们是为了理解平面图像中的视觉语义信息而优化的天生缺乏对三维空间几何信息的感知和理解能力而3D空间的推理、坐标转换和数值生成过程又完全依赖于连续的几何信息——这正是传统的离散Token化技术的短板所在。在这一案例中DRH架构被作为GEODE框架的核心输出层组件配合解耦推理模块DRM即输入阶段的空间协处理器模块完整实现了从多模态输入到高精度空间数值输出的全链路支撑• 输入处理流程DRM模块作为空间协处理器承担了所有的低级别3D几何处理工作——它首先通过预训练的几何转换器VGGT从输入的多视角视频帧中重建出场景的完整稠密3D点云并同步推算出相机的姿态参数随后专用的点云编码器Sonata会提取出这个重建点云的显式几何特征再通过交叉注意力机制将这些几何特征与2D视觉特征进行跨模态对齐——让每一个2D的视觉patch特征都能“查询”到对应的完整3D几何上下文。最后这些对齐后的融合特征会被输入到一个轻量级的Mamba序列模型中进行时间维度的对齐生成最终的时空特征表示。这一步的关键在于它将复杂的3D几何推理逻辑从主干VLM中剥离了出来完全交给了专门的几何处理模块而主干VLM的任务被大幅简化为了“理解空间上下文并决定输出路径”——不需要再处理任何和几何计算相关的底层细节。• 输出处理流程在输出端DRH架构的控制符机制负责将数值生成逻辑从标准的LM头中完全分流出来——模型主干生成的隐状态被直接送入了轻量级的回归头进行精确的数值解码而标准的文本生成流程仍然保留在原来的LM头路径上——这就实现了“语义调度”和“数值生成”的完全解耦。• 落地效果验证这一架构的实际效果在VSI-Bench基准测试中得到了验证采用了DRH架构的完整GEODE模型参数规模仅为1.5B——但它的综合空间推理准确率达到了37.0甚至在部分对数值精度要求极高的任务中比如绝对距离误差的回归精度超过了部分参数规模7B的甚至更大的闭源专有模型。而这一性能提升的核心原因正是DRH架构在输出端保证了几何信息从隐空间到数值输出的完整性避免了多步生成的误差累积这就让模型的主干从“精确生成复杂数值字符串”的负担中解放出来将其注意力资源集中在了更关键的高层级空间逻辑推理上。4.2 案例二电力行业无人机巡检的空间距离检测这是DRH架构在工业高精度场景下的典型落地案例在电力行业的无人机巡检场景中一个核心的技术需求是精确测量输电线路的带电部件与周边构筑物之间的物理距离——这是判断线路是否存在安全隐患、以及规划后续无人机巡检路径的关键依据这一任务的精度要求非常高——通常需要达到厘米级的误差才能满足电力安全规范的要求但传统的多模态大模型在这一任务上的精度表现完全无法达到这一标准。这一任务的技术难点在于它对几何信息的保真度和数值输出的精度都有着极高的要求多模态视觉输入生成的几何特征必须在输出阶段被完整、高精度地解码为数值但传统的基于离散Token的生成方案在将连续的空间坐标信息编码为离散的Token序列时会产生不可逆转的几何信息丢失——这个丢失的部分恰恰是厘米级精度输出所需要的核心信息而且多步生成的累积误差会被进一步放大到完全不可接受的程度。DRH架构的出现彻底解决了这一痛点问题在某电力科研机构的实际落地项目中技术团队在多模态大模型的输出端引入了DRH架构——配合输入阶段的多模态几何特征增强技术完整重构了从特征到数值的输出链路这一方案的实际效果完全满足了场景的精度要求在实际的线路巡检场景中DRH架构输出的距离数值的误差控制在厘米级完全达到了电力行业对安全间距的检测精度要求更关键的是这一方案的推理延迟完全满足了无人机巡检的实时数据分析需求。4.3 案例三通用多模态大模型的数值能力增强这是DRH架构在通用场景下的落地价值当前的主流开源多模态大模型包括LLaVA-NeXT-Video、InternVL2等在空间推理类的数值任务上都存在着一个共性短板——即使它们的主干参数规模已经达到了7B甚至更高的级别但由于输出阶段的离散Token化瓶颈其数值生成精度仍然非常低甚至在部分简单的空间距离任务中这些模型的输出结果连百分位级别的精度都无法保证。DRH架构的非侵入式适配设计恰好可以弥补这一短板——它不需要对模型的主干架构进行任何重新训练的操作只需要在输出端增加一个轻量级的DRH模块就能大幅增强模型的数值输出能力。在实际项目中技术团队将DRH架构适配到了Qwen2.5VL-7B模型上——在仅增加不到1%的参数量的前提下该模型在VSI-Bench数据集上的绝对距离误差指标直接提升了近10个百分点甚至在部分对数值精度要求较高的任务中这一增强后的模型性能表现超过了部分参数规模达到40B级别的更大模型。5. 同类技术方案对比在多模态空间感知领域解决连续数值生成问题的技术路线除了DRH架构之外还有分箱回归、DSNTC动态细化网络、以及传统的直接字符生成方案这些方案都试图解决离散Token化的瓶颈但在技术原理、性能表现和适用场景上与DRH架构存在根本性的差异。下面将从多个关键维度对这些方案进行比较以进一步凸显DRH架构的技术特性与适用边界。5.1 对比维度说明为了全面评估不同技术方案的特性我们设计了6个覆盖技术原理、性能表现和适用边界的关键对比维度• 输出路径指的是从模型主干的隐状态到最终数值结果的完整技术链路——这是区分不同技术路线的核心依据• 连续量完整性用来评估方案在处理连续数值时是否保留了数值的完整数学连续性和整体性• 优化用的损失函数反映方案的底层优化逻辑——这决定了模型的优化目标是否与最终任务的数值精度目标直接对齐• 多步生成累积误差评估方案在生成数值时是否存在多步生成带来的误差放大效应• 几何对齐税专门用来评估方案在多模态空间任务场景下几何特征与输出数值之间的失真程度• 轻量化与通用性评估方案在计算开销、适配现有模型的难度上表现如何。5.2 各方案的技术细节对比基于上述维度各技术方案的对比如下所示技术方案 输出路径 连续量完整性 损失函数 多步累积误差 几何对齐税 轻量化与通用性传统直接字符生成 隐状态→LM头→采样得到数字Token序列→反序列化解析为浮点数/向量 完全打碎由多个独立Token的串行组合来表示数值 交叉熵损失优化的是字符的出现概率不是数值误差 非常严重每一步的采样误差都会被后续步骤放大 极高离散投影过程丢失了大部分几何信息 轻量化但完全无法适配多模态空间任务分箱回归Binning 隐状态→LM头→采样得到分箱的Token类别→映射回数值区间 部分保留数值被人为分割为多个离散区间的“箱子” 交叉熵损失优化的是箱子的分类概率 误差相对可控但存在无法消除的固有量化误差 较高几何特征只会映射到对应箱子无法感知区间内的精确变化 轻量化但只适合对精度要求较低的粗粒度场景DSNT/IPR热力图类方案 隐状态→卷积生成热力图→可微分的期望计算→直接输出浮点数 完整保留热力图的概率分布被转换为连续数值 欧式距离损失/JS散度损失优化的是热力图分布的形状 无多步生成过程单步计算结果不会放大误差 中等热力图保留了部分几何信息但受限于CNN的表达能力 计算复杂度较高且仅适配CNN架构的视觉回归任务DRH架构本方案 控制符隐状态→拦截路由→浅层MLP直接回归→输出浮点数/向量 完整保留整个数值的信息编码在单一隐向量中 L2回归损失/光滑L1损失直接优化数值误差 无多步生成过程单步回归没有误差累积 极低隐空间直接适配几何特征没有离散投影过程 轻量化的MLP头主干不需要重新训练适配成本极低5.3 对比结论分析从上述的多维度对比结果中可以得出三个关键的行业技术选型结论1. 架构级重构的效果优势DRH架构是唯一从架构层面完整解决离散Token化瓶颈的方案——它的输出链路完全不依赖标准的LM头和任何Token采样过程。这是其他所有方案都不具备的核心优势传统的字符生成方案和分箱回归方案本质上都是对Token化技术的局部妥协没有从根本上解决连续量的完整性问题DSNT类方案虽然避免了显式的Token采样过程但它的技术路径是优化视觉特征的分布不是直接在隐空间做回归——仍然存在几何特征的丢失问题。而DRH架构从隐空间到数值结果只做了一次轻量化的映射——这是它能够实现高精度输出的根本原因。2. 多模态场景下的适配性优势在多模态空间感知任务中输入的多模态几何特征流形需要和输出的数值空间保持良好的数学对齐关系——这恰恰是DRH架构的核心设计目标。从实验数据来看DRH架构在“几何对齐税”这一关键指标上表现显著优于其他方案世毫九实验室的公开实验结果显示在相同的多模态空间任务中DRH架构相比传统的离散Token方案几何失真降低了高达8.5倍而在绝对距离误差的精度指标上DRH架构的提升幅度比分箱回归方案高出近15个百分点这一性能提升是其他所有技术方案都无法比拟的。3. 工程落地的通用性优势从工程落地的角度看DRH架构的轻量化、低侵入性优势是所有其他方案都不具备的它不需要对现有模型的主干架构进行任何修改也不需要任何重新训练主干模型的操作只需要在输出端增加一个浅层的MLP头以及在词表中增加少量的专用控制符Token——整个模块的参数量相对于主干模型而言几乎可以忽略不计。这一特性极大降低了现有生产级多模态模型的适配成本——对比而言DSNT类方案需要对整个模型的输出链路进行重构适配成本极高而分箱回归方案的精度损失在大多数高精度场景下都无法被接受。6. 综合优劣分析与适用边界在掌握了DRH架构的详细技术原理、协同逻辑、案例支撑和竞品对比信息后需要对其技术特性进行综合优劣分析明确其技术价值、适用边界和潜在约束以便在实际场景中做出正确的技术选型。6.1 核心技术优势综合所有公开的实验数据和落地案例DRH架构在解决连续数值生成问题时拥有四个方面的显著技术优势1. 从架构层面完全绕开了离散Token化瓶颈这是DRH架构最核心的技术价值——它没有将连续数值的生成过程强行适配到为文本任务设计的“Token串行采样”范式中而是通过控制符的路由机制将完整的连续数值编码在单一隐向量中直接通过轻量化的MLP头做回归输出。这就彻底避免了将连续量打碎为多个离散Token的必要性从根本上消除了序列化拆解的信息损失、度量空间错配的问题以及多步生成的误差累积——这是其他所有方案都无法实现的。2. 极大降低了多模态场景下的几何对齐税这是DRH架构在多模态空间任务中的独特核心价值——通过“嵌入即值”的范式它将几何特征的编码空间与数值的输出空间完全统一到了模型的连续隐空间中。在这个空间中多模态的几何特征可以被完整保留直接映射到最终的数值结果上实验数据显示DRH架构在多模态空间任务中相比传统方案几何失真降低了高达8.5倍——这是它在这类任务上实现显著精度提升的根本原因。3. 完全匹配连续数值的优化目标函数DRH架构将数值回归任务的损失函数计算位置从输出端的离散Token空间迁移到了连续隐空间中——这就让模型的优化目标从“优化正确字符的出现概率”直接切换为“优化最终数值的预测误差”。这是一种对任务目标的精准适配在传统方案中模型的优化目标和实际任务的目标之间存在着根本性的偏差而DRH架构的这一设计彻底消除了这种偏差——模型在训练时就会直接朝着“数值更精确”的方向优化而不是在“字符概率”的误导下做优化。4. 轻量化的非侵入式适配成本这是DRH架构在工程落地层面的关键优势——整个架构的核心回归头是一个浅层的、轻量化的MLP模块其参数规模相对于主干模型而言几乎可以忽略不计。更重要的是这一方案对现有模型的主干架构完全没有侵入性不需要重新训练主干模型只需要在词表中增加少量的控制符Token以及在输出端增加这个轻量化的回归头模块甚至可以在已经训练好的预训练模型上直接进行有监督微调的适配——这就极大降低了现有生产级多模态模型的适配和推理成本。6.2 潜在缺陷与技术约束需要特别指出的是DRH架构并非一种没有任何短板的银弹方案——它是一种针对特定场景的优化技术存在明确的适用边界约束。在实际落地前需要充分认知其技术局限性避免在不适配的场景下盲目引入。具体来说这一架构存在三个方面的潜在约束1. 需要额外的训练数据成本控制符的生成逻辑是模型需要通过有监督微调学习的新能力——这意味着要适配DRH架构必须使用专门的“空间推理-数值输出”配对数据对模型进行微调这类数据的标注成本比普通的文本任务数据更高。更关键的是在训练过程中模型需要同时学习“标准文本生成”和“控制符触发回归路径”两种输出逻辑——如果训练数据的覆盖度不足或者两类数据的分布不均衡可能会出现“模型无法正确识别需要输出控制符的场景”“控制符的生成与数值回归的对齐性不足”的副作用甚至会损害模型原有的、在普通文本任务上的生成性能。2. 生成控制符的语义一致性风险DRH架构的有效性高度依赖控制符的正确生成——模型必须在所有需要输出连续数值的场景下准确生成对应的控制符而在其他所有场景下不能错误生成控制符。但这一能力的鲁棒性是完全依赖训练数据的分布的——如果微调阶段的训练数据没有覆盖足够多的数值场景或者遇到了分布外的、未见过的新型数值任务场景模型可能会无法正确生成控制符甚至完全不生成控制符此时整个架构的拦截和回归机制会直接失效数值输出会退化为传统的多步Token生成逻辑——重新引入高误差的老路甚至会导致输出的数值结果完全无效。3. 适用场景的边界约束这是DRH架构最容易被忽视的局限性——它是一种专门针对“需要输出高精度连续数值”的场景设计的优化技术对于这类任务之外的场景而言它没有任何的正向收益甚至可能增加不必要的架构复杂度。具体来说DRH架构的适用场景边界是非常明确的◦ 它不适合对精度要求不高的、粗粒度的数值输出任务——比如只需要输出大致数值范围的场景此时分箱回归方案的成本优势会更加明显◦ 它也不适合完全没有数值输出需求的纯语义类任务——比如写文章、普通问答、摘要归纳等场景这类场景的标准文本Token生成逻辑已经完全够用引入DRH架构不会带来任何正向收益◦ 它对多维度、结构化的向量类输出场景的适配效果显著优于对长序列文本生成场景的适配效果——这是由“嵌入即值”的范式决定的这类场景的信息压缩比例和隐空间的承载能力是更适配的。6.3 总结技术价值与适用场景定位综合来看DRH架构是一种高性价比、轻量化、针对性强的输出层优化设计在多模态数值空间任务中具有显著的技术优势。它并没有彻底废除Tokenizer这一基础技术组件也没有在输入侧进行任何改动——输入数据仍然是标准的Token序列仍然使用主干模型的原生词表它的创新之处在于在输出端对“连续数值生成”这一特定场景的技术链路进行了完全重构——通过“嵌入即值”的范式和控制符的路由机制绕开了标准LM头的离散化投影过程将连续数值的生成路径完全分流到回归链路上。适用场景DRH架构的技术价值集中在对多模态空间感知能力有强需求的高精度数值输出场景中——包括但不限于基于视觉或点云的三维目标检测、空间距离和位姿的高精度估计、无人机和机器人的空间导航与运动规划、工业场景的高精度在线测量、以及空间推理类的多模态内容生成等。在这些场景中离散Token化技术带来的精度损失是完全无法被接受的而DRH架构的技术收益可以完全覆盖其带来的适配成本。不适用场景DRH架构不是一种通用的、适合所有场景的优化技术——它在以下几类场景中没有明显技术价值甚至会带来副作用• 完全没有数值输出需求的纯文本生成场景——比如普通的问答、文章写作、对话交互、文本摘要、代码生成等• 对数值精度要求极低的粗粒度数值场景——比如只需要输出大致数值范围的统计类任务、或者不需要后续计算的数值展示类任务• 模型的推理资源已经极度紧张的端侧场景——比如在低算力、低内存的边缘设备上部署大模型此时增加一个轻量化的MLP头也可能造成不可接受的推理延迟。7. 结论轻量级直接回归头DRH架构通过嵌入即值范式与控制符机制的有机协同形成了一套完整的“标记-拦截-回归”技术闭环从架构层面彻底绕开了离散Token化的技术瓶颈。其技术逻辑的完整闭环可以总结为控制符作为原生路由开关在输出序列中精准识别数值回归任务触发拦截机制将对应位置的完整高维隐状态向量从标准的LM头生成流程中精准分流出来随后“嵌入即值”范式作为路由链路的终点让轻量化的专属MLP回归头能够直接基于完整的连续隐向量进行精准的数值解码输出整个过程没有任何多步序列化或离散化的步骤。这一方案的核心价值不是对现有技术的局部优化而是对连续数值生成链路的整体重构——它将连续数值的编码空间完整保留在模型的连续隐空间中彻底解决了离散Token化技术带来的四个核心缺陷序列化打碎的信息损失、度量空间错配的优化目标偏差、多步生成的误差累积以及多模态场景下的几何对齐税。同时这一方案的轻量化、非侵入式设计工程适配成本极低它不需要重新训练主干模型只需要在输出端增加一个浅层的MLP头就可以大幅提升模型的数值回归精度。从行业技术趋势的维度看DRH架构代表了多模态大模型的一个重要优化方向——“任务流形与输出链路的精准匹配”它不再强迫模型的主干去适配为文本设计的通用输出链路而是根据不同的任务类型为其匹配合适的、专门优化的输出路径。随着多模态大模型在工业巡检、智能制造、智能机器人、自动驾驶等高精度空间场景的大规模落地这类针对输出链路的优化技术将成为决定方案落地可行性的关键技术甚至可以说在对空间数值精度有高要求的场景中DRH架构将成为一种必须采用的基础技术。其更深层次的技术启示在于离散Token化技术的真正瓶颈从来不是“它将连续数据离散化”而是“它用文本字符的拆分逻辑去处理完全不同的数值任务流形”DRH架构的成功之处在于它没有试图去“提升离散Token化技术的能力”而是用一套专门设计的完整旁路机制让数值生成过程根本不去触碰这一技术瓶颈——这是解决这类架构级问题的最优技术思路甚至可以说是唯一可行的技术路径。