这项由独立研究者发表的论文于2026年7月以预印本形式公开论文编号为arXiv:2607.23693题为《Compute Globally, Materialize Locally: The Memory Contract of Sparse Event-KV》感兴趣的读者可通过该编号查阅完整原文。当我们谈到人工智能记忆的时候很多人会以为AI记住某件事就是把那件事的原始文字存下来要用的时候再取出来读一遍。这个理解在大多数情况下没问题但这篇研究告诉我们真实情况远比这复杂也远比这神奇——AI有时候在彻底遗忘某条原始信息之后仍然能正确回答依赖那条信息的问题而且它并没有作弊。这不是魔法而是大语言模型在处理信息时留下的一种计算痕迹这篇研究把这种现象命名为**语义物化**semantic materialization。要理解这个现象先从一个日常的比喻说起。假设你在一家餐厅工作你的任务是记录每天的食材状态并转告给同事。某天你告诉同事小李今天的鱼货是新鲜的小李把这话记在心里随后又转告了另一位同事小王小李说货是新鲜的。第二天你忘了最初是你说的这句话档案室里那张鱼货新鲜的记录纸也被销毁了。此时有人来问小王今天鱼货新不新鲜小王说新鲜的。——他是从哪里知道的他没有看过原始记录但这个信息已经通过传话链条留在了他的记忆里。这篇研究要证明的正是AI系统里存在类似的现象而且比这个餐厅故事还要精确和可测量。**一、问题从哪里来AI的记忆账本并不简单**现代大语言模型在处理长对话或长文档时会产生一种叫做KV缓存KV Cache的数据结构。你可以把它理解成AI在阅读每一段文字时在大脑里留下的阅读笔记——每读一个词或一句话就在笔记本上写下一些数字记录它在当前上下文中的含义。当AI系统需要管理非常长的历史对话时不可能把所有阅读笔记都保留下来内存不够用。所以系统会有选择地丢弃一部分笔记只保留它认为重要的那些。这个丢弃操作被称为缓存驱逐eviction。问题来了当你丢掉一页笔记的时候你真的只是丢掉了那一页纸上的字吗还是说那页纸上的内容早已渗透进了后续的笔记里即使原稿不在了信息依然还在这正是这篇研究要回答的核心问题。研究者认为现有的AI记忆管理系统在验证某条记录是否可以安全删除时使用的是一个有缺陷的逻辑如果删掉它之后模型的回答准确率没有下降就认为这条记录是多余的。但这个逻辑忽视了一种可能性——也许准确率没有下降不是因为那条记录本来就没用而是因为它的内容早就被复制进了后续某条被保留的记录里。**二、实验设计一场极其严格的信息追踪游戏**为了验证这一猜想研究者设计了一种叫做捐赠者对donor pair的对比实验。这个设计非常精妙值得细细说清楚。研究者构造了一段AI的历史记录其中包含若干个事件比如S寄存器的状态是在线ONLINE是一个源事件M镜像了S的状态是一个后续的根事件。注意根事件本身并没有说M是什么状态它只是说M跟着S走。在全量处理即AI一次性阅读所有历史之后根事件所对应的KV缓存行就已经见过了源事件它的数字表示里理论上可能已经包含了S是在线这个信息。然后研究者在向AI提问时把源事件的缓存行悄悄删除只保留根事件的缓存行然后问AIM现在是什么状态关键在于被提问时AI看到的文字里完全没有任何地方说M是在线的——源事件被删了根事件只说M镜像S没有任何值。那AI回答在线从哪里来的为了确保实验结论是可信的研究者同时构造了一个孪生历史版本除了把源事件改为S是离线OFFLINE之外其他所有东西——文字内容、位置、格式——完全一模一样。然后再用同样的方式问AIM是什么状态如果AI在第一个版本里回答在线在第二个版本里回答离线并且两个版本里被实际提供给AI的文字内容完全相同、只有那个被删除的源事件不同那就说明AI的回答里包含的信息只能来自那个被删除的源事件通过某种方式留在了根事件的缓存行里。**三、震惊的实验结果99比0**实验结果非常惊人。在Qwen3-8B这个模型上研究者跑了99组这样的对比对在对AI回答有影响的这些对里有99组的回答方向跟那个被删除的源事件一致0组相反。统计学上的p值是3.2×10???这个数字的意思是这种结果纯属巧合的概率极其渺茫相当于你抛了100次硬币每次都正面朝上。更进一步的256组复制实验里130组的回答跟被删除的源事件一致0组相反还有125组是两个版本AI给了相同的回答说明这些问题本身跟那个源事件关系不大。这个结果不是特定于某一个模型的。研究者在Ministral-3-8B上跑了类似实验结果是90比1在Gemma-4-12B上跑了另一种方式的实验结果是80比0。换句话说这个现象在多个不同的AI模型上都成立。简单来说一个AI在阅读完整的历史记录之后它后续生成的某些笔记会把早期看到的信息预先消化进去。即使你把早期那页原始笔记销毁那个信息依然以某种形式存在于后续的笔记里并且在被单独拿出来使用的时候能够指导AI给出正确的答案。这就是研究者所定义的语义物化——计算过程在下游事件的缓存行里留下了上游信息的印记而这个印记独立于原始的文字存在。**四、这个现象的边界在哪里信息能传递多少**发现了这个现象之后研究者没有止步而是继续追问这个隐形传递能传递多少信息是什么样的信息都能传还是有明确的边界研究者用一种很直观的方式来测试把需要传递的信息分成不同复杂程度的类别然后看看每种复杂程度的信息传递成功率。最简单的是二元状态也就是是/否、在线/离线这种只有两个选项的状态。实验结果是这类信息传递的准确率高达0.934也就是说94%的时候AI能根据那个被删除源事件的内容给出正确答案而纯靠猜的准确率只有0.5。接下来是四选一的状态比如北/南/东/西这种有四个选项的情况。准确率直接掉到了0.223已经非常接近纯猜的准确率0.25了。八选一的情况更糟糕准确率只有0.156而随机猜测的准确率是0.125——几乎已经在猜了。三位数字这种具体的数值准确率是0完全没有传递。这个规律很清晰缓存行能携带的是粗粒度的状态信号而不是精确的数值。就像你告诉同事那道菜辣同事能记住辣这个大方向但如果你说那道菜辣度是7.4分同事大概率只记住很辣或者忘了具体数字。研究者还特别测试了一种情况如果源事件包含的不是直接的状态值而是需要计算才能得出的结论比如传感器读数超过阈值警报应该触发——这种需要推理才能得出的结论在没有额外提示的情况下也无法通过缓存行的隐形传递被恢复出来。研究者把这种现象概括为一个紧凑状态信封二元信息能进入这个信封并被传递更复杂的信息超出了信封的容量。**五、触发条件不是所有表达方式都能写入这个信封**发现了这个现象存在之后研究者开始探究另一个重要问题哪些表达方式能让这种信息传递发生哪些不能他们设计了16种不同的措辞方式分成两大家族。一种是镜像表达比如M跟随S、M镜像S、M复制S、M影随S等描述的语义基本相同都是M的状态与S保持一致。另一种是标志表达比如r传感器的警报标志与检测结果一致、警报标志根据检测结果更新等同样都是描述某个值跟另一个值保持一致。然后研究者测试每种措辞在缓存行上实际写入了多少信息——也就是说当源事件被删除之后使用这种措辞的根事件其缓存行能多准确地指导AI回答出正确答案。结果出人意料。M跟随S这种表达方式在Qwen3-8B上的写入率是0.83而M与S同步这种表达方式的写入率只有0.45——两者语义几乎完全相同但效果相差近一倍。同样标志与结果一致的写入率是0.94而标志据结果赋值只有0.48。更重要的是研究者同时测试了AI理解这些表达方式的能力——也就是在提供完整原始信息时AI能不能正确回答问题。结果是几乎所有16种表达方式的理解准确率都接近1.0平均值是0.98。这说明AI完全理解了这些表达它们在语义上没有任何区别。但理解不等于写入理解了某个表达方式不代表在处理这个表达时AI会把相关信息写入后续缓存行。这就是一个非常反直觉的发现对AI来说两种语义完全等价、理解程度完全一样的表达在信息物化进缓存行这个操作上可以有天壤之别。不仅如此这种差异还因模型而异。Qwen3认为镜像是个好词写入率0.80但Gemma-4对这16种表达的写入率普遍在0.41到0.67之间没有一种能超过0.75的强写入阈值。这意味着在某个模型上有效的表达方式在另一个模型上不一定有效需要针对不同模型单独校准。**六、信息落在哪里根事件和边缘事件的不同角色**研究者还探究了一个有趣的问题在一条传话链里信息究竟落在哪个节点上他们构造了这样一条链S寄存器的值→M镜像S→T镜像M。在这条链上M是根事件直接指向源T是边缘事件指向根而不是源。实验结果显示当只保留M的缓存行同时删除S和T的记录时AI能以很高的准确率回答M的状态也能借助M的缓存行回答T的状态因为T通过M来路由信息。但当只保留T的缓存行删除S和M的记录时AI对T的状态几乎什么都答不出来——准确率跟随机猜测差不多。这说明边缘事件T本身并没有直接存储源事件S的信息它只是知道应该去问M。当M不在场时T就失去了这个路由路径也就说不出正确答案了。反过来如果同时保留M和T然后问T的状态AI能正确回答因为T可以通过M找到答案。如果再把M从保留集合里拿掉只剩T准确率立刻崩溃。研究者在Gemma-4-12B上跑这个有无根事件的对比结果是41比0——有根事件时41对问题都给出了正确的方向没有根事件时几乎什么都不剩只有2比0且根事件单独也显示89比0。这种现象被研究者概括为根事件携带信息边缘事件路由信息。在设计AI记忆系统时这意味着哪些缓存行真正值得保留不是看它们在话题链里的位置离问题最近而是看它们是否是信息链里真正落地的节点。**七、能不能主动利用这个现象从意外发现到刻意设计**到这里研究已经确认了一个自然存在的现象。但研究者更进一步问了一个更有工程价值的问题既然信息能被物化进缓存行那我们能不能主动设计一个事件专门用来把信息存储进缓存行里以备将来使用他们把不同的载体事件设计成五个级别从弱到强依次是被动提及passive mention就是自然语言里随便提到了一下某个值有依据的绑定grounded binding明确说某个值跟另一个值绑定结构化指令structured directive自然语言计算指令NL compute directive类似于现在判断结果并记录在这里以及最强的显式文字记录explicit text直接把答案写出来。每种级别对应的捐赠者对跟随率如下被动提及只有6%有依据的绑定9%结构化指令23%自然语言计算指令51%显式文字记录100%。这意味着如果在AI处理历史记录的时候在源事件之后紧跟着插入一个请现在推断结论并记录这样的指令性事件那么这个事件的缓存行在源事件被删除之后仍然能让AI以51%的概率给出正确答案而源事件本身什么都没保留。相比于没有任何刻意设计时的6%这是一个8倍以上的提升。这就是研究者所说的可编程的原语你可以主动在AI的历史记录里插入特定设计的载体事件专门用于在源事件被删除后延续信息。这对于长期运行的AI代理系统来说具有实际的工程意义。不过研究者也诚实地指出了这个方法的局限最可靠的回退方案仍然是显式文字记录100%也就是直接把信息写进文字。自然语言计算指令能做到51%但这个数字本身仍然意味着近一半的时候它失败了。因此这种隐性缓存物化更适合作为一种辅助机制而不是完全替代明确文字记录的主要机制。**八、在真实对话里有没有用自然对话的检验结果**既然刻意设计的载体事件有效那么在真实的长期对话里那些自然出现的提及是否也能达到类似的效果比如在一段持续了21天的对话历史里早期提到过一件事中间某个时候又随口提了一下那么到了对话末尾只保留随口提了一下那次提及的缓存行能不能帮助AI回答出相关问题研究者用了两个真实的长期对话数据集来测试这个问题一个叫REALTALK包含了21天的真实对话另一个叫LoCoMo是评估AI长期记忆能力的标准测试集。他们把自然对话里那些随口提及的事件的缓存行单独提取出来跟不使用任何历史上下文的孤立编码进行对比看看使用缓存行的AI是否比重新孤立地读那段文字的AI表现更好。结果是没有检测到任何优势。在Qwen3-8B上用了自然提及缓存行的版本跟孤立编码的版本准确率几乎相同甚至在LoCoMo数据集上略低差了0.044。在Gemma-4-12B上LoCoMo数据集的结果在统计意义上等同于孤立编码。这个结果说明自然对话里那些随口提及并不是可靠的信息写入载体。它们可能提及了但没有触发缓存行里的信息物化。刻意设计的载体事件和自然发生的提及效果截然不同。研究者把这个结论表述得非常精确被动地收割自然对话里的提及不是一个可依赖的信息写入接口。这意味着任何想利用这个现象设计AI记忆系统的工程师不能依赖自然对话里随机出现的提及来作为信息载体必须有意识地插入专门设计的载体事件。**九、这对删除不重要的信息这个操作意味着什么**研究者在结论部分特别强调了一个对现有AI系统评估实践的重要警示当一个系统删除了某个不重要的记录然后发现模型的回答准确率没有变化就认为这个记录确实不重要——这个逻辑是有漏洞的。因为系统可能恰好保留了一个在全量处理时见过那个被删除记录的后续缓存行而这个缓存行里已经物化了被删除记录的信息。所以准确率没有下降不是因为那个被删除的记录原本就没用而是因为它的信息已经被转移到了别处。如果你在之后再删掉那个后续缓存行信息才真正消失。换句话说删掉之后准确率不变只能说明在当前的保留集合下被删除的记录是冗余的——但它冗余是因为它的信息已经被下游某个保留的缓存行替代了而不是因为这个信息本身无关紧要。这对AI记忆系统的评估方式提出了一个更高的要求不能仅仅看删除某条记录后准确率是否变化还需要考虑下游的哪些缓存行可能已经继承了那条记录的信息。**十、模型之间的差异与通用性问题**研究者在多个不同的模型上测试了这些现象并发现了一些有趣的跨模型规律也发现了一些差异。Qwen3-8B是研究中测试最完整的模型表现出了非常清晰的语义物化现象也对不同的触发措辞表现出了明显的敏感性。Ministral-3-8B也表现出了类似的物化现象但它的自由生成接口有一个问题很多时候它会给出冗长的推理过程但不给出明确答案导致很多实验结果无法判断方向。Gemma-4-12B则表现出了一个很有趣的特点虽然它在16种触发措辞上的写入率没有任何一种能超过0.75的阈值但通过另一种候选逻辑值探测的方式可以发现它其实在缓存行里存储了相关信息只是它的自由生成接口没有把这个信息表达出来。这种存储了但说不出来的现象被研究者称为理解但未原生生成的分裂模型的缓存行里有信息但在被问到时它不会主动说出来除非你用特定的方式问它。这个发现有一个重要的实践含义对某个模型有效的触发措辞不一定对另一个模型有效在某个模型上能正常读出来的信息可能在另一个模型上需要用不同的提问方式才能读出来。因此这整套机制都需要针对具体模型进行校准没有一种通用的、在所有模型上都有效的方案。---归根结底这篇研究揭示了一件让人重新思考AI记忆本质的事情AI处理信息不只是读了就忘它在阅读的过程中会把信息烙印在后续的计算结果里而这些烙印即使在原始信息消失之后有时仍然能够被正确地读取出来。这不是AI在欺骗我们而是大型语言模型架构的一种内在属性——信息在被处理时会以某种形式流淌到下游的计算节点里。对于普通用户来说这可能只是一个有趣的技术细节。但对于正在构建AI代理系统的工程师来说这意味着他们手里多了一个可以主动设计的工具通过在合适的时机插入合适措辞的载体事件可以让AI在丢失原始记录之后仍然保留关键的状态信息。同时他们也需要警惕删除一条记录后准确率不变不代表那条记录真的没用。这项研究带来的最大思考是当我们设计AI的长期记忆时保留什么这个问题不仅是在选择保留哪些文字更是在选择保留哪些计算痕迹。而计算痕迹的价值往往比文字本身的价值更难评估也更容易被忽视。原论文编号arXiv:2607.23693希望有兴趣的读者能够深入探索这个领域里还有多少类似的隐藏规律等待被发现。---QAQ1语义物化semantic materialization是什么意思A语义物化是指大语言模型在一次完整阅读历史记录的过程中会把早期信息的计算结果写入到后续事件的KV缓存行里。即使后来原始的源事件记录被删除了那个后续缓存行仍然可能保留着足够的信息让模型能够正确回答依赖那条被删除信息的问题。简单说就是虽然原稿没了但信息已经渗透进了后续的笔记里。Q2KV缓存驱逐实验里的99比0说明了什么A这个99比0的实验结果说明在Qwen3-8B模型上当源事件被删除、只保留根事件的缓存行时99个对比对里有99个的回答方向跟那个被删除的源事件一致0个相反。由于被提供给模型的文字内容在两个版本里完全相同这就证明了回答里的信息只能来自被删除源事件通过缓存行留下的计算痕迹而不是来自任何可见的文字。Q3主动设计载体事件来保存AI记忆的方法可靠吗A根据这篇研究的实验结果使用自然语言计算指令比如请现在推断结论并记录这类刻意设计的载体事件能把信息的跟随率从6%提升到51%。但这仍然意味着接近一半的时候会失败。最可靠的方式仍然是直接用文字把信息明确写出来100%有效。因此这种缓存物化机制更适合作为辅助手段而不是替代明确文字记录的主要方案且有效性还会因模型不同而变化需要针对具体模型进行校准。