相关链接论文DOIhttps://doi.org/10.1145/3770855.3817813代码仓库https://github.com/ShiqiaoZhou/SARAF讲解及其改进思路https://space.bilibili.com/51422950?spm_id_from333.1007.0.0摘要时序预测依赖历史模式但真实序列常呈现非平稳性与状态切换给完全参数化的预测器带来挑战。受检索增强生成RAG启发近期工作通过检索相关历史片段、在推理时作为外部证据来增强预测器。然而由于真实时序内在的非平稳性高度相似的过去片段并不必然意味着相似的未来使仅靠相似性的检索脆弱且易冗余。作者提出SARAF自适应地平衡检索的相关性与多样性先用带时间对齐增强的时序相似性构建候选池再用多样性感知的选择策略覆盖异构历史状态且多样化强度由数据集级平稳性自动调节最后用平稳性感知的聚合融合检索到的未来。在8个真实数据集上的大量实验表明SARAF取得了有竞争力的预测性能在强基线上平均提升了准确率与鲁棒性在具挑战的非平稳场景下收益尤为明显。Q1这个模型试图解决什么问题核心问题是检索增强预测默认“相似的过去蕴含相似的未来”但在非平稳时序上该假设不成立——输入相似的历史片段可能对应差异极大的未来同时Top-K检索结果常高度冗余重复且错配的样本会聚合成误导性“共识”、放大误差。能否让检索既选得准、又选得多样并按数据集平稳程度自适应调节。图注诊断实验720输入、96预测横轴为测试输入与检索到的训练输入的Pearson相似性按输入相似性排序纵轴为对应检索未来与真值未来的相似性。左为较平稳的Electricity97.2%通道平稳Spearman秩相关ρ1.000输入越相似、未来也越相似右为非平稳的Exchange仅12.5%通道平稳ρ0.285秩明显失配部分检索未来与真值近零相似。1.相似性检索在非平稳下脆弱Electricity上ρ1.000、检索可靠Exchange上ρ0.285输入相似性不是未来相似性的可靠代理许多检索未来与真值几乎无关2.Top-K结果高度冗余滑动窗口库中Top-K常返回近似重复的证据浪费有限的K预算、降低有效信息量重复但错配的样本还会聚合成误导性“共识”、放大误差导致检索秩严重退化、预测不稳3.简单衰减治标不治本以往方法在证据不可靠时下调检索权重但既没解决“输入检索与未来相关性失配”的根因又会过度压制部分有用的邻居、使模型退化成纯参数化预测器丢失检索对长尾/特定状态模式的价值。Q2相关研究1.时序预测从ARIMA等统计模型到LSTM、DeepAR再到Informer、Autoformer等TransformerDLinear表明归一化线性映射即可很强PatchTST做patch词元化TimesNet、CycleNet、MoFo显式建模多周期针对非平稳RevIN做轻量归一化Non-stationary Transformers与SAN用去平稳注意力/动态归一化保留非平稳线索TimeBridge则警告过度平稳化会抹除长期多变量结构2.检索作为输入增强TimeRAG用DTW聚类检索、交给LLMRAFT用多周期匹配与Pearson相关、用检索未来增强输入RAF、TRACE、TS-RAG把检索与时序基础模型结合3.检索作为事后修正PFRP构建全局记忆库、把基础预测与记忆预测融合PIR在基础模型出预测后检索相似片段做修正4.SARAF多数检索方法仍靠纯相似性检索非平稳下脆弱SARAF在非平稳下通过平稳性控制的多样化候选子集来增强检索本身并直接与骨干预测融合、而非压制检索分支。Q3模型如何解决这个问题整体架构SARAF先对输入查询归一化与仅由训练集构建的时序数据库中所有历史窗口计算带时间对齐的相似性选出Top-M候选对再对M个候选做基于多样性的检索、选出K对M远大于K多样化强度由数据库估计的数据集级平稳性分数s̄控制对检索到的K个未来做高斯加权聚合得到检索预测核带宽σ也由s̄调节最后把检索预测与预测器的朴素预测平均经输出投影层得到最终预测。图注模型架构上半为主流程输入经归一化后分别进入预测器与检索器两路在融合模块合并、经投影输出下半为检索器细节时序数据库经平稳性估计输出λ时间对齐相似性检索得Top-M多样性检索得Top-K再对Top-K未来做高斯加权求和、输出融合未来。时序数据库构建用步长为1的滑动窗口、仅从训练集提取长度L的历史片段每个片段配对长度H的未来序列得到含N个时序对的数据库DTS{(xi,yi)}xi∈R^(L×C)、yi∈R^(H×C)。检索库只来自训练划分保证不使用验证/测试信息。平稳性估计式1-2为高效估计数据集级平稳性从DTS采样历史片段、计算实例级平稳分数再取平均。对样本xi切成W个不重叠子窗计算每子窗逐通道的局部均值与标准差再量化它们跨子窗的变化vμ、vσ分别为子窗均值、标准差在子窗间的标准差为尺度不变用数据集{xi}的标准差σ̄归一化。实例平稳分数式1s̃i½{[1−min(1,vμ/σ̄)][1−min(1,vσ/σ̄)]}∈[0,1]值越大表示局部均值与方差随时间越稳定数据集级平稳性式2为所有样本分数的平均s̄(1/N)Σs̃i。相比ADF、KPSS等单变量且大规模计算昂贵的经典检验该方法可在多变量数据库上高效批量计算。时间对齐检索增强式3时序普遍存在日历驱动的规律昼夜、周、季节纯形态检索可能返回形态相似但时间上下文错配的片段。对查询时间戳{tq}与训练时间戳{ti}计算奖励矩阵B式3Bq,iΣ_{r∈R}λrφr(tq,ti)R含小时、星期、月份、分钟可用时。对循环成分小时、月份、分钟用循环距离处理环绕如23与0相近drmin(|tq−ti|,Pr−|tq−ti|)φr为dr上的指数核Pr为周期小时24、月份12、分钟60星期成分对完全相同的工作日给最高奖励、同为工作日/周末给较小奖励最后按最大值把B缩放到[0,1]。时间对齐相似检索式4-5采用对尺度变化与均值漂移鲁棒、强调协同运动趋势的Pearson相关作为相似性在向量化、中心化的窗口上计算式4Stemporal(q,i)⟨vec(x̃q),vec(x̃i)⟩/(‖vec(x̃q)‖2·‖vec(x̃i)‖2)vec把L×C矩阵展平成R^(LC)。再结合时间对齐奖励式5Ssim(q,i)(1−αtime)Stemporal(q,i)αtime·Bq,iαtime控制时间对齐增强的贡献最后按Ssim排序、保留Top-M作为后续选择的候选池。基于多样性的检索式6-9在Top-M池上用平稳性引导的随机MMR最大边际相关平衡查询相关性与已选窗口间的多样性以更好覆盖可能的状态。1.平衡参数式6MMR用λ∈[0,1]权衡相关性λ1与多样性λ0把λ设为平稳性的数据集感知函数λ(s̄)λmins̄(λmax−λmin)平稳性越差s̄小λ越小、多样化越强2.随机MMR式7-8先把最相似候选作为锚点再迭代选其余K−1个每步对候选xi计算MMR(i)λ(s̄)·Ssim(q,i)−(1−λ(s̄))·max_{xj∈R}Δ(i,j)。为避免候选两两相似的O(M²)开销用基于查询相似性接近度的轻量代理Δ(i,j)1−|Ssim(q,i)−Ssim(q,j)|抑制选择证据高度相似的候选3.随机采样式9不做确定性argmax而是从softmax分布p(i)Softmax(MMR(i))采样下一个候选重复直到|R|K。自适应高斯权重式10-11为每个检索项分配归一化权重高斯核带宽以数据集级平稳性为条件式10σ(s̄)σmin(1−s̄)(σmax−σmin)σmin、σmax控制尖锐程度范围非平稳时带宽更大、权重更平滑地分散到更多未来。权重式11wkexp(−d²k/2σ²)/Σ_j exp(−d²j/2σ²)其中dk1−Ssim(q,rk)。检索增强预测式12-151.检索预测式12对检索窗口xrk配对的未来yrk做加权聚合ŶretΣ_k wk·yrk2.直接预测式13用轻量线性层作为时序预测器把中心化查询映射到预测时长ŶdirectW·x̃qbW沿时间维作用、跨通道共享3.融合与最终投影式14-15保持轻量直接把直接预测与检索预测平均Ŷ½(ŶdirectŶret)再沿预测时长做线性投影得ŶfinalLinear(Ŷ)。Q4实验效果如何数据集在8个广泛使用的多变量时序基准上评估ETTh1、ETTh2、ETTm1、ETTm2、Exchange、Solar、Electricity、Traffic覆盖不同通道维度、采样频率与平稳程度。回看窗口统一为720预测时长为{96,192,336,720}。图注数据集统计与平稳性分数。Exchange最不平稳平稳分数.4203、ADF平稳比率12.5%ETTh2.5731/57.1%与ETTm2.6080/85.7%中等非平稳Solar.7439/100%、Electricity.8648/97.2%、Traffic.8628/100%最平稳。基线与训练设置对比9个SOTA预测器Autoformer、Non-stationary Transformer、PatchTSTTransformer类DLinear线性分解RAFT相似性多周期检索CycleNet线性骨干周期建模TimesNet傅里叶主导周期TimeMixer多尺度混合DUET时间模式与跨变量关系双聚类。SARAF训练10个epoch、batch size为32结果在单张NVIDIA GPU上、3次独立运行取平均检索库仅由训练划分构建所有基线在统一协议相同划分、回看长度、预测时长与指标下评估用MSE与MAE作为指标。主要结果SARAF在8个数据集中的5个上取得最优的平均MSE与MAE整体性能具竞争力。跨所有数据集平均相比检索预测器RAFTMSE降低3.85%、MAE降低1.87%相比强预测基线DUETMSE降低4.05%、MAE降低0.75%。图注完整主结果回看7204个预测时长。SARAF在4长度平均上ETTh1 .429/.437、ETTh2 .348/.392、ETTm1 .297/.348、ETTm2 .297/.318、Exchange .394/.426、Solar .192/.244、Electricity .173/.274、Traffic .425/.295。SARAF在不同平稳特征的数据集上都有良好表现既在非平稳的Exchange、ETTh2上通过多样化检索获益也在较平稳的Electricity上保持精度说明平稳性可作为控制检索证据如何选择与融合的实用信号。消融实验①检索机制消融Table 2SARAF在MSE上一致优于去掉检索器的变体如ETTh1 .415对.421、Exchange .394对.411、Traffic .395对.414证明检索在预测器之外提供了互补信息随机检索一致更差.421、.402、.414说明增益来自有效检索而非检索本身去掉预测器、仅聚合检索未来在多数数据集上差很多ETTh1 1.328、Electricity 1.613、Traffic 2.768说明检索未来需要预测器校准噪声与错配。图注检索机制消融SARAF、去检索器、去预测器、随机检索四组。值得注意的是在Exchange上去预测器变体反而取得最好结果.377/.409说明高度非平稳序列上检索分支本身信息量大、检索在更强非平稳下更重要。②检索器组件消融Table 3时间对齐增强贡献最稳定去掉它所有数据集MSE都升高ETTh1 .420、ETTm1 .347、Exchange .398、Electricity .156、Traffic .402多样性与平稳性的效果更依赖数据集——在非平稳更强的Exchange上去掉多样性.400、平稳感知.398或两者.399都明显变差在Traffic上有类似但更温和的趋势而在较平稳的ETTh1、Electricity上差异很小Electricity去掉多样性相关组件后MSE甚至略低符合设计模式越稳定、越少强调多样化。图注检索器组件消融完整、去时间对齐、去多样性、去平稳感知、同时去多样性与平稳感知五组。时间对齐普遍有益平稳性条件下的多样性控制主要在非平稳使相似邻居冗余/不可靠时提升检索可靠性。超参数敏感性对时间对齐权重αtime、最终检索集大小K、回看窗口长度做敏感性分析。图注αtime在ETTh2与Electricity上的MSE4个预测时长。ETTh2上MSE随αtime变化更明显长时长H720在αtime由低调到中等时下降最清晰说明预测越远、时间对齐越重要Electricity整体平稳、对αtime不敏感。图注K在两数据集上的MSE。Electricity上增大K一致降低MSE平稳数据集受益于更广检索上下文ETTh2上趋势弱、长时长甚至反转K过大会放入相关性低的候选、稀释有效证据最优检索预算应随数据动态调整。图注回看窗口在两数据集上的MSE。增大窗口总体降低MSE、由短窗到中等窗收益最大长时长上更明显窗口过大则收益饱和、可能略回升。足够长的输入对检索也很关键——窗口太短而目标太长时输入相似性是未来相似性的更弱代理720仍是稳定选择。多样性检索分析从检索输入的冗余度与融合未来的有用性两个角度分析。Fig.6(a)显示RAFT与去多样性变体的检索输入相互相似性持续偏高、Top-K证据近似重复SARAF在不同平稳数据集上都降低了组内相似性平均比消融变体低14.57%、比RAFT低16.09%。图注多样性检索分析(a)检索冗余随数据集平稳性变化SARAF的输入相互相似性明显低于RAFT与去多样性变体(b)在较非平稳ETTh2上融合检索未来与真值的相似度SARAF相比去多样性变体在96/192/720分别提升21.3%、9.1%、34.0%336为−6.7%多样化检索让多个可能未来共同贡献。检索器作为即插即用模块把默认线性预测器替换为Transformer类的PatchTST与线性类的DLinear与检索器即插即用结合。两种骨干在ETTh1、ETTm1上、4个预测时长平均的MSE与MAE都被检索一致提升。图注骨干加/不加检索器对比PatchTST在ETTh1由.635/.565降到.540/.527、ETTm1由.548/.492降到.477/.471DLinear在ETTh1由.521/.508降到.413/.431、ETTm1由.400/.422降到.353/.381说明检索器泛化良好、可有效增强多种预测器。效率分析在ETTh1输入720、预测96、batch size 32下对比推理效率。SARAF推理第二快.334ms/iter参数量.088M与模型显存.335MiB都很紧凑检索类RAFT更慢、显存更高122.996MiB因其推理时对检索候选做注意力。图注推理效率ETTh1。SARAF .088M/.335MiB/54.077MiB/.334msDUET 6.660M/25.408MiB/36.030MiB/7.202msRAFT .104M/.397MiB/122.996MiB/.590msDLinear .138M/.528MiB/20.460MiB/.271ms。SARAF因维护外部检索库、总显存高于纯预测器DLinear/DUET但仍低于RAFT。附录更多动机与超参附录在全部8数据集上重复动机实验并给出检索可靠性与超参搜索范围。图注8数据集的输入相似性对未来相似性按平稳性排序。平稳数据集Electricity、Traffic、Solarρ接近1.0ETTh1 .973、ETTm1 .988、ETTm2 .960非平稳ETTh2降至.515、Exchange .285且未来相似性集中在零附近。图注检索可靠性对平稳性分数。左为相似性保留比率未来相似性/输入相似性右为输入与未来排序的Spearman秩相关两个指标都随平稳性明显正相关平稳数据集秩接近完美、保留率高非平稳数据集可靠性低。图注SARAF超参搜索范围与固定值batch size 32、回看720、训练10轮、子窗数W6、σmin .05/σmax .30、λmin .30/λmax .90、候选池M100αtime与K在给定集合中搜索。Q5有哪些可以继续探索的点作者在附录列出的局限与方向1.更细粒度的相似性当前依赖多变量窗口上的全局相似函数更细的逐通道/分组相似可更好捕捉变量间异构动态但会增加检索与存储成本2.压缩检索数据库密集滑动窗口库对长序列、大数据集显存开销大可通过聚类、原型选择或学习索引压缩库、降低存储与延迟同时保留大部分有用证据3.实例级平稳信号当前平稳性在数据集级估计可能无法完全反映实例级状态切换把平稳信号扩展为上下文相关、可进一步提升非平稳下的适应能力4.与基础模型/在线学习结合可探索检索与时序基础模型的深度结合以及在线、流式场景下检索库的动态更新。Q6总结SARAF研究了检索增强时序预测的一个关键局限高度相似的历史输入不总是带来相似的未来轨迹相似性检索的可靠性与数据集平稳性密切相关。它把时间对齐相似检索、平稳性控制的多样性选择与自适应高斯聚合结合在8个多变量数据集上取得了有竞争力的整体性能与稳定的平均增益。平稳性可作为控制检索证据如何选择与融合的实用信号为异构状态下、纯相似性检索提供了一条更可靠的替代路径。