质谱数据采集模式全解析:DDA与DIA的选择策略与实战
发布时间:2026/10/4 10:06:21 作者:尧图编辑部 阅读量:1,286

开头我从一个实际经历说起。我第一次拿到组学平台的质谱操作界面时面对一堆参数——扫描范围、离子传输时间、碰撞能量、AGC target——完全不知道这些数字在指挥机器干什么。后来跟应用工程师反复调方法、跑样品、对比结果才慢慢把质谱原理和数据采集模式这两件事串起来。蛋白质组学领域现在几乎绕不开质谱而质谱结果的质量一半取决于硬件另一半取决于你选什么采集模式。DDA和DIA这两个词几乎决定了你的实验是探索发现还是定量比较。这篇文章不打算复述教科书我想从实际操作角度拆解质谱原理再把DDA和DIA的设计逻辑、参数取舍、数据特征和选择策略讲清楚。刚进组学实验室的同学、准备从DDA转向DIA的课题组或者只是想知道质谱跑出来那些文件到底怎么来的都可以参考。1. 质谱仪到底在测什么——蛋白质组学视角的底层逻辑1.1 从蛋白质到肽段质谱只能测分子碎片很多人第一次接触蛋白质组学容易直接问质谱能不能测蛋白质序列。实际上完整蛋白直接进质谱虽然可行但灵敏度、分离度都远不如酶解后的肽段。现在主流蛋白质组学流程shotgun proteomics的第一步是先把蛋白质提取出来用胰蛋白酶把蛋白切成肽段。胰蛋白酶切在赖氨酸和精氨酸的C端一个平均大小的蛋白能切成十几到几十条肽段。为什么必须这么干原因有两个。第一肽段比完整蛋白更听话。蛋白质动不动几十上百kDa离子化效率低进入碰撞池后碎裂位点过多谱图复杂到根本无法解析。肽段通常只有几百到两三千Da带电后质荷比落在质谱仪最灵敏的范围内碎裂后产生的碎片离子恰恰能反映序列信息。第二肽段直接对应蛋白身份。每个肽段序列其实就是蛋白序列的一个子字符串。你只要测出一条独有肽段的序列基本就能锁定它来自哪个蛋白。越多的肽段被鉴定到蛋白覆盖度越高。所以蛋白质组学定量说到底是在测每个蛋白的肽段离子信号有多强。质谱就是在做一件事测量带电荷的肽段离子的质荷比然后把它打断测量碎片离子的质荷比。前者是MS1扫描前体离子谱图后者是MS2扫描碎片离子谱图。一张完整的组学原始文件里成千上万张这样的谱图拼接起来就构成了蛋白丰度的估计基础。1.2 ESI电离源、四极杆与飞行时间三段式解剖要理解采集模式至少得搞清楚主流仪器里三个核心模块在干什么。第一个是电离源。现在高灵敏度的组学平台几乎都用纳升电喷雾电离nanoESI。液相色谱把肽段洗脱出来进入一个非常细的喷针针尖加上高压一般1.5到3 kV溶剂在电场和气流作用下雾化成小液滴。液滴不断蒸发变小表面电荷密度越来越高最后电荷转移到肽段分子上形成带多电荷的气相离子——大多数肽段会带2或3电荷有的更长或带更多电荷。所以你在质谱图里看到的分母m/z已经把电荷数算进去了。一个1000Da的肽段如果带2个电荷表现出的m/z大约是500.5。第二个是质量分析器。市场上最常见的组学仪器组合是四极杆Quadrupole和飞行时间TOF。四极杆由四根平行金属杆组成在杆上施加射频和直流电压组合。特定电压下只有特定质荷比的离子能稳定振荡穿过四极杆其余离子撞在杆上丢掉。改变电压就能让不同m/z离子依次通过。所以四极杆既可以当全传通道也可以当过滤器——这是DDA模式下选母离子、DIA模式下切窗口的核心执行部件。飞行时间分析器的原理很直白离子在电场中被加速后飞向检测器轻的离子飞得快重的飞得慢。记录离子到达时间就能算出m/z。TOF质量分辨率可以做得很高能区分质量差异只有几毫道尔顿的离子这正是区分某些同质量肽段归属的关键。现代TOF还配了反射器reflectron相当于把离子的飞行路径折叠了一次用来补偿初始动能差异把分辨率进一步提高。还有一类主流平台是Orbitrap用静电场阱让离子沿中心电极做轴向振荡再把振荡频率做傅里叶变换得到质量谱。分辨率极高、质量准确度极好尤其适合需要区分复杂等重肽段或做TMT标记定量的场景。近年Thermo把Orbitrap与高场不对称离子迁移谱FAIMS联用在DIA定量中提分辨率效果相当明显。第三个是碰撞池。离子经过四极杆筛选后进入碰撞池与氮气或氩气碰撞获得内能碎裂成b/y系列碎片离子——这两个系列的本质是肽段沿着肽键断开一端保留N端一端保留C端。b离子和y离子的质量差对应一个个氨基酸残基反过来推就能读出序列。1.3 碰撞碎裂与二级谱图蛋白质身份的指纹在DDA和DIA里碰撞能量CE都需要针对不同m/z做梯度调节——肽段越大碰撞能力要求反而要越高。有些平台用阶梯碰撞能量stepped NCE在一个碎裂事件里叠加多档能量保证大小碎片同时出现这个细节对鉴定能力影响很大。二级谱图是蛋白质身份识别的指纹。一个肽段被打碎后产生的b/y系列离子位置像一把尺子的刻度算法比如搜索引擎和数据库匹配会拿这把刻度与理论酶解肽段的碎裂模式比对给出PSM肽段-谱图匹配分数。DDA和DIA在数据形态上有个根本区别DDA的MS2谱图通常对应单个母离子干净谱图DIA的MS2谱图对应窗口内一群母离子的混合碎裂谱图混合谱图。这个区别决定了两者数据解析逻辑完全不同——DDA是先选后测DIA是全测后算。2. 数据依赖采集模式DDA锁定前N强的选择逻辑2.1 topN策略与动态排除DDA的逻辑直白得近乎原始每轮MS1扫描结束后软件看一看这个谱图里有哪些峰按强度排序选前N个最强峰逐一送入四极杆做MS2碎裂。选多少最常见的设置是top 15到top 20。为什么不是top 50因为每个MS2事件要花时间一轮循环Cycle time做得太长色谱峰定时不够定量就不准。你在软件里看到的cycle time就是MS1扫描时间加N个MS2扫描时间的总和。色谱峰的洗脱宽度一般20到40秒你至少想在峰顶附近采到6到10个点来还原峰形循环时间就得控制在1.5到3秒之间。动态排除dynamic exclusion是DDA的关键机制。同一个最强肽段离子如果不加限制会在好几轮循环里反复被选中碎裂浪费MS2事件。软件会把这个m/z列入黑名单20到60秒在这段时间里不再选它做母离子把机会让给其他丰度更低的峰。参数调得越大谱图多样性越好但代价是同一个峰的MS2重复次数变少低丰度定量噪点变大。一般我会把动态排除设成30秒片段离子强度高、序列较长的肽段可以适当放宽。值得留意的是DDA模式在高丰度背景干扰多的样本里有个天然倾向反复选中同一批高丰度肽段。血浆样本尤其明显——白蛋白和免疫球蛋白的肽段把MS2采样机会占掉大半低丰度蛋白很难被选到。处理办法无非是预分离比如high pH反相分级把动态范围摊开或者用高丰度蛋白去除试剂盒但这些操作本身会引入额外误差和样本损失。2.2 DDA参数设计中的关键平衡点DDA方法的参数调优本质上是在做四个变量的权衡循环时间、排除时间、MS2分辨率/积累时间和碰撞能量。我给新手一个相对稳妥的起始方法参考参数推荐起始值说明MS1分辨率60k–120kOrbitrap体系越高越能分辨同质量肽段但扫描变慢MS1扫描范围350–1200 m/z覆盖大多数酶解肽段太宽浪费电荷容量AGC target (MS1)1e6–3e6控制离子累计量防止空间电荷效应最大注入时间 (MS1)25–50 ms别给太长否则循环时间压不住topN15–20取决于样本复杂度和色谱峰宽动态排除30 s兼顾多样性与定量重复性碰撞能量27–30 NCE可加stepped先跑标准品查看b/y系列覆盖度Orbitrap平台上MS2分辨率从15k提到30k会明显提升低丰度碎片峰的质量分辨但也会让循环时间增加一点点。DDA在短梯度比如30分钟快速方法里通常做不到特别深——峰太少MS2机会有限。想要鉴定深度就得把梯度拉长配合分级来摊机会。这也是为什么很多发现蛋白质组学项目往往一针要跑60到120分钟。2.3 DDA的实际局限丢失低频信号和缺失值问题我实际跑DDA数据最有体会的一点是它其实不擅长重现性。同一个样本重复进三针每针选中的前N强会有差异——靠近阈值线的峰可能这针选了那针没选于是样本间就出现大量缺失值。定量层面有的蛋白在这组样本中被定量了在另一组样本中却因为没被选上而完全没有数据点这对后续统计是个大麻烦。你如果用DDA做比较蛋白组学缺失值比例20%到40%都不稀奇。DDA更适合什么无标记非靶向但更典型的其实是基于TMT/iTRAQ标记的多重定量以及需要找新东西的发现性项目。TMT标记之后所有样本混合成一管只需要在MS2层面用报告离子相对定量DDA对母离子的重复选择要求没那么严格因为每根肽段离子碎裂一次就能提供所有通道的信息。所以现在做TMT研究DDA依然是首选。但如果你要做无标记、跨几十上百个样本的丰度比较DDA的低重复性和缺失值问题会被无限放大。这就是DIA被不断推进的核心原因。3. 数据非依赖采集模式DIA窗口式全景扫描的工程思路3.1 SWATH与窗口划分如何把动态范围压缩到可测范围DIA的思路跟DDA完全相反不筛选母离子而是把所有离子按质荷比分成一个个窗口窗口内的全部离子都送入四极杆碎裂。每个窗口产生一张MS2谱图里面混合了这个窗口内所有肽段碎片。只要窗口覆盖整个扫描范围那么理论上你获得了样本里每个离子的碎裂信息。SWATH是SCIEX对DIA商业化的名称也是目前最经典的窗口策略。窗口怎么划是DIA方法设计的核心。窗口太宽一个窗口里同时碎裂几十上百个前体离子碎片谱图混叠严重软件解析时容易张冠李戴窗口太窄虽然选择性好但需要的窗口总数变多每个窗口占用的时间变长循环时间就压不下来。经典的SWATH方法在400到1000 m/z范围内用32个窗口每个窗口约25到26 Da宽循环时间约2到3秒。亮点在于窗口与窗口之间要保证一定的重叠大约1 Da防止恰好落在边界的峰丢失。后来有了variable window概念——低m/z区域离子密度大、同位素峰又密窗口划窄一点比如100到500 m/z用12个窗口每个窗口10到15 Da高m/z区域肽段密度稀疏窗口放宽到30到50 Da。优化时你可以根据DDA数据统计肽段分布把窗口边界对齐到几乎没有肽段窗界的区域减少峰被切开分配到两个窗口的概率。DIA数据分析的基石是谱图库spectral library。谱图库记录了每个肽段的保留时间、母离子质量、碎片离子m/z和强度。DIA扫描到的混合谱图就是用这些信息去查——算法从库里取出理论碎片特征在混合谱图对应的保留时间区间内做信号提取。没有库覆盖的肽段DIA数据里虽然有碎片信号但无法通过常规流程解析。这也是早期DIA不建库就没法用的痛点来源。3.2 离子淌度与diaPASEF在时间轴上再开一维传统DIA只有两个维度正交的m/z窗口和色谱保留时间。如果两个不同肽段落在同一个窗口且保留时间接近它们的碎片就混在一起。Bruker的timsTOF系列把离子淌度ion mobility加了进来开辟了第三维——离子在气体中迁移的速度取决于它们的碰撞截面。timtof把DIA升级成diaPASEFparallel accumulation-serial fragmentation。diAPASEF最巧妙的地方在于平行累积、串行碎裂。传统DIA把窗口一个个切出来是串行的——一次只做一段窗口diaPASEF把前体离子先累积在离子淌度管里随着淌度驱动电场逐渐加大不同淌度的离子依次被释放出来四极杆则根据当前淌度区域动态调整窗口位置实现扫描随淌度实时跟踪。这么一来一个循环里可以覆盖更多的窗口通常数百个循环时间反而短。最直观的效果是在相同上样量下diaPASEF的鉴定深度和定量稳定性都明显好过同等价位的传统Q-TOF DIA。这个优势在微量样本和单细胞蛋白质组学里体现得尤为突出——本来就没多少样品采集效率就成了命门。需要注意diaPASEF的方法设计不再用固定的等宽窗口列表而是基于离子淌度的二维参数图调整窗口位置和宽度。不同m/z、不同淌度区间的离子密度差别很大策略上要在离子密度高的二维区域用多而窄的窗口在稀疏区域用少而宽的窗口。Bruker配套软件如timeControl里有一些预设方法新手建议直接跑预设的diaPASEF-positive-100ToD这类方法开始再根据实际数据密度做优化。3.3 数据处理谱图库、库-free与DIA-NN这类工具的演进DIA数据处理早期依赖两件事建库和提取定量信号。建库的过程通常是把一个混合样本分成几十个组分每组分再跑DDA把所有鉴定到的肽段谱图集合成一张大库。库的质量直接决定DIA分析上限——库不好DIA解析就好不了。后来出现了无库分析library-free代表工具是DIA-NN。DIA-NN用深度学习预测肽段的碎裂行为、离子淌度和保留时间直接从DIA数据本身学习信号特征再配合干湿结合的算法甚至能在没有库的情况下做直接定量。我用过的最顺手的组合是前期用DIA-NN做一轮预分析得到特征再用特征生成项目专用库最后回到DIA-NN做正式定量。这样做的好处是库的特征跟本项目的色谱条件和碎裂条件高度匹配比拿公共库硬套准得多。跨样本批次时公共库比如Pan Human Library虽然方便但对色谱梯度、液相体系的差异非常敏感——保留时间预测偏差会让信号提取窗口选错位置定量噪点立刻变大。另一个关键点是FDR控制策略。DIA的分析单位不是PSM而是前体离子×碎片离子×保留时间四维特征匹配。用DIA-NN跑出来的结果除了一般的global q-value前体水平FDR还要关注蛋白水平FDR和Run-specific FDR三者的联动。尽量把肽段和蛋白质水平的FDR控制在1%以内不要只看软件默认的q值很多软件默认的阈值并不针对DIA混合谱图。4. DDA与DIA的选择策略不同样本类型和实验目的怎么选4.1 参数对比与适用场景不少课题组问我是不是DIA一定比DDA好。我觉得这不成立——两者各有擅长的阶段。把核心差异放一张表里比较容易说明白。对比维度DDADIAMS2选择逻辑只选topN峰扫描全部窗口MS2谱图纯度高单母离子低窗口混合鉴定深度同梯度偏低受采样机会限制高碎片信息全覆盖定量缺失值高低丰度常没选上低每个窗口都采跨样本重现性一般很好数据量中等大分析计算量大软件生态成熟MaxQuant、Proteome Discoverer等仍在快速演进DIA-NN、Spectronaut、Skyline等典型场景TMT多重定量、发现新蛋白、PTM位点鉴定无标记大队列比较、标志物筛选、单细胞微量组学DDA的高纯谱图优势在PTM位点鉴定上仍然有决定性——修饰肽段丰度低、信号碎片复杂混合谱图经常让修饰位点归属模糊。如果你做磷酸化富集后的样本想在激酶底物位点层面精确定位DDA加高分辨率MS2依然是稳妥路径。DIA做磷酸化不是不能做只是位点定位的准确度需要额外的位点概率统计比如PhosphoRS打分来兜底。4.2 真实项目中的组合拳打法实际项目里我很少只用单一模式到底。最常见的组合是前期DDA建库后期DIA定量先取代表性样本或等量混合样分级成8到12个组分跑DDA得到项目专属库再用库支持的DIA方法跑所有样本。这样发挥两边的优点——DDA负责发现和建库DIA负责一致定量。另外一个思路是同一根色谱柱、同一梯度条件下先跑一针DDA做方法开发和检查色谱分离质量再用DIA跑正式实验因为DIA数据里包含着DDA几乎全部可鉴定肽段的信息方法开发阶段的琐碎调整不会浪费正式实验的样本。单细胞蛋白质组学这块我目前更倾向直接上diaPASEF。原因很简单上样量只有纳克级传统DDA把topN机会浪费在背景和噪声上珍贵的离子信号在MS1扫描阶段就丢掉了。DIA窗口能保留大部分离子信息再用低流速色谱和窄喷针提高离子化效率单针鉴定深度能做到3000到5000个蛋白这在普通DDA模式下几乎做不到。4.3 数据分析的陷阱假阳性、共洗脱干扰和批次效应DIA数据解析有一个很容易被低估的坑共洗脱干扰。色谱分离、m/z窗口和碎片段三者都接近的肽段会在库匹配时互相竞争特征信号。DIA-NN这类工具允许你查看干扰程度相关的得分——一般叫干扰评分或precision精确性不佳的定量特征在后续统计时会被过滤掉。我在处理时习惯保留严格的干扰阈值例如DIA-NN的干扰评分大于0.5才保留宁可少统计一些蛋白也不要让定量数据里掺入共洗脱噪点。批次效应在DIA里同样严重。不同批次的色谱柱状态、喷针、样品制备试剂都会让保留时间出现漂移。对策有三个一是跑正式样本前用QC样商业标准品或实验室内部混合样检查保留时间漂移和总离子流强度二是在DIA-NN分析时打开match-between-runs或保留时间校准相关性选项让跨样本的保留时间对齐三是在统计学建模时把批次设为协变量或随机效应别天真到直接做组间比较。5. 质谱组学正在变快、变敏感——我看到的趋势5.1 硬件层面更高的分辨率、更短的循环时间这两年硬件的方向很清楚提高扫描速度、分辨率和离子利用效率。Thermo的Orbitrap Astral把Orbitrap与Astral分析器结合在一起MS2扫描速度可以到每秒数百谱图扫描速度与分辨率不再是鱼和熊掌。过去DIA最常见的批评之一是MS2谱图太多处理费劲现在Astral这类平台反而希望扫描越快越好——更快的循环时间意味着可以用更窄的窗口做DIA混合谱图的复杂程度会进一步下降。5.2 软件层面深度学习重构DIA数据处理范式DIA-NN和Spectronaut这类软件已经从查询谱图库进化到学习谱图特征。未来趋势是库变得项目自适应深度模型直接预测碎片离子保留时间、淌度和强度使得没有实验库的项目也能做到与建库方法相当的定量精度。我还注意到可解释性AI模型开始能帮忙做离子分组和DIA峰判定这些任务原来靠规则判断现在靠模型泛化。数据处理环节对新手越来越友好但反过来如果你不理解背后的特征匹配逻辑光会用软件点按钮很容易得到表面漂亮实则充满系统性偏倚的结果。5.3 从定性到绝对定量DIA在临床大队列中的优势临床蛋白质组学的大趋势是从几千个蛋白的发现筛选走向几十到几百个蛋白的靶向验证——DIA天然适合这个转变。DIA数据里含有所有肽段的信号你想在后期追加验证某个新候选标志物不需要重新跑实验调出原始文件、提取目标特征即可。这种回顾性验证能力是DDA完全不具备的。我在神经退行性疾病和肿瘤标志物项目里越来越倾向于用DIA做发现验证的连续流程——前20例样本先做深度分级的全景数据候选名单锁定后再在200例队列的常规DIA里定向提取。5.4 仍在变多的维度宏蛋白组、空间蛋白组与翻译后修饰的DIA化最后聊两个正在发生的方向。空间蛋白质组学激光显微切割加纳米级LC-MS让DIA在小区域样本里发挥价值因为样本量少所有离子都必须保留下来翻译后修饰层面的DIA现在也在加速专门的磷酸化DIA库和乙酰化DIA库相继公开虽然位点定级准确性仍需人工验证但大规模修饰组学走向DIA应该只是时间问题。宏蛋白组宏基因组预测蛋白组由于物种复杂、动态范围巨大传统DDA经常采样不足DIA的全景记录离线解析思路反而是更合理的工程解。我个人越来越认同一个观点DDA和DIA的选型不是为了跟风而是取决于你的样本量、定量类型和最终要回答的科学问题。刚接触组学的人最好先拿标准样品把两种模式都跑一遍感受DDA干净但缺失和DIA全面但需要懂解析的差别。真正上手之后你会慢慢发现多数高深度定量项目最终会走向DIA——不是因为DDA过时了而是因为DIA更符合生物学研究对一致性和可重复性的需求。这个领域变化很快我提到的参数和软件版本过几年肯定会迭代但底层原理和数据采集模式的取舍逻辑值得任何时候先想明白。