技术解读生成式 vs 判别式大模型影像诊断能力评测核心要点问题多模态大模型做神经影像诊断开放式推理的真实准确率有多高能否自主使用方法对 GPT-5.2、Gemini 3 Pro、Claude Opus 4.5 三款大模型在 RSNA 病例集 252 例颅脑与脊柱神经影像上用「开放式生成 vs 选择题判别」两阶段范式评测。结果开放式主要诊断准确率仅 51.6%–62.7%给出选项后升至 75.4%–81.0%相差 15.1–23.8 个百分点临床显著错误率 17.8%–26.9%。意义低开放式准确率与临床错误负担不支持自主诊断使用判别式能力能否辅助需前瞻性人机对照验证。原文Generative versus discriminative diagnostic performance of large multimodal models in intracranial and spinal neuroradiologynpj Digital Medicine2026-08-241. 神经影像诊断的临床挑战颅内与脊柱的神经影像neuroimaging是神经外科与神经内科临床决策的基石脑肿瘤、颅内出血、脊柱退变与占位性病变等都要靠 CT、MRI 影像结合病史做出判断。这类阅片任务结构复杂、病灶细小、鉴别诊断多误诊漏诊的代价很高。临床上医生的诊断是一个「开放式」过程——不受选项限制直接从影像与病史中推理出结论。但眼下大模型评测多采用「选择题」形式模型只需在给定的几个选项里挑答案。这就带来一个关键问题大模型在更接近真实阅片的开放式场景下诊断能力究竟如何它与选择题评测之间差了多少这项由多中心神经外科团队完成的研究用 252 例真实神经影像病例给出了量化答案成果发表于 npj Digital Medicine。2. 这项评测的核心创新这项工作的价值不在训练一个新模型而在三点评测方法上的实质贡献。第一两阶段对照量化「生成式」与「判别式」的差距。研究对同一批病例先让模型开放式生成主要诊断再提供候选选项让模型做判别式选择直接量出两种范式之间的准确率鸿沟。过去多数评测只看选择题得分可能高估模型在真实阅片中的表现本研究把这个问题显式地摆上了台面。第二从神经外科视角做「临床影响分级」。研究不只报告笼统的准确率而是由神经外科专家组对每一例错误做临床影响分级得出「具有临床意义错误」的具体比例。这个指标比准确率更贴近真实场景——因为并非所有错误都一样严重。第三稳健性检验排除「会话内偏差」。研究在分层抽取的 100 例亚组中用四个模型重复运行并做全新会话的重新评估确认「生成式与判别式」的差距稳定存在并非评测设计的偶然产物。3. 技术原理同一输入两种作答专科分级评测的基本流程可以概括为「同一输入、两种作答、专科分级」三步。输入是来自 RSNA 病例集受付费墙保护的 252 例颅脑与脊柱神经影像病例覆盖颅内与脊柱的多种病变。第一阶段是开放式生成模型不受选项约束直接输出主要诊断第二阶段是判别式识别给定若干候选答案让模型从中选择。评价从神经外科视角进行既统计两种范式下的主要诊断准确率又由专家组对错误做临床影响分级。需要特别说明这里评测的是三款商业大模型的 API 能力——GPT-5.2、Gemini 3 Pro 与 Claude Opus 4.5而非经过临床验证、获批上市的诊断产品。评测结论反映的是「通用大模型直接用于神经影像诊断」这一特定场景不能等同于成熟产品的临床性能。4. 数据说话开放式仅六成判别式相差15个百分点以上论文报告的核心结果如下表。研究维度比较对象核心结果统计证据开放式主要诊断准确率GPT-5.2 / Gemini 3 Pro / Claude Opus 4.551.6%–62.7%未报告 P 值/置信区间判别式提供选项准确率同上三款模型75.4%–81.0%未报告 P 值/置信区间两种范式差距判别式 vs 生成式15.1–23.8 个百分点未报告 P 值/置信区间错误自我纠正完全错误诊断中43%–59%未报告 P 值/置信区间临床显著错误率神经外科专家组分级17.8%–26.9%未报告 P 值/置信区间三个数字最值得关注。其一开放式诊断准确率仅 51.6%–62.7%意味着在最接近真实阅片的场景下最强的多模态大模型也有一半左右会答错其二提供选项后准确率升至 75.4%–81.0%二者相差 15.1–23.8 个百分点说明「选择题」形式会明显放大模型的表面能力其三即便在「完全答错」的病例中也有 43%–59% 能在看到选项后自我纠正进一步印证了差距主要来自「开放式生成」这一环节。但也要看清边界研究未报告灵敏度、特异度等操作点指标且 17.8%–26.9% 的临床显著错误率并不低因此判别式较高的准确率也不能直接等同于「可以放心辅助」。5. 从实验室到临床应用前景与局限这项研究对产业有三个具体落点。其一可作为医疗 AI 企业评估大模型的「范式校准」工具——在宣称模型诊断能力前至少同时报告开放式与判别式两种准确率避免被选择题高分误导其二可把「临床影响分级」引入模型评测量化「有临床意义的错误」而非只看总体准确率其三为「人机协同」与前瞻性对照试验的顶层设计提供依据把大模型定位为「第二意见 / 候选诊断」而非自主决策者。这也呼应了我们此前关于大模型辅助诊断推理中的自动化偏差的讨论AI 建议无论对错都会显著影响医生的判断因此评测的真实性比单个分数更重要。但至少有两条重要局限需要正视。第一样本来自单一 RSNA 病例集、共 252 例代表性有限且为横截面回顾性评测未做多中心前瞻验证也未纳入患者临床结局。第二评测对象是通用商业大模型的 API 能力而非针对特定临床工作流优化过的系统结论能否外推到不同人群、不同影像协议与真实阅片流程仍需进一步研究。6. 结论与产业启示这项研究给出一个清醒的结论即便最强多模态大模型在神经影像开放式诊断上准确率也仅五到六成与判别式相差 15 个百分点以上临床显著错误率最高近三成目前不足以支持自主诊断使用。对医疗 AI 企业和研究团队有三点建议一是评测必须「生成式与判别式」双范式并报警惕选择题高分掩盖开放式短板二是把专科视角的临床影响分级纳入评价量化错误的实际后果三是将大模型定位为可审计的辅助工具落地前设计前瞻性人机对照验证。这也正是思陌智能科研服务长期关注的方向面向医疗大模型与医学影像 AI 的评估验证协助团队完成从基准评测、专科影响分级到前瞻人机对照的完整评估链条为临床决策支持系统的合规落地提供端到端支撑。相关问题Q这些大模型已经能用于神经影像自主诊断了吗A不能。开放式诊断准确率仅 51.6%–62.7%临床显著错误率高达 17.8%–26.9%作者明确表示这不支持自主诊断使用。即便提供选项后准确率升至 75.4%–81.0%也只说明「判别式」能力更强仍需前瞻性人机对照验证后才能谈辅助定位。Q这项研究测试的是完整产品还是模型本身A测试的是三款商业大模型GPT-5.2、Gemini 3 Pro、Claude Opus 4.5的 API 能力并非经过临床验证、获批上市的诊断产品。它衡量的是「通用大模型直接读影像作答」这一特定场景不能等同于成熟产品的临床性能。Q这对医院或患者意味着什么A意味着当下不应把通用大模型当作神经影像诊断的最终答案。对医院而言若引入此类工具应定位为「第二意见 / 候选诊断」并由专科医生复核对患者而言AI 结论仍需以影像科与神经外科的正式诊断为准不可据此自行决策。参考文献Acar A, Kaya B, Yahya D, et al.Generative versus discriminative diagnostic performance of large multimodal models in intracranial and spinal neuroradiology.npj Digital Medicine. 2026. DOI: 10.1038/s41746-026-03169-1Goh E, Gallo R, Hom J, et al.Automation Bias in Large Language Model–Assisted Diagnostic Reasoning.NEJM AI. 2026. DOI: 10.1056/AIoa2501001本文基于 Generative versus discriminative diagnostic performance of large multimodal models in intracranial and spinal neuroradiology 的独立解读仅供学术交流不构成临床建议。 工程实现要点评测范式要双轨并报开放式生成与选择题判别同时测避免被选择题高分掩盖真实短板。引入专科视角的临床影响分级量化「有临床意义的错误」而非只看总体准确率。用全新会话 重复运行做稳健性检验排除会话内设计带来的假象。区分「模型 API 能力」与「获批诊断产品」不把通用大模型测试写成产品实测。落地前设计前瞻性人机对照验证把大模型定位为可审计的辅助工具。大模型能独立诊断神经影像吗双范式评测揭示开放式准确率仅六成