JikeCloud 极客云地址价格节点

JikeCloud 极客

检验准确率很高,阳性为何仍不等于患病:灵敏度、特异度与患病率怎么一起读

灵敏度和特异度从已知疾病状态出发,阳性预测值却从测试结果反问真实状态。两者条件方向不同。只有把患病率、参照标准、研究人群和置信区间放在同一张四格表中,才不会把阳性直接写成确诊。

百分比相同,问题方向可能完全相反

某项检测写着灵敏度95%、特异度95%。不少读者会把这句话缩成“阳性后有95%概率患病”。这个换算没有根据,因为三个百分比的分母不同。灵敏度从已经存在目标状况的人出发,特异度从不存在目标状况的人出发。阳性预测值则从所有阳性者出发,反问其中多少人真的有目标状况。

条件方向一换,答案就会改变。灵敏度回答“确实有目标状况的人里,测试抓到了多少”。阳性预测值回答“测试说阳性的人里,实际有目标状况的占多少”。前者不能直接代替后者。

这类数字只适合解释一项研究怎样表现,不能据此判断任何个人。个人结果还要结合检测用途、症状、既往资料和正式诊断流程。

用四格表找回每个指标的分母

FDA的诊断测试统计指南建议,把新测试与参照标准交叉成四格。参照标准认为有目标状况、测试也阳性,是真阳性。参照标准认为没有、测试却阳性,是假阳性。其余两格是假阴性和真阴性。

灵敏度等于真阳性除以真阳性加假阴性。特异度等于真阴性除以真阴性加假阳性。阳性预测值等于真阳性除以真阳性加假阳性。阴性预测值则以全部阴性结果为分母。

CDC公共卫生教材也用同一张四格表表达这些关系。灵敏度以所有真实有目标状况者为分母,特异度以所有真实无目标状况者为分母。阳性预测值以所有测试阳性者为分母,因此分母中同时包含真阳性和假阳性。

只写“准确率95%”会隐藏四格分布。两个测试的总体正确比例相同,假阳性与假阴性的构成仍可能完全不同。筛查更关心漏掉多少,确认性用途可能更关心误报多少,不能靠一个合并比例取代。

低患病率为何会改变阳性结果的含义

设想一万人接受测试,目标状况患病率为1%。其中100人确实有目标状况,9900人没有。若灵敏度为90%,会得到90个真阳性和10个假阴性。若特异度为95%,9900名无病者中仍可能出现495个假阳性。

此时全部阳性共有585人,只有90人是真阳性。阳性预测值约为15.4%,远低于90%的灵敏度。测试性能没有突然变差,变化来自人群中无病者数量远大于有病者。

如果患病率上升,而灵敏度和特异度保持不变,真阳性会在全部阳性中占更大比例。这个机制解释了为什么同一检测在高风险门诊和一般人群筛查中,阳性预测值可能不同。

CDC对特定感染筛查的旧版指南也记录了同样现象。低患病率下,特异度与患病率会强烈影响阳性结果中真实感染所占比例。该例只说明统计机制,不能把当年的病种、阈值或处置建议移到其他检测。

患病率不是随手查来的全国平均数

预测值计算里的患病率,应对应被检测的人群和时间。普通社区、专科门诊、已出现症状者和接触者,测试前概率不同。直接把全国年患病率塞进某家医院的研究表,可能制造一个看似精确却不适用的结果。

检验准确率很高,阳性为何仍不等于患病:灵敏度、特异度与患病率怎么一起读 配图 1
检验准确率很高,阳性为何仍不等于患病:灵敏度、特异度与患病率怎么一起读 配图 1

年龄、症状持续时间、采样时点和纳入标准也会改变人群构成。若研究只招募典型重症病例和健康对照,得到的灵敏度与特异度可能高于真实使用环境。研究是否采用连续入组、是否排除模棱两可结果,都值得核对。

因此,研究人群的预测值不能无条件套到任何人群。至少要比较纳入地点、目标状况定义、患病率、病程和测试用途。缺少这些信息时,只能说研究报告了某个预测值,不能把它写成普遍概率。

参照标准决定四格中的真假

四格表看似客观,但真假分类来自参照标准。FDA把参照标准定义为判定目标状况是否存在的最佳可用方法。它可以是一项检测,也可以是多项方法和临床随访组成的规则。

“最佳可用”不等于绝对无误。某些疾病没有单一公认标准,组合规则也可能漏判。若参照标准错误,新测试与它不一致时,未必都是新测试错。性能估计会继承参照标准的局限。

检验准确率很高,阳性为何仍不等于患病:灵敏度、特异度与患病率怎么一起读 配图 2
检验准确率很高,阳性为何仍不等于患病:灵敏度、特异度与患病率怎么一起读 配图 2

阅读教材时,应找到参照标准名称和判定流程。若只写“与临床诊断比较”,却没有说明谁诊断、依据什么资料、是否不知道新测试结果,偏倚风险就无法判断。

参照标准还应独立于待评估测试。若先看新测试结果,只在不一致者身上追加检查,再用追加结果回头决定真假,可能偏向新测试。FDA专门提醒,这种差异解决方法不能消除偏倚。

没有参照标准时,一致率不是准确率

有些研究只能把新测试与现有方法比较,而现有方法并非参照标准。这时两项结果相同,只能证明彼此一致,不能证明都正确。两项方法也可能在同一个人身上同时误判。

FDA建议在这种情形报告阳性一致率和阴性一致率,不使用灵敏度与特异度的名称。名称差异不是文字洁癖,它告诉读者表格的列并不代表真实状态。

总体一致率也会受人群构成影响。当多数对象都为阴性时,只要两种方法经常共同判阴性,总体一致率就可能很高。阳性格里的分歧却可能被一个合并数字淹没。

因此,看到“与某检测一致率98%”时,应检查比较对象是否为参照标准。若不是,就把结论限定为方法间一致性,不延伸成确诊能力或排除能力。

点估计旁边必须保留置信区间

灵敏度95%通常来自有限样本,不是测试永远固定在95%。FDA指出,换一组研究对象,甚至同一组人在不同时间接受测试,估计值都可能变化。置信区间表达抽样造成的不确定范围。

检验准确率很高,阳性为何仍不等于患病:灵敏度、特异度与患病率怎么一起读 配图 3
检验准确率很高,阳性为何仍不等于患病:灵敏度、特异度与患病率怎么一起读 配图 3

若研究只有20个真实病例,漏掉1人就会明显改变灵敏度。若有2000个病例,同样漏掉1人的影响小得多。两个研究点估计都写95%,区间宽度可能差异很大。

置信区间也不是全部保障。样本很多可以让区间变窄,却不能修复错误的参照标准、选择偏倚或不适用的人群。精确地测量了一个偏离目标的问题,仍然不能支持外推。

复核时,应把点估计、区间、分子和分母一起抄下。只有百分比而没有人数,很难看出一两个结果是否左右了结论。

把教材百分比还原成人数,再讨论含义

最实用的读法,是把研究人数还原成真阳性、假阳性、假阴性和真阴性四格,再核对人群与置信区间。先写参照标准判定的有病与无病人数,再按灵敏度和特异度填入测试结果。

第二步改变患病率,保持灵敏度与特异度不变。用1%、10%和30%的假设人群分别计算。阳性预测值怎样移动,会比背公式更直观。这个练习只用于理解统计关系,不用于估算个人风险。

第三步检查结果名称。表格若没有参照标准,就标为一致率。研究若排除了不确定结果,要确认分母是否减少。点估计若没有区间,也要把不确定性缺失写进备注。

最后写清边界:该测试用于筛查、辅助诊断还是监测;研究对象来自哪里;目标状况怎样定义;结果对应哪个采样时点。只要这些条件发生变化,性能数字就可能不再适用。

高灵敏度和高特异度当然重要,但它们不是阳性后的个人答案。真正可复查的结论来自四格人数、患病率、参照标准、研究人群和不确定性共同形成的证据链。

再做一次两种人群的受控对照

可以固定测试性能,只改变人群构成。第一张表放一万名一般人群,第二张表放一万名高风险就诊者。两张表使用相同的灵敏度和特异度,再分别填入四格人数。真阳性与假阳性的比例会随患病率改变。

这项对照回答的是人群变化,不是测试技术变化。若同时更换测试阈值,就无法知道预测值变化来自哪一部分。教材中的多个例题也应分别标记阈值和样本来源,不能混成一张平均表。

还要检查不确定结果是否留在分母。把“无法判定”全部删除,可能让性能看起来更整齐,却隐去了真实使用时会遇到的结果。若研究另设无效或灰区类别,应单独列人数和处理规则。

完成这些记录后,结论应保持克制:测试在特定研究人群和参照标准下呈现某组性能。跨人群使用前,需要重新评估患病率、样本谱和用途。统计换算可以解释概率,不能替代个人诊断。

资料来源

  • 美国食品药品监督管理局:《Statistical Guidance on Reporting Results from Studies Evaluating Diagnostic Tests》,发布或更新于 2007-03-13
  • 美国疾病控制与预防中心:《Principles of Epidemiology in Public Health Practice, Lesson 5 Appendix A》,发布或更新于 2011-11-01
  • 美国疾病控制与预防中心:《Screening Tests To Detect Chlamydia trachomatis and Neisseria gonorrhoeae Infections》,发布或更新于 2002-10-18