临床预测模型的亚组分析
模型已经纳入患者异质性指标,还要考虑个体化 threshold 和 subgroup analysis 吗?
要。因为这里至少有三种不同的“异质性”。
| 类型 | 问题 | 标准 VTE 风险模型能否解决? |
|---|---|---|
| 预后风险异质性 | 谁本身更可能发生 VTE? | 可以部分解决 |
| 干预获益/伤害异质性 | 谁会从抗凝中获益更多、出血或硬膜外血肿风险更高? | 通常不能 |
| 模型性能异质性 | 模型在不同人群中是否同样准确和校准? | 必须额外检验 |
1 模型纳入了变量,只代表它试图预测风险
标准预测模型估计的是:
[
p_i=P(\text{VTE}\mid X_i)
]
即患者 (i) 在其临床特征 (X_i) 下发生 VTE 的预测概率。
例如模型纳入:
- 年龄;
- 肿瘤;
- BMI;
- 手术时长;
- 既往血栓;
- D-dimer;
- 活动受限;
它确实可以让不同患者得到不同的 VTE 风险。
但这仍不能自动回答:
对这个患者来说,药物预防带来的 VTE 减少,是否超过其出血、硬膜外血肿、神经损伤、成本和不便?
一个简化的行动条件可以写成:
[
p_i \times E_i \times B_i
H_i \times L_i + C_i
]
其中:
- (p_i):该患者未接受干预时的 VTE 风险;
- (E_i):预防措施对该患者的相对或绝对效果;
- (B_i):避免一次 VTE 的获益;
- (H_i):干预导致伤害的概率;
- (L_i):伤害严重度;
- (C_i):治疗负担、成本或资源代价。
只有左侧大于右侧,行动才有预期净获益。
若每个人的 (E_i)、(H_i)、(B_i)、(L_i)、(C_i) 都相同,可以采用统一风险阈值。
但在脊柱术后 VTE 场景中,这种假设往往过强:
- 肾功能、血小板、凝血状态会改变出血风险;
- 神经外科或脊柱手术方式会改变硬膜外血肿后果;
- 导管、麻醉方式、术后活动能力会改变预防措施的可行性;
- 肿瘤、既往血栓或某些病理状态可能改变绝对获益;
- 患者偏好和医院资源也可能不同。
因此,一个模型纳入了异质性指标,不等于它已经完成个体化决策。 若要真正根据患者特征改变治疗建议,需要预测治疗获益和治疗伤害,甚至预测个体化治疗效应;这属于因果决策模型,而不是普通结局风险模型。个体化治疗决策的 DCA 也需要评估模型是否能改善治疗选择,而不仅是预测结局风险。(Sage Journals )
2 是否一定要做不同 subgroup 的不同 threshold?
不一定。
若干预的获益、伤害、可接受负担和患者偏好在各亚组中近似相同,并且模型在各组中校准良好,那么一个共同的风险阈值可以合理。
例如,模型给每位患者预测绝对 VTE 风险:
- A:1%
- B:4%
- C:11%
若行动阈值是10%,那么只有 C 行动。即使三人属于不同亚组,也不需要因为“分组不同”而强行设不同 cut-off。
不同阈值真正需要的理由不是“基线发生率不同”,而是:
- 预防疗效不同;
- 出血或其他伤害风险不同;
- 行动成本或可行性不同;
- 患者价值取向不同。
不要为了让不同亚组获得相同敏感度、特异度或 PPV,就机械地分别调阈值。那只是统计指标的平衡,不必然是临床净获益最大化。DCA 的阈值概率本质上对应漏诊与不必要干预的相对权衡,而不是 ROC 曲线上某个天然最优点。(PMC )
3 为什么仍然需要 subgroup analysis?
因为“变量被纳入模型”不等于“模型在该变量的不同人群中表现一致”。
举例:模型纳入 sex,但仍可能出现:
| 组别 | 平均预测风险 | 实际观察风险 |
|---|---|---|
| 男性 | 10% | 10% |
| 女性 | 10% | 4% |
总体上看,模型的平均预测可能仍然“不错”;但对女性而言,10% 恰好可能跨过抗凝阈值,造成系统性过度干预。
原因可能包括:
- 该亚组事件数少,模型估计不稳定;
- 关键交互项未纳入,例如 sex × cancer、年龄 × 手术类型;
- 某些变量在不同人群中的临床含义不同;
- 测量质量、缺失模式、诊疗路径或基础风险不同;
- 模型在开发医院表现良好,但在新环境中发生 subgroup-specific dataset shift。
因此:
模型变量负责个体化预测;
subgroup analysis 负责审计这种个体化是否真的可靠。
在你的 checklist 中,subgroup performance 不应理解为“每篇小样本研究都必须强行做十几个亚组”。它的 Y 应指:研究对预先定义、临床上重要且事件数足够的亚组,报告了至少部分模型性能,例如 discrimination、calibration 或 net benefit。
事件很少时,最诚实的做法不是挖很多亚组,而是写明无法可靠估计,需要更大样本或外部验证。PROBAST+AI和临床预测模型评价框架都强调,模型的适用性和性能必须结合目标人群、预测因子、结局及验证环境判断,而不能仅凭整体 AUROC 推断。(BMJ )