1f600

临床预测模型的亚组分析

2026/07/08 发布 2026/07/08

模型已经纳入患者异质性指标,还要考虑个体化 threshold 和 subgroup analysis 吗?

要。因为这里至少有三种不同的“异质性”。

类型 问题 标准 VTE 风险模型能否解决?
预后风险异质性 谁本身更可能发生 VTE? 可以部分解决
干预获益/伤害异质性 谁会从抗凝中获益更多、出血或硬膜外血肿风险更高? 通常不能
模型性能异质性 模型在不同人群中是否同样准确和校准? 必须额外检验

1 模型纳入了变量,只代表它试图预测风险

标准预测模型估计的是:

[
p_i=P(\text{VTE}\mid X_i)
]

即患者 (i) 在其临床特征 (X_i) 下发生 VTE 的预测概率。

例如模型纳入:

  • 年龄;
  • 肿瘤;
  • BMI;
  • 手术时长;
  • 既往血栓;
  • D-dimer;
  • 活动受限;

它确实可以让不同患者得到不同的 VTE 风险。

但这仍不能自动回答:

对这个患者来说,药物预防带来的 VTE 减少,是否超过其出血、硬膜外血肿、神经损伤、成本和不便?

一个简化的行动条件可以写成:

[
p_i \times E_i \times B_i

H_i \times L_i + C_i
]

其中:

  • (p_i):该患者未接受干预时的 VTE 风险;
  • (E_i):预防措施对该患者的相对或绝对效果;
  • (B_i):避免一次 VTE 的获益;
  • (H_i):干预导致伤害的概率;
  • (L_i):伤害严重度;
  • (C_i):治疗负担、成本或资源代价。

只有左侧大于右侧,行动才有预期净获益。

若每个人的 (E_i)、(H_i)、(B_i)、(L_i)、(C_i) 都相同,可以采用统一风险阈值。
但在脊柱术后 VTE 场景中,这种假设往往过强:

  • 肾功能、血小板、凝血状态会改变出血风险;
  • 神经外科或脊柱手术方式会改变硬膜外血肿后果;
  • 导管、麻醉方式、术后活动能力会改变预防措施的可行性;
  • 肿瘤、既往血栓或某些病理状态可能改变绝对获益;
  • 患者偏好和医院资源也可能不同。

因此,一个模型纳入了异质性指标,不等于它已经完成个体化决策。 若要真正根据患者特征改变治疗建议,需要预测治疗获益和治疗伤害,甚至预测个体化治疗效应;这属于因果决策模型,而不是普通结局风险模型。个体化治疗决策的 DCA 也需要评估模型是否能改善治疗选择,而不仅是预测结局风险。(Sage Journals )

2 是否一定要做不同 subgroup 的不同 threshold?

不一定。

若干预的获益、伤害、可接受负担和患者偏好在各亚组中近似相同,并且模型在各组中校准良好,那么一个共同的风险阈值可以合理。

例如,模型给每位患者预测绝对 VTE 风险:

  • A:1%
  • B:4%
  • C:11%

若行动阈值是10%,那么只有 C 行动。即使三人属于不同亚组,也不需要因为“分组不同”而强行设不同 cut-off。

不同阈值真正需要的理由不是“基线发生率不同”,而是:

  • 预防疗效不同;
  • 出血或其他伤害风险不同;
  • 行动成本或可行性不同;
  • 患者价值取向不同。

不要为了让不同亚组获得相同敏感度、特异度或 PPV,就机械地分别调阈值。那只是统计指标的平衡,不必然是临床净获益最大化。DCA 的阈值概率本质上对应漏诊与不必要干预的相对权衡,而不是 ROC 曲线上某个天然最优点。(PMC )

3 为什么仍然需要 subgroup analysis?

因为“变量被纳入模型”不等于“模型在该变量的不同人群中表现一致”。

举例:模型纳入 sex,但仍可能出现:

组别 平均预测风险 实际观察风险
男性 10% 10%
女性 10% 4%

总体上看,模型的平均预测可能仍然“不错”;但对女性而言,10% 恰好可能跨过抗凝阈值,造成系统性过度干预。

原因可能包括:

  • 该亚组事件数少,模型估计不稳定;
  • 关键交互项未纳入,例如 sex × cancer、年龄 × 手术类型;
  • 某些变量在不同人群中的临床含义不同;
  • 测量质量、缺失模式、诊疗路径或基础风险不同;
  • 模型在开发医院表现良好,但在新环境中发生 subgroup-specific dataset shift。

因此:

模型变量负责个体化预测;
subgroup analysis 负责审计这种个体化是否真的可靠。

在你的 checklist 中,subgroup performance 不应理解为“每篇小样本研究都必须强行做十几个亚组”。它的 Y 应指:研究对预先定义、临床上重要且事件数足够的亚组,报告了至少部分模型性能,例如 discrimination、calibration 或 net benefit。

事件很少时,最诚实的做法不是挖很多亚组,而是写明无法可靠估计,需要更大样本或外部验证。PROBAST+AI和临床预测模型评价框架都强调,模型的适用性和性能必须结合目标人群、预测因子、结局及验证环境判断,而不能仅凭整体 AUROC 推断。(BMJ )

还没有评论,赶紧评论下,抢个沙发?