045
Intro
Possible Selection Bias in Mendelian Randomization Studies: Effect of Body Mass Index on Breast Cancer as an Example 是 Kezhen Fei 等人在 2026 年发表于 American Journal of Epidemiology 的文章。它讨论一个老问题:一些 MR 研究发现 genetically predicted BMI 越高,乳腺癌风险反而越低,这和肥胖增加绝经后乳腺癌风险的流行病学和机制证据相冲突。
作者给出的解释是 survivor selection bias。更准确地说,他们怀疑不是 MR 算法突然坏了,而是 MR 使用的 GWAS summary statistics 已经被入组和存活选择污染了。这个 distinction 很重要,因为文章标题批的是 MR studies,但病根其实在 GWAS ascertainment。
Why I Read It
我读它只是因为题目和摘要提到 MR selection bias。读之前并不知道它具体要证明什么,也不清楚偏倚具体是什么。
读完后才发现,作者真正证明链条并不在 MR 方法本身,而在 MR 使用的 GWAS summary statistics:如果 outcome GWAS 里的 SNP-outcome association 已经因为入组/存活机制而偏,MR 会继承这个偏倚。也就是说,它把一个本质上发生在 GWAS ascertainment / SNP-outcome association 层面的潜在问题,包装成 MR 研究的选择偏倚;同时又用 sibling breast cancer history 这种很脆的 proxy outcome 来支撑解释。它可以作为“有人这样批评 MR”的案例,但不能当成一个强证据。
What It Says
作者先做了两步铺垫。第一步,用 GIANT 的女性 BMI GWAS 作为暴露,用 UK Biobank 中 mother’s attained age GWAS 作为女性 lifespan proxy,做 two-sample MR。结果是 genetically predicted BMI 越高,寿命 proxy 越短:每 1 SD BMI 增加对应约 -1.50 年,95% CI 为 -2.30 到 -0.70。
第二步,他们把乳腺癌 liability 作为暴露,同样用 mother’s attained age 作为结局,说明乳腺癌 genetic liability 也和更短寿命相关。到这里,作者想建立的是一个选择偏倚前提:BMI 会影响活到入组,乳腺癌也会影响活到入组。
第三步才是 BMI 到乳腺癌的 MR。暴露仍然是 GIANT female-specific BMI GWAS,结局换成三套乳腺癌 GWAS。用 BCAC 的参与者本人乳腺癌,BMI 看起来降低乳腺癌风险,OR = 0.74,95% CI 0.64-0.84。用 UK Biobank 的参与者本人乳腺癌,结果也类似,OR = 0.70,95% CI 0.56-0.87。但用 UK Biobank 参与者报告的 sibling breast cancer history 作为 proxy outcome 时,关联消失,OR = 1.00,95% CI 0.99-1.01。
作者据此说:既往 MR 里 BMI 对乳腺癌的“保护效应”可能是 survivor selection bias 造成的假象。机制是,GWAS 只纳入活到中老年且能参加研究的人;如果高 BMI genetic liability 和乳腺癌都影响存活入组,那么在这个被选择过的样本里,SNP 到乳腺癌的关联可能被扭曲。
What I Take From It
这篇文章真正有价值的地方只有一个:它提醒 MR 继承 GWAS 的偏倚。如果 outcome GWAS 里的 SNP-outcome beta 已经因为 survivor selection、case ascertainment 或 biobank participation 被扭曲,two-sample MR 不会自动修复它。MR 用的是 summary beta,不是完整世界。
但文章把这个问题说成 “MR studies may suffer from selection bias”,其实有点转移火力。更准确的说法应该是:GWAS ascertainment bias can bias downstream MR estimates。MR 是下游受害者,GWAS 输入才是偏倚进入系统的地方。
我不觉得这篇能证明既往 BMI-乳腺癌 MR 结果已经被推翻。它只能说明:那些结果可能存在 survivor selection 的解释。这个可能性值得记录,但不能被当成强证据。
Note
这篇文章最大的问题是,它几乎全靠 MR 套 MR 来讲一个选择偏倚故事。它没有直接观察谁因为高 BMI 或乳腺癌死在入组前,也没有量化真实入组机制。它先用 MR 证明 BMI genetic liability 和乳腺癌 liability 都跟寿命 proxy 相关,然后再用另一个 proxy outcome 说保护效应消失。逻辑是可以画成 DAG 的,但证据链仍然很间接。
更麻烦的是 sibling breast cancer history。这个变量不是兄弟姐妹参加 UKB 后被完整随访诊断出来的乳腺癌,而是 UKB 参与者报告“兄弟姐妹有没有乳腺癌”。它本质上是参与者 SNP 和亲属疾病史之间的 proxy-phenotype GWAS。因为兄弟姐妹有遗传相关性,这不是完全荒唐;但它很脆,受报告误差、家庭结构、筛查机会、医疗可及性、家庭健康意识和社会经济条件影响。拿这个 proxy 的 null result 去反推本人乳腺癌 GWAS 的保护效应是 survivor bias,力度不够。
文章还把选择机制讲得过于单向。现实里,乳腺癌患者或有家族史的人可能更常接触医疗系统,更容易被诊断、登记或参与研究;健康志愿者效应、教育、收入、筛查意识也都会影响 UKB/BCAC 这类数据的组成。selection bias 的方向未必只会让病例缺失,也可能在某些路径上放大病例纳入。作者没有真正处理这个复杂性。
所以这篇可以引用来提醒:MR 不能默认 GWAS beta 干净,biobank survivor selection 会传导到 MR。但不要把它当作强实证证据。它更像一篇方法学质疑短文:问题意识对,实证支撑弱,批 MR 的姿势也不够精确。