跳转到正文

孟德尔随机化【MR】

返回

孟德尔随机化【MR】

发布于: 更新于:
统计加载中...

1 什么是孟德尔随机化?

孟德尔随机化的概念源于 19 世纪遗传学奠基人——格里高尔 · 孟德尔(Gregor Mendal)。孟德尔通过对豌豆植物的杂交实验,发现了基因遗传的基本规律,这为现代遗传学奠定了基础。现代的孟德尔随机化方法借鉴了他的遗传学理论,将基因变异视为一种“随机分配”的工具变量,用以推断因果关系。

孟德尔随机化的核心是孟德尔第二定律:分离定律,也就是当 DNA 在配子形成时,基因对的不同等位基因会独立地分配到不同的配子中。这点类似随机对照试验(Randomized conturolled trials, RCT)中的随机分组。

例如,在血清钙水平对冠心病风险影响的研究中,RCT 受试者被随机分为两组,一组为对照组,另一组是使用了钙补充剂的实验组。根据孟德尔第二定律,MR 研究人群根据是否继承血清钙水平相关的遗传变异,也被“随机化”分为了两组。

在排除混杂因素的条件下,如果 RCT 中的随机组平均血清钙水平较高的同时也具有较高的冠心病风险,则表明钙水平与冠心病风险存在因果关系。因此,按照同样的推理,如果 MR 发现影响血清钙水平的遗传变异与冠心病风险的差异有关,则它提供了血清钙对冠心病有因果影响的证据。

孟德尔随机化 2026 06 18 1299d819 272f 4a9d 9b51 b6fec6c48190
图 1:随机对照试验 RCT 和孟德尔随机化 MR 研究设计的比较 (以血清钙水平对冠心病的因果关系为例子)

2 孟德尔随机化的三大假设

孟德尔随机化实际上是通过工具变量来解释事物之间的因果关系。在生物学研究中,这个工具变量是指遗传变异,即利用全基因组关联研究(Genome-wide association study, GWAS)数据 SNP(Single-Nucleotide Polymorphism)作为工具变量来分析表型和疾病之间的因果关系。

为了确保结果的有效性,MR 必须满足 3 个核心假设:

  1. 关联性:遗传变异必须与暴露因素 X 强相关;
  2. 独立性:遗传变异不能与任何可能的混淆因素 U 相关;
  3. 排他性:遗传变异不能与结局变量 Y 直接相关。
孟德尔随机化 2026 06 18 3a4e451d e80b 4d58 9c4b 9ea529d5579b
图 2:孟德尔随机化 3 大假设

上述例子中,例如我们发现血清钙水平较高的患者更容易得冠心病,这只能表明高血清钙和冠心病同时出现的概率较大(相关性较强),不能证明血清钙水平高是冠心病的风险因素(相关性不代表因果关系)。因为可能存在其他因素导致冠心病的发生,或者也许冠心病才是导致血清钙水平高的原因。

对此,为了探究高血清钙(暴露因素 X)是否会导致冠心病(结局变量 Y)的发生,我们引入遗传变异 SNP 作为工具变量,探究高血清钙和冠心病的因果关系:

  1. 关联性:弱工具变量的使用会导致估计出现偏移,所以遗传变异必须与高血清钙存在稳定的强相关关系。这在全基因组水平上表现为:该 SNP 在高血清钙上的 p <5 * 10 -8
  2. 独立性:遗传变异必须与高血压高血脂等其他因素相互独立,没有相关性。这在全基因组水平上表现为:除了高血清钙以外,该 SNP 在其他因素上的 p > 5 * 10 -8
  3. 排他性:遗传变异不能与冠心病直接相关。如果该 SNP 能直接导致冠心病,那么相关于跳过了高血清钙这一暴露因素直接导致了结局,我们无法证明高血清钙和冠心病有因果关系。

未完待续





评论