周欣/杨靖Med综述:人类微生物组研究中的统计效能和样本量估算

2026-06-30 11:29
上海

医学

2026年6月16日,复旦大学智能医学研究院/口腔医院周欣教授团队与广州国家实验室、π-HuB大科学计划秘书长杨靖教授团队,在Cell Press细胞出版社旗下医学旗舰刊Med在线发表了题为“Power and sample-size estimation in human microbiome research”的综述论文。文中,作者逐层梳理了微生物组研究中不同研究类型的统计效能与样本量计算的考量,并提出核心建议:在微生物组研究中,经典的解析型样本量公式大多失效,应转向基于模拟(simulation)的统计效能(Statistical Power, 后简称Power)分析,并善用预实验(pilot)数据来刻画真实的方差、稀疏度与相关结构;同时把多重检验、分阶段的发现-验证设计等因素前置到研究设计阶段进行考量。

人类微生物组已被关联到糖尿病、炎症性肠病、肿瘤、衰老乃至几乎一切——但这个领域长期被一个公开的信誉问题困扰:大量“明星结论”无法在独立人群中重复。该综述系统性探讨了人类微生物组研究中的重要环节——研究设计阶段的统计检验效能与样本量估算。

与多数偏数学、面向统计专家的方法学综述不同,本文以临床科学家和青年研究者“用得上”为目标,根据研究问题的类型把统计效能与样本量的考量逐层梳理:从描述群落结构的多样性分析(α多样性的Chao1、Shannon、Simpson、Fisher,以及β多样性的Jaccard、Bray-Curtis、UniFrac与 PERMANOVA,并比较了各指标对稀有菌/优势菌的敏感性与相应的样本量含义),到识别具体菌的差异丰度与生物标志物检验(参数与非参数方法、专为组成性数据设计的ANCOM系列、负二项与零膨胀模型),再到相关性与因果推断(相关分析、传统中介分析与孟德尔随机化),最后讨论如何通过纵向设计——“让每个受试者做自己的对照”,来提升统计效能。

贯穿全篇的核心建议是:在微生物组研究中,经典的解析型样本量公式大多失效,应转向基于模拟(simulation)的power分析,并善用预实验数据来刻画真实的方差、稀疏度与相关结构;同时把多重检验、分阶段的发现-验证设计等因素前置到设计阶段进行考量。文章最后用一张决策树式的总结图(图1)把这些内容收束成一份导航图——从“你要回答的是群落间还是群落内的问题”出发,逐步映射到合适的统计方法与具体的估算工具(如G*Power、micropower及一系列R包),为研究者提供了一个结构化、可操作的样本量规划起点。

值得一提的是,通讯作者周欣教授本身深度参与人类微生物组计划二期(iHMP)这一大科学计划,通讯作者杨靖教授现任π-HuB国际大科学计划秘书长,团队正将iHMP的经验带入π-HuB框架。

图1 微生物组研究中样本量估算策略与现有工具

作者专访

Cell Press细胞出版社特别邀请本文作者周欣教授、杨靖教授进行了专访,为大家进一步解读。

CellPress:

微生物组几乎与所有重大疾病都被建立了关联,但该领域长期被“结论难以重复”困扰。能否请您谈谈,统计意义上的power不足,会在多大程度上影响这场可重复性危机?

周欣教授:

可重复性危机有很多被讨论过的原因——测序平台差异、分析流程不统一、批次效应等。但有一个更上游、却很少被正面讨论的原因,就是很多研究从设计的第一天起就是统计效能不足(underpowered)的。厚壁菌门/拟杆菌门比值就是一个很典型的例子:它最初基于很小的样本量而被提出为肥胖标志物,引用量极高,但后来在更大、更多样的人群里反复无法得到重复。

问题在于,当一个研究的样本量不足以可靠地检出真实效应时,结果要么得到假阴性、要么把偶然的波动当成了信号——而后者在小样本里尤其危险。微生物组的效应量本身往往不大,个体间和个体内的变异又极高,这就意味着所需样本量比研究者直觉以为的要大得多。我们组织的这篇综述,某种程度上就是想说:可重复性危机不只是“分析”的问题,它首先是“设计”的问题。如果不在研究设计阶段就把 power 想清楚,后面再精巧的分析也救不回来。

CellPress:

您在2024年那项追踪86人、六年、四个身体部位的研究(Cell Host &Microbe, 2024, DOI: 10.1016/j.chom.2024.02.012)里有一个反直觉的发现:每个人最“独一无二”的那部分菌群,往往也是最稳定的。这个“越个体化、越稳定”的观察,对我们理解“为什么微生物组研究难以重复”提供了什么样的视角?

周欣教授:

我们当时追踪了 86 位参与者长达六年,覆盖肠道、口腔、皮肤、鼻腔四个部位。一个出乎意料的观察是:每个人身上那些个体特异的菌群,反而表现出更强的时间稳定性;而稳定性和个体性本身又是部位特异的——肠道和口腔比皮肤、鼻腔更稳定。

这个发现对“难以重复”其实是一个很关键的视角。它意味着,当我们做跨人群比较时,每个人体内最稳定、最具辨识度的那部分信号,恰恰是高度个体化的。换句话说,个体差异不是均匀的随机噪声,而是结构化的、属于每个人自己的稳定特征。如果一个研究的样本量不足以充分代表这种个体间的结构化差异,那么它在一个人群里看到的信号,很可能只是若干个体特征的偶然叠加,换一批人就消失了。这正是为什么我们一再强调:微生物组研究里,低估人群的内在变异,几乎等同于高估了自己的统计效能。

CellPress:

本综述的一个核心观点是,微生物组数据的组成性、稀疏性和零膨胀,让经典的样本量估算公式失灵。对一位想做菌群研究的临床医生来说,如果他沿用G*Power这类常规工具,最可能在哪里“翻车”?

周欣教授:

G*Power这类工具背后假设的是“干净”的数据——近似正态、方差齐性、各观测独立。微生物组数据几乎在每一条上都不满足:它是组成性的(一个菌的相对丰度上升必然意味着别的下降,彼此并不独立)、高度稀疏、还有大量的零。

最常见的“翻车”有两种。一种是直接套用一个均值差异的公式算出每组20人就够了,却完全没有把组成性带来的方差膨胀和零膨胀算进去,结果真实所需可能是它的好几倍。另一种更隐蔽:研究者其实想问的是“具体哪个菌不一样”(差异丰度),却用了一个为“整体群落是否不同”设计的样本量估算——这两类问题的power需求完全不在一个量级上。说到底,经典公式不是不能用,而是用错了对象——就像拿量血压的袖带去量一个人的血糖。

CellPress:

您的纵向数据显示,同一个人体内菌群的日间波动有时甚至超过不同人之间的差异。当个体内的“噪声”可以盖过个体间的“信号”时,传统横断面研究里效应量和样本量的概念是不是需要被重新定义?

周欣教授:

是的,这恰恰是微生物组区别于很多其他组学的地方。在一个横断面研究里,我们默认每个人提供一个具有代表性的快照,然后比较组间差异。但如果同一个人不同时间点之间的波动,本身就和不同人之间的差异一样大甚至更大,那么单个时间点的快照到底代表了什么,就成了问题。

这时候效应量需要被放在两层方差的背景里重新理解——既有个体间方差,也有个体内方差。如果只盯着个体间差异去估算样本量,而忽略了个体内的波动,得到的power是虚高的。我们文章里想传达的一点是:对许多问题,与其在更多的人身上各取一个点,不如在适当数量的人身上取多个时间点——纵向设计让每个人成为自己的对照,把个体间这层最大的方差直接抵消掉。

CellPress:

在人群队列研究里,是否存在一种现象——样本量似乎不是从“要回答的科学问题”算出来的,而是从“经费能覆盖多少人”倒推出来的。您如何看待“经费约束”?

杨靖教授:

我们想坦诚地说,这个现象确实普遍存在。在投标书里,统计效力分析有时更像是一个需要填上的格子,而不是真正驱动设计的东西——先有了经费能覆盖的人数,再反过来把分析写得“看起来够”。

经费约束是真实存在的,大多数项目的确撑不起一个理想统计效力的人群队列,这一点我们完全理解。但如果把问题全归到钱上,就错过了更根本的一层:很多研究者,包括很优秀的医学科学家,心里其实并没有一张“什么样的样本量能真实回答什么层级的问题”的地图。于是逻辑被彻底倒过来了——本该是“问题决定样本量”,现实却成了“样本量决定我能问什么,而我却假装在问更大的问题”。这个认知缺口,比经费缺口更值得我们这个领域正视。

周欣教授:

一个非常典型的场景是这样的:一个团队招募了大约30位患者和30位对照,这个规模拿来比较两组人群体层面的整体菌群结构差异,其实是真实的、站得住的。但同一个30人的队列,研究者往往还想在上面做成千上万个分类群的差异丰度筛查、再校正年龄饮食用药等混杂、最后还想做中介分析去推断因果。

问题在于,这同一批人,在“群落整体比较”这一层是够的,到了“单个菌的差异”这一层就开始吃力,而到“校正混杂的关联”和“因果推断”这两层则远远不够。它在每一个更高的层级上都在超载,而结论却被同等地写进论文。这就是“样本量决定能问什么”这种倒置最危险的后果:不是问错了问题,而是用只够回答 A 类问题的资源,同时去回答了B、C、D类问题,并对所有结论一视同仁地自信。一张哪怕只是数量级意义上的地图,至少能让人在设计阶段就做一个诚实的选择:要么把问题缩到样本量能回答的层级,要么去争取与问题匹配的资源。

CellPress:

您在综述中提到,纵向设计如何提升power——让每个受试者做自己的对照,抵消个体间变异。这是不是应对微生物组高变异性最现实的一条路?它的代价和边界又在哪里?

周欣教授:

纵向设计是我们认为最被低估、也最值得推广的一条路。它最大的价值在于:个体间差异是微生物组里最大的一块方差,而让每个人做自己的对照,等于直接把这块方差从误差里拿掉了,对检出细微的、随时间发生的变化尤其有效。我们在那项六年队列里也亲身体会到,多时间点采样在检测宿主效应和可遗传菌群上,远比单时间点有力。

但它绝不是免费午餐。一个关键的边界是:当个体内的相关性(ICC)很高时,在同一个人身上不断增加采样次数,对组间比较带来的 power 增益会迅速递减——这时候,增加人数仍然比增加观测次数更重要。另外,纵向研究要面对脱落、缺失、采样时点不规则、以及时间自相关等一系列问题,分析模型也更复杂。所以纵向设计的正确用法不是多采几次就行,而是把采样频率匹配到你关心的生物学时间尺度上,并用恰当的模型去隔离真正的时间效应。

CellPress:

据了解,您正基于人类微生物组计划二期(iHMP)的数据,系统地构建一套power与样本量的 simulation,并打算借助AI agent把它做成一个可对话的设计工具。可否做一个简单介绍?

周欣教授:

我们特别想强调一点:我们不愿意给出一张过于坚定的“几十人对应什么、几百人对应什么”的对照表。因为那会和我们这篇综述最核心的论点自相矛盾——微生物组没有通用的样本量公式。任何脱离了具体数据分布、效应量假设和分析框架的数字,都是不负责任的。而画一张真正负责任的地图,本身就是一项需要大规模simulation的科学工作。

这也是我们现在正在做的事。我们以iHMP的真实数据作为simulation的底座——因为它捕捉了真实人体微生物组的零膨胀、过离散、纵向结构等所有难题,在此之上系统地刻画:在不同的问题类型、不同的效应量、不同的分析方法下,power究竟随样本量怎样变化。更进一步,我们打算把这套工作做成一个借助AI agent的可对话工具:研究者不必先成为统计专家,而是用自然语言描述自己的问题,工具基于iHMP数据底座的模拟,给出有依据的power估计和设计建议。我们也希望未来把它建成一项面向社区开放的共享设计资源。

CellPress:

您的工作继承了iHMP这一代大科学计划的经验。能否谈谈,为什么统一的数据标准本身就能提升power?以及您希望未来对π-HuB国际大科学计划有哪些贡献?

杨靖教授:

我们文章里反复提到,批次效应、DNA提取差异、测序深度不一致,这些技术因素都会抬高方差、从而推高所需样本量。所以当一项研究让所有参与队列使用同一套采样、提取、测序和分析标准时,它压低的是技术方差——这等于不增加一个人,就提升了power。更关键的是,只有在统一标准下,不同队列的数据才能真正合并:两个各1000人的队列简单相加,并不等于一个2000人的队列,批次效应会把真实信号淹没掉;而一旦标准统一,多中心合作就能让样本量真正地相加、急剧扩增,那些单个队列无力回答的高层级问题——稀有菌、弱效应、因果推断——才第一次变得可及。

iHMP这一代先驱计划用真金白银让整个领域看清了一件事:在大科学计划里,设计阶段对power和样本量的疏忽,浪费的不是几个样本,而是巨大的集体投入。我们这篇综述,本质上是想把这份经验提炼成可操作的方法学,让正在建设中的计划能站在前人的肩膀上,不必把上一代的学费再交一遍。

更长远地说,微生物组是全人类共同的科学问题,没有任何一个国家、一个计划能独自回答它。我们希望这份工作能成为π-HuB国际大科学计划之间经验传递与标准协作的起点之一。

作者介绍

周欣

研究员

复旦大学智能医学研究院/口腔医院青年研究员、博士生导师。香港理工大学兼聘教授,香港理工斯坦福深度纵向组学中心执行副主任。药促会基因与细胞治疗专委会委员,上海市白玉兰浦江人才。研究领域包括多组学队列与人工智能、免疫微生物互作、免疫类器官等。

杨靖

研究员

广州国家实验室研究员,医学蛋白质组全国重点实验室研究员,广州医科大学和广东智慧医学国际研究院兼聘教授。研究领域包括化学蛋白质组学、计算蛋白质组学与氧化还原生物学。

王路漫

教授

北京大学医学人文学院健康信息管理系副教授。研究方向包括微生物多组学数据整合与智能分析、临床数据分析、微生物生态学。致力于人工智能与医学交叉领域的研究与教学,推动数据分析方法在医学领域的应用。

周倩宜

硕士

复旦大学智能医学研究院在职科研助理,天津大学医学院临床硕士,主要研究方向为队列数据分析、免疫类器官和数字孪生。

陆颍洲

博士

谷歌Gemini团队开发工程师,斯坦福大学遗传学系博士后。主要研究方向为人工智能数据治理、AI大模型开发。

相关论文信息

论文原文刊载于CellPress细胞出版社

旗下期刊Med上

▌论文标题:

Power and sample-size estimation in human microbiome research

▌论文网址:

https://www.sciencedirect.com/science/article/pii/S2666634026001777

▌DOI:

https://doi.org/10.1016/j.medj.2026.101174

原标题:《周欣/杨靖Med综述:人类微生物组研究中的统计效能和样本量估算 | Cell Press对话科学家》

阅读原文

    特别声明
    本文为澎湃号作者或机构在澎湃新闻上传并发布,仅代表该作者或机构观点,不代表澎湃新闻的观点或立场,澎湃新闻仅提供信息发布平台。申请澎湃号请用电脑访问https://renzheng.thepaper.cn。