
来自英国曼彻斯特大学、牛津大学和美国阿肯色大学的研究人员近日在《美国国家科学院院刊》发表论文,警告科学界长期以来将统计"非显著"结果解读为"无效应"的做法存在根本性错误,并推广一种名为等效检验的统计方法,以帮助研究人员更准确地区分"效应真正微不足道"与"数据不足以得出结论"这两种截然不同的情形。
在统计学中,p值用于衡量在真正没有效应的情况下观察到当前数据的出乎意料程度。当p值大于0.05时,通常被认为结果"不显著"。然而,这并不意味着效应不存在——它仅代表现有证据不足以得出差异存在的结论。研究人员警告,将"非显著"等同于"无效应"的误读在约50%的研究论文和会议报告中普遍存在,可能导致研究人员从数据中得出错误结论。
这一混淆之所以危险,在于同一个统计结果可能来自两种完全不同的情形:要么真的没有有意义的效应,要么存在重要效应但因样本量过小或数据变异性过高而被掩盖。在许多样本量不足以检测真实差异的研究中,错误地报告"无差异"可能导致有前景的疗法被忽视、真实风险未被察觉,从而使后续研究偏离正确方向。
研究团队推广的等效检验方法提供了一种替代思路。传统统计检验关注的是"是否有证据支持存在差异",而等效检验关注的是"即便存在差异,这个差异是否小到在科学、临床或实际意义上可以忽略不计"。这种方法使研究人员能够区分真正可以忽略的效应与因证据不足而仍悬而未决的结果。
研究团队重点推广其中的双单侧检验程序(TOST),这一方法已在心理学、医学和药物监管领域获得一定认可,但在生命科学和自然科学的许多领域仍未得到充分利用。
论文共同作者、曼彻斯特大学心脏生理学教授David Eisner表示:"研究人员常常想知道某种效应是否缺失或小到可以忽略,但传统统计检验无法回答这个问题。非显著结果经常被解读为什么都没发生的证据,而实际上它可能仅仅意味着没有足够的证据来确定。"
论文共同作者、牛津大学Jakub Tomek表示:"等效检验有助于区分真正微不足道的效应与尚未解决的问题,使科学家对数据实际告诉他们的内容有更清晰的认识,并提高所报告结论的可信度。"
阿肯色大学医学科学学院Aaron Caldwell补充道:"等效检验迫使你回答大多数研究从未提出的问题:多小才算小到不值得关注?这是一个科学判断,而非统计判断,必须在收集数据之前做出。这样做的回报是,你终于能够就效应不存在做出肯定性陈述,而不仅仅是未能发现效应。"
为使这一方法更易于使用,研究团队还开发了一款免费在线计算器,允许研究人员无需编写代码即可执行常见的等效检验。该计算器支持多种常用统计比较方法,并已与成熟统计软件进行了验证对比。
参考文献:Jakub Tomek et al, Beyond "non-significant" results: Why and how to test for practical equivalence, Proceedings of the National Academy of Sciences (2026). DOI: 10.1073/pnas.2611548123
编辑:王洪
排版:李丽





评论 (0)