循证实践与医学统计学
因为在 AKT 中,“我在网上看到了一些东西”这种说法还不够充分。
最后更新:2026年4月 · 也称为循证医学 (EBM)
网络资源
精心挑选的官方指南和全科医生实践培训资源。因为有时,最宝贵的智慧并不隐藏在官方文件中。
一分钟回忆
临床实习前或AKT考试前一晚扫描一下?这些都能影响你的分数。
🧮 风险公式
- ARR = CER − EER
- NNT = 1 ÷ 年度收益率
- 存款准备金率 = ARR ÷ CER
- RR = 能效比 ÷ 成本率
- NNH = 1 ÷ ARI
🔬 诊断测试
- 意思 = TP ÷ (TP+FN) → SnNout
- 产品规格 = TN ÷ (TN+FP) → SpPin
- PPV的 = TP ÷ (TP+FP) ← 低患病率跌倒
- NPV = TN ÷ (TN+FN) ← 高发跌倒
📊 研究设计
- 系统评价/荟萃分析 → 最高证据
- 随机对照试验 → 治疗的金标准
- 队列研究 → 相对风险和发病率
- 病例对照研究 → 手术室,罕见病
- 横断面研究→患病率
📈 图表
- 森林图菱形与直线交叉点 = 不显著
- 漏斗图不对称性 = 发表偏倚
- Cates 图:NNT = 100 ÷ 黄色面孔
- 箱线图中间线 = 中位数
- I² >50% = 显著异质性
📉 意义
- p < 0.05 = 具有统计学意义
- 置信区间跨越 1.0(比率)= 无统计学意义
- 置信区间跨越 0(差异)= 无统计学意义
- 平均值 = 均值;中位数 = 中间值
- 正态分布的 68-95-99.7 规则
⚖️ 偏见类型
- 选择 → 非代表性样本
- 回忆 → 案例更容易记住
- 发表 → 仅限阳性研究
- 提前期 → 筛选错觉
- 人员流失→辍学会扭曲结果
这在全科医生和AKT中为何重要
循证医学和统计学并非只是理论。在诊室里,无论你是否提及,每次讨论治疗方案都会涉及到需治疗人数(NNT)。每项血液检测都有其敏感性和特异性。每项新指南都基于特定的研究设计,而研究设计会影响你对其的信任程度。
在AKT考试中,这个主题占分相当大一部分——根据RCGP的指导,大约占试卷的10-15%。这是少数几个只需少量针对性复习就能取得显著成效的领域之一。 立即许多考生在这里丢掉容易拿到的分数,不是因为概念难懂,而是因为他们从来没有坐下来系统地学习过这些概念。
AKT考试中的统计学问题通常会提供一份试验数据表格,要求你计算某个数值、解读图表或确定最佳研究设计。这类问题侧重于考察你的系统性思维,而非医学知识。 这使得它们成为试卷中最“容易学习”的分数。
循证医学(EBM)
“上世纪1980年代中期我接受培训时,我给每个心脏病发作后入院的病人都静脉输注利多卡因。那是标准做法,大家都这么做,似乎完全合情合理。”
——戈登·盖亚特教授,这位创造了“循证医学”一词的医生,在描述他在循证医学出现之前接受的培训时如是说。
他后来发现,他接受的训练——以及全世界成千上万医生都在采用的疗法——不仅毫无用处,而且可能还会害死人。这并非由于疏忽,也并非由于医术不精,而是因为从来没有人真正检验过这种疗法是否有效。
正是这个故事造就了循证医学的存在——也正是这个故事对你遇到的每一位患者都至关重要。
“认真、明确、明智地运用当前最佳证据来制定有关个体患者护理的决策。”
——David Sackett,《英国医学杂志》1996年——医学界引用最广泛的定义
简单来说:循证医学 (EBM) 要求你根据现有最佳研究(经过严格开展、批判性评价和诚实解读)来做出临床决策,而不是根据习惯、意见、传统或教授告诉你的内容来治疗病人。
它并不能取代临床判断——它 运筹学 它。EBM 建立在三个不可分割的支柱之上,这三个支柱必须协同运作:
🕰️循证医学是如何产生的?——简史
循证医学并非凭空出现,而是加拿大和英国数十年来悄然酝酿的革命性思想的结晶。
| 年份 | 创建 |
|---|---|
| 1938 | 约翰·保罗(耶鲁大学)创造了“临床流行病学”一词——其核心思想是,医学研究应该在人群中进行科学分析,而不仅仅是观察个体患者。 |
| 1967 | 加拿大汉密尔顿的麦克马斯特大学新医学院成立,设立了临床流行病学和生物统计学系——这在当时可谓是开创性的,致力于将研究方法应用于临床决策。 |
| 1972 | 苏格兰流行病学家阿奇·科克伦发表了 有效性和效率:关于医疗服务的随机思考 ——一篇里程碑式的著作,论证了医学必须严格检验自身的治疗方法。他的研究最终催生了以他名字命名的科克伦协作组织。 |
| 1981 | 麦克马斯特大学的大卫·萨克特及其同事在《加拿大医学会杂志》上发表了九篇系列文章,旨在指导临床医生如何批判性地评价医学文献。这标志着循证医学运动的正式开端。 |
| 1990 | 戈登·盖亚特是麦克马斯特大学的一位年轻住院医师主任,他设计了一个新的教学项目,最初将其命名为“科学医学”。同事们对此感到反感——暗示当前的医疗实践不够科学,这种说法太过直接。 |
| 1991 | 盖亚特重新命名了这种方法 “循证医学” 并在ACP期刊俱乐部的一篇社论中发表了这个术语。这个短语立刻流行起来。 |
| 1992 | 具有里程碑意义的JAMA论文—— 《循证医学:医学实践教学的新方法》 ——将循证医学引入世界。盖亚特回忆说,最初的反应是“愤怒”。同事们觉得这是在告诉他们,他们不是好医生。 |
| 1993 | Cochrane协作组织正式成立——这是一个旨在制作和传播医疗保健证据系统评价的国际网络。 |
| 1996 | David Sackett 在 BMJ 上发表了权威的三支柱定义。循证医学成为主流。 |
| 2000年代至今 | 循证医学已融入英国的医疗培训体系:英国国家卫生与临床优化研究所(NICE)指南、英国医学总会(GMC)的《良好医疗实践》以及皇家全科医师学会(RCGP)的课程均有相关要求。它已成为英国每位医生培训和考核的基础。 |
⚠️循证医学出现之前的医学是什么样的?它解决了什么问题?
在循证医学出现之前,医学的运作依赖于戈登·盖亚特(Gordon Guyatt)令人印象深刻的那句话。 “GOBSAT” - 老伙计们围坐在桌旁临床指南是由资深专家根据他们的个人意见编写的,而病人最终的治疗结果完全取决于碰巧是哪位医生接诊。
- 基于权威的医学: 你对待病人的方式和你教授如出一辙。权威来自资历,而非证据。一位“一直都是这么做的”顾问,即使“这种方法”从未经过检验,也依然会被人奉为圭臬。
- 基于直觉的医学: 如果某种治疗方法在生理上看似合理,就会被采用。如果抑制异常心律看起来合乎逻辑,就会加以抑制。至于这种方法是否真的对患者有益,却很少进行验证。
- 轶事医学: “根据我的经验,我发现……”就是当时的证据标准。个案决定实践——即便这些个案在统计上属于异常值。
- 差异巨大: 同一个病人如果去两家不同的医院就诊,或者即使是同一家医院的两位不同的医生就诊,对于完全相同的病症,也可能接受完全不同的治疗。
🔴 改变医学的案例——CAST 试验
这不是假设,而是现代医学中最重要的真实案例之一,也是循证医学有史以来最有力的论据之一。
设定——看似无懈可击的逻辑
心脏病发作会导致危险的心律失常(室性心律失常)。室性心律失常会导致猝死。因此: 抑制心律失常→预防猝死这似乎显而易见是正确的,因此从20世纪70年代开始,世界各地的医院都将抗心律失常药物——特别是利多卡因、氟卡尼和恩卡尼——常规用于心肌梗死后患者。不是偶尔使用,而是常规使用,作为标准治疗。
试验——有人真的测试过了
1987年,心脏心律失常抑制试验(CAST)招募了1,700多名心肌梗死后患者,并将他们随机分配到抗心律失常药物组(氟卡尼或恩卡尼)或安慰剂组。这些药物完全达到了预期效果——成功抑制了心律失常。但意想不到的事情发生了。
结果——出乎所有人的意料
服用这些药物的患者是 2.5倍更容易死亡 与服用安慰剂的患者相比,服用这些药物的患者死亡率更高。由于危害显而易见,试验不得不提前终止。这些药物竟然杀死了它们原本应该保护的患者。
NNH = 21。每 21 名接受氟卡尼或恩卡尼治疗的患者中,就有一名原本可以存活的患者死亡。
课
当时还是年轻心脏病专家的戈登·盖亚特亲自为他病房里每一位心肌梗死后的患者输注利多卡因。他遵循的是最佳实践,他接受过正确的培训,而且出发点是好的。然而,由于缺乏严格的随机对照试验(RCT)检验,他和他的同事都无从得知这种治疗方法是否有害。这段经历成为他毕生致力于循证医学(EBM)的核心原因。他后来表示,医学史“充斥着大量基于猜测和直觉而非确凿证据的治疗方法”。
在循证医学出现之前,你能得到什么样的治疗取决于你居住的地方、就诊的医院以及接诊的医生。同一个患有相同疾病的病人,在利兹和伦敦可能会接受截然不同的治疗。不同的医院,不同的国家,结果也可能大相径庭。
循证医学改变了这一切。它将临床决策与同一套证据——相同的试验、相同的系统评价、相同的指南——联系起来,为医学界赋予了共同的语言和标准。如今,在布拉德福德就诊的心肌梗死患者和在布里斯托尔就诊的心肌梗死患者,都应该接受基本相同的循证治疗。这并非因为医生水平相同,而是因为治疗方案是由证据驱动,而非个人偏好。
在英国,这是通过以下方式实现的: 尼斯指南, 皇家全科医师学会课程, QOF指标, 临床审核和 MRCGP考试 所有这些都要求并评估循证实践。参加AKT考试时,考核的就是你运用这一框架的能力。
🌍 没有循证医学的世界——国际视角
英国通过国家卫生与临床优化研究所 (NICE)、国民医疗服务体系 (NHS) 和研究生培训等途径对循证医学 (EBM) 的重视并非遍及全球。在世界许多地方,患者所能获得的医疗服务仍然很大程度上取决于接诊医生、就诊地点以及支付能力。了解这一点有助于您理解循证医学能够为患者提供哪些保护。
下面描述的变化反映了 医疗保健系统和结构问题不在于个别医生的能力或奉献精神。在每个列出的国家都有许多才华横溢、勤奋敬业的医生。问题在于缺乏循证医学所提供的标准化基础设施——指南、监督和培训框架。单凭个别医生无法克服系统性问题。
| 国家/地区 | 缺乏强有力的循证医学框架,实践会如何变化? |
|---|---|
| 🇮🇳 印度(私营部门) | 一个2018 Lancet 研究发现,私立医院的剖腹产率高达40%至58%,而公立医院仅为10%至14%——这往往是受经济利益驱动,而非临床需要。过度检查和多重用药在私立医疗机构中普遍存在。同一位癌症患者,由于就诊地点和经济能力的不同,可能接受截然不同的治疗。 |
| 🇵🇰巴基斯坦 | 抗生素使用指南的执行情况差异显著——该地区抗生素处方率位居南亚最高之列。耐药结核病和抗菌药物耐药性是其直接后果。获得专科护理和标准化治疗方案的机会高度依赖于地理位置和收入水平。 |
| 🇳🇬 尼日利亚 / 🇬🇭 加纳 | 硫酸镁是世界卫生组织推荐的、有循证医学依据且价格低廉的子痫治疗方法。研究表明,它能显著降低孕产妇死亡率。然而,在尼日利亚和加纳,硫酸镁的供应和实际使用情况因医院资源和临床医生培训水平的不同而存在巨大差异——这意味着,一名子痫妇女的生死可能取决于她最终就诊的医疗机构。 |
| 🇸🇩 苏丹 / 🇮🇶 伊拉克 | 长期冲突和动荡摧毁了医疗卫生基础设施。2003年后的伊拉克,公共卫生服务崩溃,指南实施停滞不前,基本药物的获取也受到地域限制。在苏丹,冲突扰乱了疫苗接种计划、孕产妇保健服务和慢性病管理。在这样的环境下,医疗实践的差异并非出于个人偏好,而是取决于现有资源。 |
| 🇪🇬埃及 / 🇮🇷伊朗 | 两国都拥有培养高素质医生的医学院,并发布了循证医学指南——但公立和私立医疗机构之间、城乡地区之间的执行情况并不一致。在伊朗,国际制裁影响了药品供应,迫使医疗机构做出一些与循证方案相悖的调整。 |
| 🇷🇴罗马尼亚 | 罗马尼亚一直在记录这种做法 皮库尔 (“信封”)——向医生和护士支付非正式现金以确保获得医疗服务。这种做法在官方层面是非法的,但却十分普遍。议会调查和新闻调查证实,外科手术的质量可能取决于患者的自费能力,而与其在英国国民医疗服务体系(NHS)享有的同等权利无关。自加入欧盟以来,估计已有超过14,000名医生因人才流失而离开英国。 |
| 🇺🇸美国 | 美国拥有全球最昂贵的医疗保健系统——人均每年超过12,000美元——但其医疗效果往往并不比英国好。达特茅斯地图集项目记录了临床实践中巨大的地域差异:同一位患者在迈阿密接受的检查和治疗次数可能是同一位患者在明尼阿波利斯的两倍,但治疗结果却并无差异。2019年发表在《美国医学会杂志》(JAMA)上的一项研究估计,美国每年有935亿美元——约占美国医疗保健总支出的四分之一——被浪费在不必要的医疗服务上。阿片类药物危机的部分原因是制药公司在循证医学(EBM)框架之外影响处方行为。 |
| 🇫🇷法国 | 法国拥有卓越的医疗保健体系,但其抗生素处方率历来位居欧洲最高之列,部分原因是文化上普遍认为就诊后就应该开处方。尽管开展了“抗生素并非自动使用”的宣传活动以降低处方率,但这种模式表明,即使在医疗体系完善的情况下,文化和商业压力也可能凌驾于循证医学指导之上。 |
| 🇮🇹意大利 | 意大利北部(米兰、博洛尼亚)的医疗质量位居欧洲前列。而意大利南部部分地区的情况则截然不同——癌症手术等待时间更长,筛查项目的实施不够规范,对指南的遵循度也更低。即使在同一国家内,地理位置也会对治疗结果产生显著影响。 |
| 🇬🇷 希腊 / 🇪🇸 西班牙 | 希腊的财政紧缩危机(2010-2015年)导致医疗保健支出削减超过25%,造成药品短缺、人员减少和医疗质量下降等问题。超过35,000万名医护人员移居国外。在西班牙,癌症生存率存在显著的地区差异——你所患的肿瘤在不同地区的反应可能有所不同,这并非因为肿瘤的生物学特性不同,而是因为不同地区对循证治疗的应用方式不同。 |
在缺乏健全的循证医学框架或全民医疗保障的医疗体系中,支付与治疗质量之间的关系往往是直接的,并且有据可查:
- 在印度的一些私立医院,能够支付私立医疗费用的胸痛患者可以立即接受导管介入和支架植入术。而同样的患者在公立医疗系统中可能需要等待数小时才能做心电图检查。
- 在撒哈拉以南非洲的一些地区,患有严重疟疾的儿童接受的是青蒿素类联合疗法(循证标准)还是疗效较差的旧药,取决于他们能去到哪家医疗机构以及他们的家庭能支付多少费用。
- 在没有全民药物可及性的国家,癌症化疗药物可能只有那些能够自费的人才能获得——这意味着同样的癌症,仅仅因为收入不同,治疗结果就会截然不同。
- 在罗马尼亚和其他一些东欧国家,外科手术的质量——外科医生的勤勉程度、麻醉监测的质量,甚至术后护理的可用性——已被证实取决于非正式的支付方式,而不是临床需求。
每次搭乘商业航班,您都受益于人类迄今为止建造的最有效的安全系统之一。这并非因为飞行员个人技艺超群——尽管他们的确如此。而是因为航空业的运作机制本身就围绕着这一核心展开。 标准化的、经过证据检验的方案每位飞行员、每家航空公司、每个国家都遵循相同的飞行前检查清单、相同的着陆程序和相同的紧急情况处理流程。无论您遇到哪位飞行员,这套系统都能保护您的安全。
医学若缺乏循证医学,就好比航空业没有检查清单。你的安全完全取决于你是否碰巧遇到一位优秀的飞行员,这位飞行员是否接受过足够近期的培训,他/她当天的状态如何,以及他/她是否从值得信赖的人那里了解了最新的医学观点。
循证医学用系统取代运气,用“在涉及2万患者的15,000项试验中”取代“根据我的经验”,用人类集体临床经验的积累证据取代房间里碰巧级别最高的人的意见。 您难道不希望您的病人这样吗?您的病人难道不希望他们自己也这样吗?
- 您遵循的每一项 NICE 指南都是经过系统性证据审查的成果——有人已经完成了确保您所采取的措施得到现有最佳科学依据的工作。
- AKT考试中所有关于统计学和研究方法的问题都在考察你批判性地评估证据的能力——即成为循证医学的积极使用者,而不是被动地遵循指示。
- 当你向患者解释需治疗人数 (NNT)、讨论筛查试验的局限性,或拒绝开具不必要的抗生素时,你就是在实践循证医学——有意识地、明确地、谨慎地实践。
- 当一位医药代表坐在你对面,告诉你他们的新药能将心血管事件的发生率降低35%时,你的第一个问题——“35%是相对值还是绝对值?”——正是循证医学教导医学界应该提出的问题。
研究设计与证据等级
在解读任何结果之前,你需要知道 它来自哪里不同的研究设计回答不同的问题,产生不同的统计数据,并具有不同的可靠性水平。
证据金字塔
证据最强位于顶部;证据最弱位于底部。
⬆ 最有力的证据 | ⬇ 最弱的证据
| 学习规划 | 方向性 | 最适合 | 生成 | 主要弱点 |
|---|---|---|---|---|
| 系统评价/荟萃分析 | - | 关于某个问题的最佳总体证据 | 合并效应量 | 只有基础研究的质量才能与之媲美;异质性 |
| 随机对照试验 (RCT) | 向前 | X疗法有效吗? | RR、ARR、NNT | 昂贵的人工环境,以及伦理问题 |
| 队列研究 | 向前(预期)或向后(回顾) | 暴露是否会导致某种结果?发生率如何? | 相对风险(RR)、发病率 | 损耗;长期来看成本高昂;令人困惑 |
| 病例对照研究 | 落后 | 罕见病;风险因素 | 比值比 (OR) | 回忆偏差;无法直接计算发病率 |
| 横断面研究 | 单次快照 | X 目前有多常见?(患病率) | 疾病的流行 | 无法确定因果关系;时间上存在歧义 |
| 病例报告/专家意见 | - | 假设生成;罕见事件 | 仅描述 | 极易受偏见影响;不具普遍性 |
📖 定性研究与定量研究
回答“有多少”或“多少”的问题。使用数字、统计数据和结构化数据。例如:随机对照试验、队列研究、包含数值结果的调查。生成 p 值、置信区间和需治疗人数 (NNT)。
回答“为什么”或“如何”。运用词汇、主题和访谈。例如:焦点小组、民族志研究、扎根理论。探索患者的经历和信念。
🔬 系统评价与荟萃分析——并非同一回事
系统评价: 严谨、结构化的文献检索方法,用于识别、筛选和批判性地评价所有与某一问题相关的研究。最终结果是对现有证据的定性总结。
荟萃分析: 一项更进一步的系统性综述—— 数学上的池子 将多项研究的定量结果合并成一个综合估计值。并非所有系统评价都包含荟萃分析(例如,如果研究之间的异质性过大而无法合并)。
🔄 PICO框架
PICO 是构建临床研究问题的标准框架——用于检索文献和设计研究。
| 博客 | 代表 | 例如: |
|---|---|---|
| P | 人口/患者 | 患有 2 型糖尿病的成年人 |
| I | 介入 | SGLT2抑制剂 |
| C | 对比 | 单独使用二甲双胍 |
| O | 成果 | 5 年时的心血管事件 |
🎲 RCT 设计特点(常用测试方法)
| 特性 | 这是什么意思 | 为什么重要 |
|---|---|---|
| 随机化 | 参与者随机分配到各个小组。 | 消除选择偏差;平衡混杂因素 |
| 单盲 | 参与者不知道他们的分配情况。 | 减少安慰剂效应和参与者偏差 |
| 双盲 | 参与者和研究人员均不知道分配情况。 | 消除观察者偏见和参与者偏见 |
| 三重盲法 | 参与者、研究人员和数据分析师均不知晓分组情况。 | 最大程度减少偏差 |
| 意向治疗分析(ITT) | 无论依从性如何,均在其原始组别中进行分析 | 保留随机性;反映真实世界使用情况 |
| 根据协议 | 仅对完成试验方案的受试者进行分析 | 显示出生物学功效,但高估了实际疗效。 |
| 交叉设计 | 参与者按顺序接受两种治疗。 | 每个人都作为自己的对照;需要一段洗脱期。 |
| 分配隐瞒 | 招募参与者的人员在招募完成之前无法看到下一位参与者将被分配到哪个组。 后 他们已被登记入册 | 防止招募人员在无意识中(或有意地)将更健康的患者分配到治疗组——这种选择偏差仅靠随机化无法避免。 |
| 集群随机对照试验 | 随机分组的对象是整个群体(例如全科诊所、病房、学校),而不是个体。 | 当个体随机化不切实际时(例如,测试一种新的咨询方式),可以使用这种方法。这种方法需要更大的样本量,并且需要对聚类效应进行统计调整。 |
治疗意向性分析提供了更多 保守的 疗效估计值较低——因为它包含了不依从的参与者。这是临床决策的首选分析方法。按方案分析会高估疗效,但有助于理解生物学机制。
⚖️ 优效性、非劣效性和等效性试验
并非所有试验都提出相同的问题。AKT 测试有时会检验你是否理解一项试验的真正目的——以及在解读试验结果时,这为何至关重要。
| 试用类型 | 提出的问题 | 共同背景 |
|---|---|---|
| 优效性试验 | “新疗法 比 比较器? | 大多数标准随机对照试验——测试一种真正的新药或新方法 |
| 非劣效性试验 | “新疗法 不比 与比较对象相比,差距是否超过预先设定的较小幅度? | 副作用更少、成本更低或更容易服用的新药——目标是证明它“足够好”。 |
| 等效性试验 | 这两种治疗方法 本质上相同?" | 生物类似药;仿制药;不同的给药途径 |
一种新型抗凝剂可能被证实对预防卒中“不劣于”华法林——并非更好,但也并非明显更差——而且使用更简便(无需监测INR)。即使该药物并未“胜过”华法林,这仍然是一项具有临床价值的发现。AKT可能会要求您正确解读非劣效性试验结果。
一项显示“无显著差异”的非劣效性试验是 不会 这与优效性试验中“无显著差异”的结果相同。在优效性试验中,无显著结果意味着未能证明新药疗效更佳。而在非劣效性试验中,无显著差异恰恰是你所期望的结果。
研究偏差、效度和信度
| 偏见类型 | 定义 | 哪些研究设计? | 如何减少它 |
|---|---|---|---|
| 选择偏差 | 参与者不代表目标人群 | 所有类型 | 随机化;谨慎抽样 |
| 回忆偏差 | 病例组(患病者)比对照组更能清晰地回忆起过去的接触史。 | 病例对照研究 | 客观数据来源;标准化问卷 |
| 发表偏倚 | 阳性/显著性研究的发表频率高于阴性研究。 | 荟萃分析(通过漏斗图检测) | 试验注册;灰色文献检索 |
| 磨损偏差 | 参与者失访会扭曲结果(退出研究者与完成研究者存在差异) | 队列研究、随机对照试验 | 意向性治疗分析;最大限度减少脱落 |
| 交货期偏差 | 筛查会给人一种错觉,即通过更早地发现疾病来提高生存率。 | 筛查研究 | 使用疾病特异性死亡率,而不是诊断后的生存率。 |
| 长度偏差 | 筛查可以发现更多生长缓慢(侵袭性较低)的疾病。 | 筛查研究 | 具有疾病特异性结局的随机对照试验 |
| 观察者/评估偏差 | 了解治疗分配情况会影响结果评估 | 随机对照试验 | 盲法(单盲、双盲、三盲) |
| 霍桑效应 | 参与者会改变自己的行为,因为他们知道自己正被观察。 | 所有类型,尤其是观察型 | 对照组;盲法观察者 |
| 验证偏差 | 只有检测结果呈阳性的患者才会接受金标准确诊检测——因此,灵敏度看起来偏高,特异性看起来偏低。 | 诊断测试研究 | 确保所有患者(无论结果呈阳性还是阴性)都接受金标准检测。 |
| 混淆 | 第三个变量与暴露和结果均相关,从而扭曲了表面上的关系。 | 观察性研究 | 随机化(RCT);分层;多变量分析 |
🔀令人困惑——当两件事看起来有关联但实际上没有关联时
混杂因素是研究方法论中最重要的概念之一,也是看似令人信服的观察性研究结果最终被证明是错误的最常见原因之一。其核心思想很简单: 两件事看起来似乎有联系,并不是因为它们直接相互影响,而是因为它们都与一个隐藏的第三个变量有关。
A 混杂因素 (或混杂变量)是与以下因素独立相关的第三个变量: 都 暴露 和 结果。它会在你所研究的暴露因素和结果之间建立虚假的(错误的)关联,或者掩盖真实的关联。
经典示例
| 明显联系 | 混杂因素 | 它解释了一切 |
|---|---|---|
| 冰淇淋销量→溺水死亡人数 | 炎热天气(夏季) | 天气炎热会导致人们吃更多冰淇淋,也会导致更多人游泳,从而增加溺水事故的发生。冰淇淋本身并不会导致溺水。 |
| 喝咖啡→肺癌 | 吸烟 | 吸烟者平均喝更多咖啡。早期研究曾将咖啡与癌症联系起来——直到控制了吸烟因素后,这种联系才消失。 |
| 携带打火机→肺癌 | 吸烟 | 吸烟者随身携带打火机。打火机本身没有生物学效应——吸烟才有。 |
| 白发→心脏病 | 车龄 | 白发和心脏病都会随着年龄增长而增加。年龄才是真正的混杂因素,而不是头发颜色。 |
| 鞋码→阅读能力(儿童) | 车龄 | 年龄较大的孩子脚也更大,而且阅读能力也更强。年龄可以解释这两点。 |
如果一个变量满足以下条件,则该变量是混杂因素: 三个全部 其中:
- 它与 暴露 (你正在学习的东西)
- 它与 结果 (你所测量的结果)
- 这是 不会 在暴露与结果之间的因果路径上(这是一个独立的第三个变量,而不是中间步骤)
- 随机化 (在随机对照试验中)——将已知和未知的混杂因素在各组之间平均分配。这是最有效的保护措施。
- 限制 — 只招募在混杂因素方面相似的参与者(例如,咖啡研究中只招募非吸烟者)
- 匹配 — 针对混杂变量的配对病例和对照
- 分层 — 分别分析每个混杂因素水平的结果
- 多变量统计调整 — 同时从统计学角度考虑多个混杂因素
在设计良好的随机对照试验中,随机化会将混杂因素(包括已知和未知的)在各组之间平均分配,从而消除混杂因素对差异的解释作用。而在队列研究和病例对照研究中,你只能调整已知且已测量的混杂因素。未测量的混杂因素始终是任何观察到的关联的潜在解释——这就是为什么观察性研究永远无法最终证明因果关系的原因。
✅ 有效性和可靠性——二者有何区别?
这项研究是否测量了其声称要测量的指标?研究结果是否准确? Free Introduction 研究可信吗?存在偏见和混淆因素的威胁。
研究结果能否应用于其他人群或真实世界环境?在专科中心开展的严格控制的随机对照试验可能无法反映基层医疗的实际情况。
在相同条件下重复测试是否能得出一致的结果?可通过评分者间信度(kappa统计量)或重测信度来衡量。
衡量两位评分者之间超出偶然一致性的程度。κ = 1(完全一致);κ = 0(一致性与偶然一致无异);κ < 0(一致性低于偶然一致)。
风险与治疗效果的评估
这是 测试最密集区域 在 AKT 统计学中,你需要熟记这些公式,并能够在考试条件下将它们应用于试验数据表。
关键指标
📊 NNT解读——这些数字究竟意味着什么?
NNT(需治疗人数)告诉你需要治疗多少患者。 一种 为了受益。所以 少 治疗所需患者数量越多,疗效就越好。NNT = 2 表示每 2 名患者中就有 1 名获益——这非常好。NNT = 100 表示每 100 名患者中只有 1 名获益——效果差得多。
| NNT范围 | 粗略解读 | 示例上下文 |
|---|---|---|
| <10 | 非常有效 | 用于治疗某些感染的抗生素;一些急性治疗 |
| 10 - 50 | 效果中等 | 许多常见的预防性药物 |
| > 100 | 效果较弱 | 一些人群层面的预防策略 |
这些阈值是 不会 来自 NICE 或 RCGP 的数据——它们只是粗略的教学辅助工具。“正确”的 NNT 值始终取决于具体情况:
- 一个 NNT 100或许仍然值得 如果避免的结果是死亡或严重的不可逆转的伤害
- 一个 NNT 5可能不可接受 如果治疗出现频繁或严重的副作用
一行规则: NNT(需治疗人数)是指治疗多少患者才能使一名患者获益——NNT越低,疗效越好。但务必权衡其与疾病后果的严重程度和治疗负担。
如果 100 名患者中有 60 名获益,则绝对风险降低率 (ARR) 为 60% (= 0.6),因此需治疗人数 (NNT) ≈ 1 ÷ 0.6 1.7 ——这是一个非常好的结果。NNT(需治疗人数)指的不是受益人数,而是治疗所需人数。 一种 效益。
📖 比值比和风险比——何时使用?
| 测量 | 用在 | 解释 |
|---|---|---|
| 相对风险 (RR) | 队列研究、随机对照试验 | 直接比较两组人群的风险。比OR值更直观。 |
| 比值比 (OR) | 病例对照研究 | 比较病例组和对照组的暴露几率。当疾病罕见时,可近似计算相对风险度(RR)。 |
| 风险比 (HR) | 生存分析(事件发生时间) | 类似于 RR,但占比为 ,尤其是 事件会随时间推移而发生。HR<1表示治疗组风险降低。 |
对于常见疾病,与相对风险(RR)相比,优势比(OR)会高估风险。对于罕见疾病(患病率<10%),两者大致相等。病例对照研究会得出优势比(OR)——您 不能 直接从病例对照研究中计算发病率或相对风险。
🧮 实例分析——根据试验数据计算 NNT
🎯 情景:他汀类药物试验
一项为期 5 年的随机对照试验表明,在心血管高风险患者中:安慰剂组有 6% 的人发生心脏病发作,而他汀类药物组有 4% 的人发生心脏病发作。
治疗 50 名患者 5 年,可预防 1 例心脏病发作
听起来很棒!但实际收益只有2%。
他汀类药物组的风险是安慰剂组的 67%,相对降低了 33%。
当患者问“这种他汀类药物对我有帮助吗?”时,请使用NNT(需治疗人数)。“如果50个像您一样的人服用这种药片5年,就能预防1例心脏病发作。对您个人而言,绝对获益率为2%。”这比“它可以降低您33%的风险”要诚实得多。
💬 与患者沟通风险(AKT 推荐)
AKT测试通常考察你如何向患者解释统计信息。主要有四种形式:
| 格式 | 例如: | 最适合 |
|---|---|---|
| 固有频率 | 每100人中有5人 | 最便于患者理解 |
| 百分比 | “5%的人” | 广泛使用但可能具有误导性 |
| NNT | “治疗20例,预防1例事件” | 清晰传达绝对益处 |
| 猫图 | 100张脸的视觉网格 | 最佳的共同决策可视化辅助工具 |
如果不说明基线风险,就说“这能降低33%的风险”是误导性的。基线风险为0.3%,33%的相对风险降低(RRR)意味着您的绝对获益为0.1%。务必将RRR与基线风险结合起来,或者改用绝对风险降低(ARR)/需治疗人数(NNT)。
💊 医药代表的伎俩——制药公司如何操纵统计数据
制药公司代表接受过专门训练,懂得如何以最有利的方式呈现试验数据。他们使用了一种简单但有效的统计技巧:
- 收益 → 以相对风险降低率 (RRR) 表示 因为它听起来更宏大、更令人印象深刻。
- 危害 → 以绝对风险增加 (ARI) 表示 ——因为它听起来规模较小,也不太令人担忧。
示例——虚构的他汀类药物销售代表拜访
一种新的他汀类药物在 5 年内将心脏病发作率从 2% 降低到 1%,但将肌病发生率从 1% 增加到 2%。
| 代表说的话 | 它的实际含义 |
|---|---|
| 这种药物通过以下方式降低心脏病发作率 50%" | 风险回报率 (RRR) 为 50%,但平均收益率 (ARR) 仅为 1%. NNT = 100。治疗 100 人 5 年可预防 1 例心脏病发作。 |
| 肌病风险仅增加 1%" | ARI = 1% — 但实际上这是 加倍 肌病风险(相对风险增加 = 100%)。 |
解药: 总是要问—— “绝对区别是什么?” 当销售代表提供相对数字时,请自行换算:ARR = CER − EER,然后 NNT = 1 ÷ ARR。这同样适用于福利。 和 害。
诊断检测与筛查——2×2 表格
2×2列联表是所有诊断统计的基础。如果您能够构建和解读此表,就能回答大多数AKT诊断问题。
2×2 表
| 实际疾病状况 | ||
|---|---|---|
| 测试结果 | 疾病 演讲与演出 | 疾病 没有 |
| 检测结果呈阳性 | 真阳性 (TP) 检测结果为“是”→患有疾病✓ |
误报 (FP) 检测结果为“是”→ 无疾病 ✗ |
| 检测结果为阴性 | 假阴性 (FN) 检测结果为阴性 → 患有疾病 ✗ |
真阴性 (TN) 检测结果为“否”→ 无疾病 ✓ |
🧠 SnNout & SpPin — 记忆辅助工具(以及它们为何有效)
Sn出局:一个高度 Sen检测结果呈阳性,如果 N阴性结果,排除疾病可能 输出.
如果检测灵敏度非常高,阴性结果意味着患病的可能性极低(假阴性率低)。使用灵敏度高的检测方法进行筛查和排除。
Sp在:一个高度 Sp特定测试,如果 P阳性,决定疾病 In.
如果特异性非常高,阳性检测结果意味着患病的可能性非常大(假阳性率低)。使用特异性检测来确诊。
📊 患病率对阳性预测值和阴性预测值的影响——AKT 的关键主题
这是诊断统计学中最重要、也最常被检验的概念之一。灵敏度和特异性是检测的固定属性。但阳性预测值(PPV)和阴性预测值(NPV)会随着受检人群中疾病的流行程度而发生显著变化。
| EventXtra XNUMX大解决方案 | 疾病的流行 | PPV的 | NPV |
|---|---|---|---|
| 对普通人群进行罕见病筛查(例如,对低风险人群进行艾滋病毒筛查) | 1% | 低(约16%) | 高(约99.9%) |
| 在一家高风险专科诊所进行测试 | 50% | 高(约95%) | 高(约95%) |
- 随着患病率上升→阳性预测值上升,阴性预测值下降
- 患病率下降→阳性预测值下降,阴性预测值上升
- 在低患病率人群中,即使使用特异性很高的检测方法,大多数阳性结果也是假阳性(阳性预测值低)。
- 在高患病率人群中,阴性检测结果仍可能漏诊(阴性预测值较低)。
📐 似然比 — 当你想更进一步时
似然比 (LR) 将灵敏度和特异性结合成一个单一数值,用于衡量检测结果对疾病概率的影响程度。它比阳性预测值/阴性预测值 (PPV/NPV) 更高级,但仍然很有用——并且偶尔会在 AKT 检测中进行应用。
| LR+ | 对后测概率的影响 |
|---|---|
| > 10 | 概率大幅且往往具有决定性意义的增长 |
| 5-10 | 适度增加 |
| 2-5 | 小幅增长 |
| 1 | 没有变化(测试无效) |
| 0.1-0.5 | 小幅至中度下降 |
| <0.1 | 大幅下降——强烈否定排除 |
人口统计与流行病学
📊 标准化死亡率 (SMR)
| SMR值 | 解释 |
|---|---|
| = 100 | 死亡率与参考人群相同 |
| > 100 | 超额死亡率(高于预期) |
| <100 | 死亡率低于预期 |
🎯 筛选 — 提前期和长度偏差(AKT 关键陷阱)
筛查能更早地发现疾病,使人误以为生存期有所延长——即使患者最终还是会在同一时间死亡。“从确诊到死亡的生存时间”仅仅是因为早期发现而延长,而非实际治疗获益。患者并没有活得更久,只是知道病情的时间更长了。
筛查项目更有可能发现进展缓慢、隐匿性疾病(这类疾病的“可检测临床前期”较长),而不是进展迅速的侵袭性疾病。这使得筛查在重症疾病的检测中看起来比实际情况更有效。
✅ Wilson & Jungner 筛选标准
在引入筛查方案之前,它应该符合威尔逊和荣格纳标准(最初发表于1968年,至今仍是标准框架)。AKT测试旨在检验受试者对这些标准的了解程度以及将其应用于具体情境的能力。
| # | 标准 | 实际意义 |
|---|---|---|
| 1 | 重要的健康问题 | 这种疾病具有较高的发病率或死亡率——值得进行筛查。 |
| 2 | 可接受的治疗方法 | 检测出无法治疗的疾病毫无意义。 |
| 3 | 具备诊断和治疗设施 | 基础设施必须在启动前到位。 |
| 4 | 可识别的潜伏期或早期阶段 | 该疾病必须具有可检测的无症状期。 |
| 5 | 可提供合适的测试 | 检测方法必须为大众所接受、安全且具有合理的准确性。 |
| 6 | 人群可接受的测试 | 人们必须愿意接受检查——侵入性或令人不适的检查可能会降低参与意愿。 |
| 7 | 对自然史的充分理解 | 必须了解如果不治疗,这种疾病会如何发展。 |
| 8 | 已就治疗对象达成一致的政策 | 需要明确的流程——不仅要考虑检测结果,还要考虑后续步骤。 |
| 9 | 经济高效 | 发现每个案例的成本必须与收益进行权衡。 |
| 10 | 连续过程,而非一次性过程 | 筛查必须持续进行——疾病发病率仍在上升。 |
前列腺癌PSA筛查是 不会 之所以将其纳入英国国家医疗服务体系(NHS)的国家筛查计划,正是因为它难以满足第5项和第7项标准:PSA检测的准确性不足(特异性低→假阳性率高),而且许多低级别前列腺癌的自然病程意味着它们在患者一生中都不会引起任何症状。这直接导致了过度诊断(见下文)。
🔍过度诊断——发现那些原本不会造成问题的问题
过度诊断是指检测到一种真正的疾病——一种确实存在的疾病——但这种疾病实际上并不会造成严重后果。 从未引起任何症状、伤害或死亡 如果未被发现,患者一生中都可能罹患此病。这不是假阳性(该疾病确实存在);而是真阳性,只是原本无需被发现。
过度诊断会将健康人变成病人。它使他们承受焦虑、副作用和治疗风险,而这些疾病原本根本不会对他们造成伤害。这是筛查项目最严重的危害之一,也是AKT检测直接针对的危害之一。
| Condition | 过度诊断示例 |
|---|---|
| 前列腺癌 | 许多通过PSA检测出的低级别癌症永远不会发展或引起症状——男性因此死亡 - 他们,不是 ,来自 他们 |
| 甲状腺癌 | 超声波检查可以发现微小的乳头状甲状腺癌,这些癌症几乎都是惰性的——检出率大幅提高,但死亡率却没有改变。 |
| 导管原位癌(乳腺) | 通过乳房X光检查发现的导管原位癌——有些永远不会发展成浸润性癌。 |
过度诊断 = 发现了一种原本不需要发现的疾病。 过度治疗 = 治疗原本无需治疗的疾病(这可能是过度诊断的结果,也可能独立发生)。它们是相关但不同的概念。
🔢 年龄标准化
在比较不同人群(例如不同国家、不同时期)的疾病发病率或死亡率时,需要考虑这些人群的年龄分布可能存在差异。即使健康状况相同,老年人群的死亡率自然也会更高。
年龄标准化是一种统计技术,用于消除不同年龄分布对比较不同人群健康结果造成的扭曲影响。它得出的结果是,如果两个人群具有相同的年龄结构(“标准人群”),则应观察到的比率。
🎗️癌症统计数据——AKT 必知知识
AKT偶尔会测试一些特定的癌症统计数据。您无需具备全面的肿瘤学知识——但这些关键数据经常出现,值得了解。
| 癌症预防 | 关键统计数据 | 为什么重要 |
|---|---|---|
| 睾丸癌 | 10年生存率>98% | 最容易治疗的癌症之一——了解这一点对辅导年轻男性很重要 |
| 肺癌 | 英国癌症死亡的主要原因 | 尽管它不是最常见的癌症,但它造成的死亡人数却比其他任何癌症都多。 |
癌症可能具有很高的致病性。 发病率 (常见)但低 死亡 有些癌症是可以治疗的,例如乳腺癌。有些癌症发病率较低,但死亡率却很高,例如胰腺癌。AKT测试可能会考察您正确解读癌症统计数据的能力——不要想当然地认为最常见的癌症就是最致命的。
⚖️ 健康不平等
健康不平等指的是不同人群之间在健康方面存在的不公平且可避免的差异。它们是英国公共卫生政策的重要关注点,并在《健康知识体系》(AKT)中作为流行病学和社会健康决定因素的组成部分出现。
健康不平等是 不同人群之间健康状况或健康决定因素分布方面存在不公平且可避免的差异它们是“可避免的”,因为它们源于社会、经济或环境条件,而这些条件原则上是可以改变的——而不是源于随机机会或生物变异。
| 类型 | 英国的例子 |
|---|---|
| 社会经济 | 贫困地区预期寿命较低;较贫困社区心血管疾病、糖尿病和精神疾病发病率较高 |
| 地理 | “南北差距”——英格兰北部部分地区的健康状况比南部地区差。 |
| 民族 | 南亚裔人群中2型糖尿病发病率较高;黑人人群中心血管疾病风险较高 |
| 性别 | 男性预期寿命较短,但女性患病年限(发病率)更长。 |
数据分布与统计显著性
中央倾向的措施
| 测量 | 定义 | 最佳使用时间 | 小心 |
|---|---|---|---|
| 平均值 | 所有数值之和 ÷ 数值个数 | 数据呈正态分布 | 容易受到异常值的影响 |
| 中位数 | 按顺序排序后的中间值。如果存在 偶数 对于若干数值,中位数是中间两个数值的平均值。 | 数据存在偏差(例如收入、住院时长) | 忽略极端值。 |
| 时尚 | 最常出现的值 | 分类数据;双峰分布 | 对于连续数据而言,这可能毫无意义。 |
| 范围 | 最大值 - 最小值 | 快速感知传播 | 完全由异常值决定 |
| IQR(四分位距) | 第 75 百分位数 - 第 25 百分位数 | 与中位数配对用于偏态数据 | 忽略上下 25% |
| 标准偏差 (SD) | 与均值的平均偏差 | 正态分布的数据 | 如果数据不服从正态分布,则会产生误导。 |
数据类型——名义数据、顺序数据、区间数据、比率数据
了解什么 类型 你拥有的数据决定了哪些汇总统计量和统计检验是合适的。AKT 测试正是检验这一点——通常是通过呈现一个数据集并询问应该使用哪种检验或指标。
| 类型 | 定义 | 例子 | 比喻 |
|---|---|---|---|
| 公称 | 无自然顺序的类别 | 血型(A、B、AB、O);性别;眼睛颜色;死因 | 一盘水果——苹果和香蕉只是不同而已,没有哪个“更多”可言。 |
| 序数 | 类别有序,但它们之间的差距是 不会 必然相等 | 纽约心脏协会(NYHA)心力衰竭分级(I-IV级);疼痛程度(轻度/中度/重度);李克特量表 | 比赛名次——第一名、第二名、第三名。我们知道顺序,但第一名和第二名之间的差距可能与第二名和第三名之间的差距大相径庭。 |
| 间隔 | 按数值间距相等排序,但是 没有真正的零 | 温度(摄氏度);日历日期;智商分数 | 温度计——0°C 并不意味着“没有温度”。你也不能绝对地说 20°C 是 10°C 的“两倍”。 |
| 长宽比 | 有序、相等的间隙,以及 真正的绝对零度 | 身高、体重、血压、年龄、收入、药物剂量 | 金钱——0 英镑表示你真的身无分文。40 英镑是 20 英镑的两倍。 |
- 名义/顺序数据 → 使用非参数检验,或用众数或中位数表示平均值
- 区间/比率数据 (正态分布)→ 可以使用均值、标准差、参数检验
- 您 无法有意义地计算平均值 对于名义数据(例如,“平均血型”是无意义的),或者对于区间数据,不能做出比例陈述(你不能说智商为 120 的人比智商为 60 的人“聪明两倍”)。
🔬 参数检验与非参数检验
统计检验根据其对数据的假设分为两大类。AKT 检验旨在判断哪种检验方法适用于特定情况——您无需进行计算,只需知道何时使用哪种方法即可。
参数测试 假设数据呈正态分布(或者样本足够大,以至于这一点无关紧要),并且数据至少是区间尺度的。 非参数检验 不要做这样的假设——它们适用于等级或类别,并且适用于偏斜数据、小样本或有序/名义数据。
| 目的 | 参数测试 | 非参数等价 |
|---|---|---|
| 比较两个独立组的均值 | 独立t检验 | 曼惠特尼 U 检验 |
| 比较方法:同一组,2个时间点 | 配对 t 检验 | Wilcoxon 符号秩检验 |
| 比较 3 个或更多组的平均值 | 方差分析(方差分析) | Kruskal-Wallis 检验 |
| 两个连续变量之间的相关性 | 皮尔逊相关 | 斯皮尔曼等级相关 |
| 比较比例/分类数据 | - | 卡方检验(χ²) |
- 数据是 偏斜 or 非正态分布 → 使用非参数方法
- 小样本 (且正态性不确定)→ 使用非参数方法
- 数据是 序数 (例如疼痛评分、李克特量表)→ 使用非参数方法
- 比较 比例或类别 → 卡方检验
- 大样本、连续型、近似正态分布 → 参数检验适用
🔔 正态分布——68-95-99.7 法则
正态分布是一种对称的钟形曲线。均值、中位数和众数都相等,并且位于曲线的中心。
| 范围 | 包含值的百分比 |
|---|---|
| 平均值±1个标准差 | 68% |
| 平均值±2个标准差 | 95% |
| 平均值±3个标准差 | 99.7% |
对于正偏态数据(例如收入、全科医生候诊时间、病房血清胆红素水平),少数高异常值会将均值向右拉。在这种情况下,应使用…… 中位数 ——它更能代表典型值。AKT 很喜欢检验这种区别。
📉 P 值和置信区间——它们的真正含义
P值
p 值是指观察到至少与已观察到的结果一样极端的结果的概率。 如果原假设成立 (即,如果没有实际效果)。 不会 零假设成立的概率。
| p-值 | 解释 |
|---|---|
| p <0.05 | 具有统计学意义——该结果偶然发生的概率小于5%。 |
| p> 0.05 | 统计学意义不显著——结果可能由偶然因素造成。 |
| p = 0.01 | 如果没有实际效果,出现此结果的概率为 1%。 |
置信区间 (CI)
95% 置信区间意味着:如果你重复这项研究 100 次,那么在其中 95 次中,真实的总体值将落入此范围内。
- 对于 比 (RR、OR、HR):如果 95% 置信区间包含 1.0 → 不具有统计学意义
- 对于 差异 (平均差值,ARR):如果 95% 置信区间包含 0 → 不具有统计学意义
- 如果置信区间完全大于 1(对于比率而言)→ 风险显著增加
- 如果置信区间完全低于 1(对于比率而言)→ 风险显著降低
❌ 第一类错误和第二类错误——狼来了 vs 错过狼来了
当零假设实际上为真时,却拒绝了它。换句话说:当某种疗法无效时,却得出它有效的结论。假阳性率。通常可接受的假阳性率为 5%(α = 0.05,p < 0.05)。
“狼来了”——在没有狼的时候发出警报。
当原假设实际上为假时,未能拒绝原假设。换句话说:漏诊了真实的治疗效果。假阴性率。通常可接受的假阴性率为 20%(β = 0.2,功效 = 80%)。
“漏掉了狼”——明明有狼却说没有。
功效 = 1 − β。它是正确检测到真实效应的概率。功效越高,漏检真实效应的可能性就越小。功效随样本量的增大而增加。一项设计良好的试验需要≥80%的功效。
⚡统计学意义≠临床意义
这是 AKT 统计中最重要、最常被检验的细微差别之一,也是许多受训者容易忽略的一点。
结果可能是 具有统计意义 (p < 0.05) 临床上无意义统计显著性只能告诉你结果不太可能是偶然因素造成的——它表明 没什么 关于这种影响是否足够大,以至于在实践中产生影响。
| EventXtra XNUMX大解决方案 | 具有统计学意义吗? | 临床上重要吗? |
|---|---|---|
| 血压下降1 mmHg,n=50,000,p=0.001 | 是 | 没有 |
| 血压下降15 mmHg,n=30,p=0.08 | 没有 | 可能是 |
| 血压下降12 mmHg,n=500,p=0.02 | 是 | 是 |
总是看看 规模效应 (ARR、NNT、平均差值)以及 p 值和置信区间。一个不包含 0 或 1 的窄置信区间比单独的 p 值更有意义——它既能告诉你效应的方向,又能告诉你效应的精确度。
- 窄置信区间 → 精确估计 → 高度确信真实值接近点估计值(通常来自大样本)
- 宽置信区间 → 不确定的估计 → 真实值可能在一个很宽的范围内(通常来自小样本或异质样本)
例如:RR = 1.5 (95% CI 1.4–1.6) → 精确、令人信服。RR = 1.5 (95% CI 0.6–3.8) → 范围宽泛、不确定——并且跨越 1.0,因此甚至不具有统计学意义。
📈 均值回归——临床实践中隐藏的混杂因素
均值回归是指极端测量值在第二次测量时更接近平均值的统计趋势—— 无论任何干预措施它是医学领域最容易被忽视的误导性结论来源之一。
患者往往在症状或各项指标最严重的时候接受检查或治疗。自然波动意味着这些指标在复测时很可能会改善——这未必是干预的结果。如果没有对照组,就无法区分均值回归和真正的治疗效果。
| EventXtra XNUMX大解决方案 | 治疗效果的迹象 | 究竟发生了什么 |
|---|---|---|
| 患者一次血压测量结果非常高 → 开始服药治疗 → 下次就诊时血压下降 | 药物有效 | 第一次测量结果可能是一个异常值;无论如何,重复测量血压值都会降低。 |
| 学生考试成绩很差 → 接受额外辅导 → 下次考试成绩更好 | 学费资助 | 低分可能不具代表性;实际表现往往接近平均水平。 |
| 一位湿疹严重发作的患者开始使用一种新的药膏→病情有所改善 | 乳膏有效 | 无论是否接受治疗,严重的病情发作都会随着时间的推移自然好转。 |
- 采取 多次基线测量 并在开始治疗前使用平均值
- 使用 控制组 — 均值回归对两组的影响相同,因此组间任何差异都更可能是真实的治疗效果。
- 这是最有力的论据之一 随机对照试验优于非对照前后研究
统计图表——需要关注哪些方面
AKT考试中会定期展示图表并要求你进行解读。学会识别每种图表类型中的关键特征——不要试图解读所有内容。只需关注一个有针对性的观察结果即可。
| 图形类型 | 主要用途 | 需要注意的一件事 |
|---|---|---|
| 森林图 | 荟萃分析结果 | 是否 钻石 越过无影响垂直线? |
| 漏斗图 | 发表偏倚检测/全科医生异常值监测 | 剧情是这样的吗? 不对称的(缺口 = 未发表的研究缺失) |
| 凯茨图 | 以可视化的方式向患者传达 NNT(需治疗人数) | 统计彩色“受益”人脸的数量;NNT = 100 ÷ 这些人脸 |
| 拉贝阴谋 | 探索荟萃分析中的异质性 | 对角线上的点 = 零治疗效应 |
| 箱线图 | 数据分布和传播 | 中线 = 中位数 (并非平均值);须线以外的点 = 异常值 |
| 费根列线图 | 测试前概率 → 测试后概率 | 从测试前概率通过 LR 画一条线,即可读出测试后概率 |
| 茎叶图 | 发行——保留原值 | 类似于直方图,但显示的是单个数据点 |
| Kaplan-Meier曲线 | 生存分析——事件发生时间 | 事件发生时,曲线下降;早期发散且持续分离的曲线表明治疗效果持续存在。 |
| 直方图 | 连续数据的分布 | 曲线形状:对称 = 正态分布;偏态 = 使用中位数而非均值 |
🌲 森林地块——详解
- 每个方格 = 一项研究。方格的大小代表该研究的权重(通常取决于样本量)。
- 水平线 = 该研究的 95% 置信区间
- 钻石 底部为汇总的总体估计值。其宽度为汇总的 95% 置信区间。
- 1.0处的垂直线 = “无效应线”(用于比率)。如果是 CI 线或菱形 越过这条线结果是 无统计学意义
I² 衡量研究间差异有多少是由于真正的异质性(真实差异)而非偶然因素造成的。
I² < 25% = 低异质性 ✓
I² = 25–50% = 中等异质性
I²> 50% = 存在显著异质性——合并结果可靠性较低⚠️
📯 漏斗图 — 发表偏倚与全科医生异常值监测
漏斗图在 AKT 中以两种完全不同的形式出现——请务必识别这两种形式。
以效应量(x轴)为纵坐标,以研究精度或样本量(y轴)为横坐标绘制图表。对称的倒漏斗图表示无偏倚。左下角有缺口的非对称漏斗图表示遗漏了样本量较小的阴性研究,从而导致发表偏倚。
根据指标(例如转诊率、死亡率)对全科诊所进行比较。漏斗线之外的数据点是 统计异常值 需要进行调查——但这并不一定能证明表现不佳。
😊 Cates 图——如何以可视化的方式提取 NNT
Cates 图(有时称为“笑脸图”)使用 100 个笑脸组成的网格来帮助患者直观地了解绝对的益处和危害。
- 这100张面孔分别代表每100名接受治疗的人中的一人。
- 黄/绿色脸 = 受益者(事件得以避免)
- 红脸 遭受伤害的人
- 灰色/素色面孔 两种方式都没有影响
📉 Kaplan-Meier生存曲线——如何解读它们
Kaplan-Meier (KM) 曲线显示了随时间推移的生存概率(或无事件生存概率)。它们出现在 AKT 问卷中,例如关于癌症试验、心血管研究以及任何追踪事件发生时间的研究。
| 特性 | 这是什么意思 |
|---|---|
| Y 轴 | 生存概率(或无事件生存概率)——初始值为 1.0 (100%),并随时间推移而下降。 |
| X 轴 | 时间(天、月、年) |
| 每一步向下走 | 事件已发生(例如死亡、复发)。步长越大,该点发生的事件就越多。 |
| 线上的刻度线 | 被排除的患者——失访或研究结束。不是事件。 |
| 两条曲线早期即分叉,并保持分离状态。 | 表明治疗效果在整个随访期间持续存在 |
| 弯道交叉 | 这表明风险并非随时间成正比——这使得结果难以解释。 |
| 中位生存期 | 生存曲线与 50% 相交的时间点——即一半患者发生该事件的时间点。 |
此 对数秩检验 对两条KM曲线进行统计学比较。 风险比(HR) 总结了曲线之间的总体差异。HR < 1 表示治疗组随时间推移事件发生率较低。如果曲线明显重叠,则 HR 将接近 1(无获益)。
📊 直方图——分布概览
直方图通过将数值分组到不同的区间(箱)中,并显示每个区间内的观测值数量,来展示连续变量(例如年龄、血压、BMI)的分布情况。与条形图不同,直方图中的条形是相接的——因为数据是连续的。
| 形状 | 意 | 使用均值还是中位数? |
|---|---|---|
| 对称的钟形 | 正态分布——均值、中位数和众数均相等。 | 两者皆可——但通常表示平均值±标准差 |
| 右偏(正偏) | 右侧长尾——少数极高值拉高了平均值 | 中位数(更具代表性) |
| 左偏(负偏) | 左侧长尾——少数极低值拉低了均值 | 中位数(更具代表性) |
| 双峰(两个峰) | 数据中存在两个截然不同的亚组。 | 分别报告两个峰值。 |
质量改进与临床审核
| 工具 | 目的 | 主要功能 |
|---|---|---|
| 临床审核 | 对照明确的标准衡量实践;找出并弥合差距。 | 需要制定标准。采用PDSA循环。包含闭环(重新审核)。 不 研究——没有假设,就没有新知识产生。 |
| 重大事件分析(SEA) | 对单一重大事件进行系统的多学科审查 | 不追究责任。注重系统学习,而非个人过错。团队内部共享。记录学习过程和行动。 |
| 根本原因分析 (RCA) | 对重大事件进行深入调查 | 比战略环境分析 (SEA) 更结构化。采用“5个为什么”分析法。识别促成因素和根本原因。通常用于预防重大事故或造成严重伤害。 |
| QOF异常报告 | 将患者适当排除在QOF指标之外 | 临床适用情况:最大耐受剂量、知情患者反对、极度虚弱或临床禁忌症。 |
🔄 临床审核与研究——主要区别
| 特性 | 临床审核 | 研究 |
|---|---|---|
| 目的 | 通过与标准进行比较来改进护理。 | 产生新知识 |
| 假说 | 无——与现有标准进行比较 | 总是有一个假设 |
| 道德批准 | 通常不需要 | 通常需要 |
| 许可 | 通常不需要 | 通常需要 |
| 随机化 | 沒有時效 | 可能包括随机对照试验 |
| 最终结果 | 服务改进;行动计划 | 新证据;出版物 |
🔁 PDSA循环
计划-执行-检查-改进(PDSA)循环是临床审核和质量改进中使用的持续改进框架。
| 阶段 | 怎么了 |
|---|---|
| 租赁计划 | 明确问题,设定标准,规划数据收集 |
| Do | 实施变更或评估当前做法 |
| 学习领域 | 分析结果;与标准进行比较;找出差距 |
| 行动 | 实施改进措施;计划重新审计以形成闭环。 |
临床计算(AKT公式库)
这些公式经常出现在 AKT 计算题中。务必记住每个公式,并了解触发相应临床事件的临界值。
🧮 ABPI 工作示例
🎯 情景:72岁的T女士,行走时腿部疼痛
🍷 酒精单位示例
| 饮品 | 体积(毫升) | 酒精浓度% | 计算 | 单位 |
|---|---|---|---|---|
| 一大杯葡萄酒 | 250ml | 13% | 250 × 13 ÷ 1000 | 3.25 |
| 一瓶酒 | 750ml | 12% | 750 × 12 ÷ 1000 | 9.0 |
| 品脱拉格啤酒(烈性) | 568ml | 5% | 568 × 5 ÷ 1000 | 2.84 |
| 单份烈酒 | 25ml | 40% | 25 × 40 ÷ 1000 | 1.0 |
工作实例
🎯 示例 1:根据试验表计算所有风险指标
一项随机对照试验将患者随机分配到药物 X 组或安慰剂组。3 年后:500 名安慰剂组患者中有 80 人发生中风;500 名药物 X 组患者中有 40 人发生中风。
🎯 示例 2:构建 2×2 列联表并计算灵敏度和特异度
一项新的检测方法应用于200名患者,其中100名患有该疾病。该检测方法正确识别出100名患病患者中的85名,并正确识别出100名健康患者中的80名。
🎯 示例 3:儿童剂量计算
一名儿童需要服用300毫克阿莫西林。现有阿莫西林混悬液的规格为250毫克/5毫升。应该服用多少毫升?
公式速查表和记忆辅助工具
风险与治疗方案
诊断测试
人口与临床公式
- SnNout: 敏感测试——阴性结果可排除疾病(筛查)
- SpPin: 特异性检测——阳性结果可确诊该疾病(确诊)
- CI 跨越 1.0 (比率)或 0 (差异)→不显著
- 森林地块菱形交叉线 → 不显著
- 漏斗不对称 → 发表偏倚(或全科医生异常值,如果是在绩效背景下)
- 箱线图中线 → 中位数(不是平均值)
- 68-95-99.7 → 正态分布中的 ±1SD、±2SD、±3SD
- I² >50% → 显著异质性
- 或来自病例对照研究 | 来自队列的RR | 横断面调查的患病率
- 审计 ≠ 研究 (审计措施与标准对比;研究产生新知识)
- 病例对照 → 或(优势比)——回顾既往暴露情况
- 队列 → 相对风险 (RR) — 从暴露后向前看
- 截 → 患病率 — 时间快照
- RCT / SR → 治疗问题的黄金标准
培训师及教学要点
- 学员通常把NNT(需治疗人数)当作公式来学习,却不理解它在临床上的实际意义——务必确保他们能用患者能理解的句子解释清楚。
- 灵敏度/特异性(检测特性)与阳性预测值/阴性预测值(受患病率影响)之间的区别尚不明确——妊娠试验的类比很贴切。
- 许多受训人员都知道森林样地是什么样子,但却无法解释其含义。 什么 观察——重点关注钻石,以及它是否越过了无效线。
- 提前期偏差经常与长度偏差混淆——使用图表或时间轴来阐明二者的区别。
- 受训人员经常将临床审核与研究混淆——请参考皇家全科医师学会自身评估中的例子。
- “这是药物试验的汇总表——你能告诉我 NNT(需治疗人数)以及你会不会给这位病人开这种药吗?”
- “请看这张森林图。这种干预措施有效吗?你对这个答案有多大把握?”
- “您的患者FIT检测结果呈阳性。在低风险人群中,阳性预测值约为3%。您如何向他解释这一点?”
- “我们发现很多PSA检测结果都偏高。使用PSA作为筛查测试有什么问题呢?”
- “一位同事想把我们医院的脓毒症治疗结果与医院的进行比较。这算是审计还是研究?需要符合伦理规范吗?”
- “如果病人问‘这安全吗?’,你会如何向他解释五十分之一的副作用发生概率?”
- 您目前如何向患者解释风险?您使用的是绝对值还是相对值?
- 您能否回忆起最近一项引用了重要 NNT 的临床指南?该指南是什么?它对您的实践产生了怎样的影响?
- 你是否曾经订购过某种检测,但不知道它的灵敏度和特异性?你是如何解读检测结果的?
- 为什么制药公司会选择以 RRR 而不是 ARR 的形式呈现其试验结果?
🔥 AKT 高收益技巧
这些是AKT试卷中反复出现的题型。记住这些题型,你就能取得好成绩。
务必先将百分比转换为小数。 ARR = 5% → NNT = 1 ÷ 0.05 = 20。始终四舍五入。 up 取最接近的整数。NNT 值越低,治疗效果越好。
对于比率(RR、OR、HR):CI 交叉 1.0 = 不显著。对于差异:CI 交叉 0 = 不显著。这几乎是所有森林图问题中都会出现的情况。
罕见病 → 案例控制 → 或者。未来将出现新的曝光机会 → 队列 → RR. 患病率快照 → 剖最佳治疗证据 → RCT or 系统评价/荟萃分析.
筛选测试 → 需要高灵敏度(不想漏诊 → SnNout)。 确认性试验 → 需要高特异性(不希望出现假阳性 → SpPin)。
即使是特异性很高的检测(99%),在低患病率地区其阳性预测值也很低。人群筛查中的大多数阳性结果都是假阳性。这就是为什么我们不会对所有人进行所有疾病的筛查。
如果 钻石 (合并估计值)越过无效应垂直线 → 总体结果不具有统计学意义。如果 I² > 50% → 存在显著异质性 → 合并结果可靠性较低。
漏斗图左下角的缺口代表发表偏倚——一些小型阴性研究未被发表。这会夸大荟萃分析中某种疗法的表观疗效。
线 内 盒子是 中位数箱体代表四分位距(中间 50%)。超出须线的点或圆圈代表离群值。
制药公司喜欢引用相对风险降低率(RRR),因为它听起来更惊人。50% 的 RRR 听起来很棒——直到你知道基线风险只有 2%(→ 平均风险降低率 ARR = 1%,需治疗人数 NNT = 100)。一定要问:基线风险是多少?
分布偏斜(收入、住院时间、血清胆红素)→ 使用 中位数 不是均值。均值容易受到异常值的影响;中位数则不会。
审计:针对……的措施 现有 标准;无需伦理审查;无需假设。研究:产生 新 知识;需要伦理审批;有假设。AKT反复测试的关键区别在于此。
ITT 分析包括所有随机分组的参与者,无论其依从性如何。这得出了一个 保守的 疗效评估——更符合临床实践实际。按方案分析会高估疗效。
ABPI < 0.9 = 外周动脉疾病。ABPI > 1.3 = 血管不可压缩(钙化)——结果不可靠。如果 ABPI < 0.8,则禁用加压包扎(请参考您的加压包扎指南)。
计算受益面的数量(通常为黄色或绿色)。NNT = 100 ÷(受益面的数量)。5 个黄色面 → NNT = 20。
常见错误和学员陷阱
这些错误在AKT的评分标准中反复出现。每一个错误都会导致考生实际失分。
- 计算 NNT 之前忘记将百分比转换为小数(例如,ARR = 5% → 必须使用 0.05,而不是 5,才能得到 NNT = 20,而不是 0.2)。
- 计算 NNT 向下 而非 up (NNT = 12.5 → 答案是 13,不是 12)
- 混淆了相对风险降低率(RRR)和绝对风险降低率(ARR),并将听起来更令人印象深刻的相对数值作为临床获益引用。
- 当置信区间刚好接近 1.0 时,就说结果“显著”——这必须 不包括 1.0 才有意义
- 箱线图的中间线代表均值——它始终是均值。 中位数
- 区分灵敏度和阳性预测值——灵敏度是检测的固定属性;阳性预测值取决于患病率。
- 认为在低患病率人群中进行高度特异性检测就能得到可靠的阳性结果——这是错误的(阳性预测值低)。
- 区分OR和RR——OR不能直接用作RR,除非疾病非常罕见。
- 病例对照研究得出的是相对风险比(RR),而不是比值比(OR),因为它是从病例组和对照组开始的,而不是从暴露队列开始的。
- 混淆临床审核与研究——声称审核需要伦理审批
- 误解提前期偏差,以为筛查计划确实能提高生存率
- 在森林图中忽略 I² > 50% 会引发人们对合并结果有效性的担忧。
- 使用均值来描述偏态数据(例如收入、住院时长)时,应使用中位数。
🏁 最终要点总结
- NNT = 1 ÷ ARR。百分比必须转换为小数。始终向上取整。NNT 越低,治疗效果越好。
- ARR 具有临床真实性。RRR 听起来很厉害,但可能会误导人。务必将 RRR 与基线风险结合起来考虑。
- 灵敏度和特异性是检测的固定属性。阳性预测值和阴性预测值会随疾病患病率而变化。
- SnNout:灵敏度高的检测,阴性结果可排除其他可能性。SpPin:特异性高的检测,阳性结果可确诊其他可能性。
- 森林图菱形穿过无效应线 → 结果不具有统计学意义。I² > 50% → 存在异质性问题。
- 漏斗图不对称 → 发表偏倚。绩效监控中漏斗边界外的点 → 异常值处理方法。
- 比率的置信区间包含 1.0 → 不显著。差值的置信区间包含 0 → 不显著。
- 病例对照研究→OR值。队列研究→RR值。横断面研究→患病率。随机对照试验/系统评价→治疗的金标准。
- 偏态数据 → 使用中位数,而非平均数。箱线图中间的线代表中位数。超出须线的点代表异常值。
- 临床审核依据标准进行评估——无需伦理考量,也无需假设。研究产生新知识——则需要伦理考量。
AKT考试中的统计学题目是所有题目中最容易掌握的。花几个小时学习本页内容并做一些练习题,就能获得远超投入的回报。