實證實踐與醫學統計學
因為在 AKT 中,「我在網路上看到了一些東西」這種說法還不夠充分。
最後更新:2026年4月 · 也稱為實證醫學 (EBM)
網絡資源
精心挑選的官方指南和全科醫生實踐培訓資源。因為有時,最寶貴的智慧並不隱藏在官方文件中。
一分鐘回憶
臨床實習前或AKT考試前一晚先掃描一下?這些都能影響你的分數。
🧮 風險公式
- ARR = CER − EER
- 神經網絡 = 1 ÷ 年度報酬率
- 存款準備金率 = ARR ÷ CER
- RR = 能源效率比 ÷ 成本率
- NNH = 1 ÷ ARI
🔬 診斷測試
- 桑斯 = TP ÷ (TP+FN) → SnNout
- 規格 = TN ÷ (TN+FP) → SpPin
- PPV = TP ÷ (TP+FP) ← 低盛行率跌倒
- 淨現值 = TN ÷ (TN+FN) ← 高發生率跌倒
📊 研究設計
- 系統性回顧/薈萃分析 → 最高證據
- 隨機對照試驗 → 治療的黃金標準
- 隊列研究 → 相對風險和發病率
- 病例對照研究 → 手術室,罕見疾病
- 橫斷面研究→盛行率
📈 圖表
- 森林圖菱形與直線交叉點 = 不顯著
- 漏斗圖不對稱性 = 發表偏倚
- Cates 圖:NNT = 100 ÷ 黃色面孔
- 箱線圖中間線 = 中位數
- I² >50% = 顯著異質性
📉 意義
- p < 0.05 = 具有統計意義
- 信賴區間跨越 1.0(比率)= 不顯著
- 信賴區間跨越 0(差異)= 無統計意義
- 平均值 = 平均數;中位數 = 中間值
- 常態分佈的 68-95-99.7 法則
⚖️ 偏見類型
- 選擇 → 非代表性樣本
- 回憶 → 案例更容易記住
- 發表 → 僅限陽性研究
- 提前期 → 篩選錯覺
- 人員流失→輟學會扭曲結果
這在全科醫師和AKT中為何重要
實證醫學和統計學並非只是理論。在診間裡,無論你是否提及,每次討論治療方案都會涉及到需治療人數(NNT)。每項血液檢測都有其敏感性和特異性。每項新指南都基於特定的研究設計,而研究設計會影響你對其的信任程度。
在AKT考試中,這個主題佔分相當大一部分——根據RCGP的指導,約佔試卷的10-15%。這是少數幾個只需少量針對性複習就能取得顯著成效的領域之一。 立即許多考生在這裡丟掉容易拿到的分數,不是因為概念難懂,而是因為他們從來沒有坐下來有系統地學習這些概念。
AKT考試中的統計學問題通常會提供一份試驗資料表格,要求你計算某個數值、解讀圖表或確定最佳研究設計。這類問題著重於檢視你的系統性思維,而非醫學知識。 這使得它們成為試卷中最「容易學習」的分數。
實證醫學(EBM)
“上世紀1980年代中期我接受培訓時,我給每個心臟病發作後入院的病人都靜脈輸注利多卡因。那是標準做法,大家都這麼做,似乎完全合情合理。”
——戈登·蓋亞特教授,這位創造了「實證醫學」一詞的醫生,在描述他在實證醫學出現之前接受的培訓時如是說。
他後來發現,他所接受的訓練——以及全世界成千上萬醫生都在採用的療法——不僅毫無用處,而且可能還會害死人。這並非由於疏忽或能力不足,而是因為從來沒有人真正檢驗過這種療法是否有效。
正是這個故事造就了實證醫學的存在——也正是這個故事對你遇到的每位病人都至關重要。
“認真、明確、明智地運用當前最佳證據來製定有關個別患者護理的決策。”
——David Sackett,《英國醫學雜誌》1996年——醫學界引用最廣泛的定義
簡單來說:實證醫學要求你根據現有最佳研究(經過嚴格開展、批判性評估和誠實解讀)來做出臨床決策,而不是根據習慣、意見、傳統或教授告訴你的內容來治療病人。
它並不能取代臨床判斷——它 運籌學 它。 EBM 建立在三個不可分割的支柱之上,這三個支柱必須協同運作:
🕰️實證醫學是如何產生的? ——簡史
實證醫學並非憑空出現,而是加拿大和英國數十年來悄悄醞釀的革命性思想的結晶。
| 每年 | 創建 |
|---|---|
| 1938 | 約翰·保羅(耶魯大學)創造了「臨床流行病學」一詞——其核心思想是,醫學研究應該在人群中進行科學分析,而不僅僅是觀察個別患者。 |
| 1967 | 加拿大漢密爾頓的麥克馬斯特大學新醫學院成立,設立了臨床流行病學和生物統計學系——這在當時可謂是開創性的,致力於將研究方法應用於臨床決策。 |
| 1972 | 蘇格蘭流行病學家阿奇·科克倫發表了 有效性與效率:關於醫療服務的隨機思考 ——一本里程碑式的著作,論證了醫學必須嚴格檢驗自身的治療方法。他的研究最終催生了以他名字命名的科克倫協作組織。 |
| 1981 | 麥克馬斯特大學的大衛‧薩克特及其同事在《加拿大醫學會雜誌》上發表了九篇系列文章,旨在指導臨床醫師如何批判性地評估醫學文獻。這標誌著實證醫學運動的正式開端。 |
| 1990 | 戈登·蓋亞特是麥克馬斯特大學的一位年輕住院醫師主任,他設計了一個新的教學項目,最初將其命名為「科學醫學」。同事們對此感到反感——暗示當前的醫療實踐不夠科學,這種說法太直接。 |
| 1991 | 蓋亞特重新命名了這種方法 “實證醫學” 並在ACP期刊俱樂部的一篇社論中發表了這個術語。這個短語立刻流行起來。 |
| 1992 | 具有里程碑意義的JAMA論文— 《實證醫學:醫學實踐教學的新方法》 ——將實證醫學引入世界。蓋亞特回憶說,最初的反應是「憤怒」。同事覺得這是在告訴他們,他們不是好醫生。 |
| 1993 | Cochrane協作組織正式成立-這是一個旨在製作和傳播醫療保健證據系統評估的國際網絡。 |
| 1996 | David Sackett 在 BMJ 上發表了權威的三支柱定義。實證醫學成為主流。 |
| 2000 年代至今 | 實證醫學已融入英國的醫療培訓系統:英國國家衛生與臨床優化研究所(NICE)指南、英國醫學總會(GMC)的《良好醫療實踐》以及皇家全科醫師學會(RCGP)的課程均有相關要求。它已成為英國每位醫生培訓和考核的基礎。 |
⚠️實證醫學出現之前的醫學是什麼樣的?它解決了什麼問題?
在實證醫學出現之前,醫學的運作依賴於戈登·蓋亞特(Gordon Guyatt)令人印象深刻的那句話。 “GOBSAT” 老夥伴們圍坐在桌旁臨床指引是由資深專家根據他們的個人意見編寫的,而病人最終的治療結果完全取決於碰巧是哪位醫生接診。
- 基於權威的醫學: 你對待病人的方式和你教導如出一轍。權威來自資歷,而非證據。一位「一直都是這麼做的」顧問,即使「這種方法」從未經過檢驗,仍然會被人奉為圭臬。
- 基於直覺的醫學: 如果某種治療方法在生理上看似合理,就會被採用。如果抑制異常心律看起來合乎邏輯,就會加以抑制。至於這種方法是否真的對患者有益,則很少進行檢驗。
- 軼事醫學: 「根據我的經驗,我發現…」就是當時的證據標準。個案決定實踐-即便這些個案在統計上屬於異常值。
- 差異巨大: 同一個病人如果去兩家不同的醫院就診,或者即使是同一家醫院的兩位不同的醫生,對於完全相同的病症,也可能接受完全不同的治療。
🔴 改變醫學的案例—CAST 試驗
這不是假設,而是現代醫學中最重要的真實案例之一,也是實證醫學有史以來最有力的論點之一。
設定-看似無懈可擊的邏輯
心臟病發作會導致危險的心律不整(室性心律不整)。室性心律不整會導致猝死。因此: 抑制心律不整→預防猝死這似乎顯而易見,因此從1970年代開始,世界各地的醫院都將抗心律不整藥物——特別是利多卡因、氟卡尼和恩卡尼——常規用於心肌梗塞後患者。不是偶爾使用,而是常規使用,作為標準治療。
試驗-有人真的測試過了
1987年,心臟心律不整抑制試驗(CAST)招募了1,700多名心肌梗塞後患者,並將其隨機分配到抗心律不整藥物組(氟卡尼或恩卡尼)或安慰劑組。這些藥物完全達到了預期效果——成功抑制了心律不整。但意想不到的事情發生了。
結果——出乎所有人的意料
服用這些藥物的患者是 2.5倍更容易死亡 與服用安慰劑的患者相比,服用這些藥物的患者死亡率更高。由於危害顯而易見,試驗不得不提前終止。這些藥物竟然殺死了它們原本應該保護的患者。
NNH = 21。每 21 名接受氟卡尼或恩卡尼治療的患者中,就有一名原本可以存活的患者死亡。
課程
當時還是年輕心臟科醫生的戈登·蓋亞特親自為他病房裡每一位心肌梗塞後的病人輸注利多卡因。他遵循的是最佳實踐,他接受過正確的培訓,而且出發點是好的。然而,由於缺乏嚴格的隨機對照試驗(RCT)檢驗,他和他的同事都無從得知這種治療方法是否有害。這段經歷成為他畢生致力於實證醫學(EBM)的核心原因。他後來表示,醫學史「充斥著大量基於猜測和直覺而非確鑿證據的治療方法」。
在實證醫學出現之前,你能得到什麼治療取決於你居住的地方、就診的醫院以及接診的醫生。同一個患有相同疾病的病人,在利茲和倫敦可能會接受截然不同的治療。不同的醫院,不同的國家,結果也可能大不相同。
實證醫學改變了這一切。它將臨床決策與同一套證據——相同的試驗、相同的系統性回顧、相同的指南——聯繫起來,為醫學界賦予了共同的語言和標準。如今,在布拉德福德就診的心肌梗塞患者和在布里斯托就診的心肌梗塞患者,都應該接受基本相同的實證治療。這並非因為醫生程度相同,而是因為治療方案是由證據驅動,而非個人偏好。
在英國,這是透過以下方式實現的: 尼斯指南, 皇家全科醫師學會課程, QOF指標, 臨床審核以及 MRCGP考試 所有這些都要求並評估循證實踐。參加AKT考試時,考核的就是你運用這個框架的能力。
🌍 沒有實證醫學的世界-國際視角
英國透過國家衛生與臨床優化研究所 (NICE)、國民醫療服務體系 (NHS) 和研究生培訓等途徑對實證醫學 (EBM) 的重視並非遍及全球。在世界許多地方,患者所能獲得的醫療服務仍然很大程度取決於接診醫生、就診地點以及支付能力。了解這一點有助於您理解實證醫學能為患者提供哪些保護。
下面描述的變化反映了 醫療保健系統和結構問題不在於個別醫生的能力或奉獻精神。在每個列出的國家都有許多才華橫溢、勤奮敬業的醫生。問題在於缺乏實證醫學所提供的標準化基礎設施—指引、監督和訓練架構。單憑個別醫生無法克服系統性問題。
| 國家/地區 | 缺乏強而有力的實證醫學框架,實踐會如何改變? |
|---|---|
| 🇮🇳 印度(私部門) | 一個2018 柳葉刀“ 研究發現,私立醫院的剖腹產率高達40%至58%,而公立醫院僅10%至14%——這往往是受經濟利益驅動,而非臨床需求。過度檢查和多重用藥在私人醫療機構中普遍存在。同一位癌症患者,由於就診地點和經濟能力的不同,可能接受截然不同的治療。 |
| 🇵🇰巴基斯坦 | 抗生素使用指引的執行差異顯著—該地區抗生素處方率位居南亞最高之列。抗藥性結核病和抗菌藥物抗藥性是其直接後果。獲得專科護理和標準化治療方案的機會高度依賴地理位置和收入水平。 |
| 🇳🇬 奈及利亞 / 🇬🇭 加納 | 硫酸鎂是世界衛生組織推薦的、有實證醫學依據且價格低廉的子癇治療方法。研究表明,它能顯著降低孕產婦死亡率。然而,在尼日利亞和加納,硫酸鎂的供應和實際使用情況因醫院資源和臨床醫生培訓水平的不同而存在巨大差異——這意味著,一名子癇婦女的生死可能取決於她最終就診的醫療機構。 |
| 🇸🇩 蘇丹 / 🇮🇶 伊拉克 | 長期衝突和動盪摧毀了醫療衛生基礎設施。 2003年後的伊拉克,公共衛生服務崩潰,指引實施停滯不前,基本藥物的取得也受到地理限制。在蘇丹,衝突擾亂了疫苗接種計劃、孕產婦保健服務和慢性病管理。在這樣的環境下,醫療實務的差異並非出於個人偏好,而是取決於現有資源。 |
| 🇪🇬埃及 / 🇮🇷伊朗 | 兩國都擁有培養高素質醫師的醫學院,並發布了實證醫學指南——但公立和私立醫療機構之間、城鄉地區之間的執行情況並不一致。在伊朗,國際制裁影響了藥品供應,迫使醫療機構做出一些與實證方案相悖的調整。 |
| 🇷🇴羅馬尼亞 | 羅馬尼亞一直在記錄這種做法 皮庫爾 (「信封」)-向醫生和護士支付非正式現金以確保醫療服務。這種做法在官方層面是非法的,但卻十分普遍。議會調查和新聞調查證實,外科手術的品質可能取決於病患的自費能力,而與其在英國國民醫療服務體系(NHS)享有的同等權利無關。自加入歐盟以來,估計已有超過14,000名醫生因人才流失而離開英國。 |
| 🇺🇸美國 | 美國擁有全球最昂貴的醫療保健系統——人均每年超過12,000美元——但其醫療效果往往並不比英國好。達特茅斯地圖集計畫記錄了臨床實踐中巨大的地理差異:同一位患者在邁阿密接受的檢查和治療次數可能是同一位患者在明尼阿波利斯的兩倍,但治療結果卻並無差異。 2019年發表在《美國醫學會雜誌》(JAMA)上的一項研究估計,美國每年有935億美元——約占美國醫療保健總支出的四分之一——被浪費在不必要的醫療服務上。阿片類藥物危機的部分原因是製藥公司在實證醫學(EBM)框架之外影響處方行為。 |
| 🇫🇷法國 | 法國擁有卓越的醫療保健體系,但其抗生素處方率歷來位居歐洲最高之列,部分原因是文化上普遍認為就診後就應該開處方。儘管開展了「抗生素並非自動使用」的宣傳活動以降低處方率,但這種模式表明,即使在醫療體系完善的情況下,文化和商業壓力也可能凌駕於實證醫學指導之上。 |
| 🇮🇹意大利 | 義大利北部(米蘭、波隆那)的醫療品質位居歐洲前列。而在義大利南部部分地區,情況則截然不同——癌症手術等待時間更長,篩檢計畫的實施不夠規範,對指引的遵循度也更低。即使在同一國家內,地理位置也會對治療結果產生顯著影響。 |
| 🇬🇷 希臘 / 🇪🇸 西班牙 | 希臘的財政緊縮危機(2010-2015年)導致醫療支出削減超過25%,造成藥物短缺、人員減少和醫療品質下降等問題。超過35,000萬名醫護人員移居國外。在西班牙,癌症存活率有顯著的地區差異——你所患的腫瘤在不同地區的反應可能有所不同,這並非因為腫瘤的生物學特性不同,而是因為不同地區對循證治療的應用方式不同。 |
在缺乏健全的實證醫學框架或全民健保的醫療體系中,支付與治療品質之間的關係往往是直接的,並且有據可查:
- 在印度的一些私立醫院,能夠支付私人醫療費用的胸痛患者可以立即接受導管介入和支架植入術。而同樣的患者在公立醫院可能需要等待數小時才能做心電圖檢查。
- 在撒哈拉以南非洲的一些地區,患有嚴重瘧疾的兒童接受的是青蒿素類聯合療法(循證標準)還是療效較差的舊藥,取決於他們能去到哪家醫療機構以及他們的家庭能支付多少費用。
- 在沒有全民藥物取得途徑的國家,癌症化療藥物可能只有那些能夠自費的人才能獲得——這意味著同樣的癌症,僅僅因為收入不同,治療結果就會截然不同。
- 在羅馬尼亞和其他一些東歐國家,外科手術的品質——外科醫生的勤勉程度、麻醉監測的質量,甚至術後護理的可用性——已被證實取決於非正式的支付方式,而不是臨床需求。
每次搭乘商業航班,您都受益於人類迄今為止建造的最有效的安全系統之一。這並非因為飛行員個人技藝超群——儘管他們的確如此。而是因為航空業的運作機製本身就圍繞著這核心展開。 標準化的、經過證據檢驗的方案每位飛行員、每家航空公司、每個國家都遵循相同的飛行前檢查清單、相同的著陸程序和相同的緊急情況處理流程。無論您遇到哪位飛行員,這套系統都能保護您的安全。
醫學若缺乏實證醫學,就好比航空業沒有檢查清單。你的安全完全取決於你是否碰巧遇到一位優秀的飛行員,這位飛行員是否接受過足夠近期的培訓,他/她當天的狀態如何,以及他/她是否從值得信賴的人那裡了解了最新的醫學觀點。
實證醫學用系統取代運氣,用“在涉及2萬患者的15,000項試驗中”取代“根據我的經驗”,用人類集體臨床經驗的積累證據取代房間裡碰巧級別最高的人的意見。 您不希望您的病人這樣嗎?您的病人不希望他們自己也這樣嗎?
- 您遵循的每一項 NICE 指南都是經過系統性證據審查的成果——有人已經完成了確保您所採取的措施得到現有最佳科學依據的工作。
- AKT考試中所有關於統計學和研究方法的問題都在考察你批判性地評估證據的能力——即成為循證醫學的積極使用者,而不是被動地遵循指示。
- 當你向病人解釋需治療人數 (NNT)、討論篩檢試驗的局限性,或拒絕開立不必要的抗生素時,你就是在實踐實證醫學——有意識地、明確地、謹慎地實踐。
- 當一位醫藥代表坐在你對面,告訴你他們的新藥能將心血管事件的發生率降低35%時,你的第一個問題——「35%是相對值還是絕對值?」——正是實證醫學教導醫學界應該提出的問題。
研究設計與證據等級
在解讀任何結果之前,你需要知道 它來自哪裡不同的研究設計回答不同的問題,產生不同的統計數據,並具有不同的可靠性等級。
證據金字塔
證據最強位於頂部;證據最弱位於底部。
⬆ 最有力的證據 | ⬇ 最弱的證據
| 學習規劃 | 方向 | 最適合 | 生成 | 關鍵弱點 |
|---|---|---|---|---|
| 系統性評價/薈萃分析 | 關於某個問題的最佳總體證據 | 合併效應量 | 只有基礎研究的品質才能與之媲美;異質性 | |
| 隨機對照試驗 (RCT) | 向前 | X療法有效嗎? | RR、ARR、NNT | 昂貴的人工環境,以及倫理問題 |
| 隊列研究 | 向前(預期)或向後(回顧) | 暴露是否會導致某種結果?發生率如何? | 相對風險(RR)、發生率 | 損耗;長期來看成本高;令人困惑 |
| 病例對照研究 | 落後 | 罕見疾病;風險因素 | 比值比(OR) | 回憶偏差;無法直接計算發生率 |
| 橫斷面研究 | 單次快照 | X 目前有多常見? (患病率) | 流行 | 無法確定因果關係;時間上存在歧義 |
| 病例報告/專家意見 | 假設生成;罕見事件 | 僅描述 | 極易受偏見影響;不具普遍性 |
📖 質性研究與量化研究
回答「有多少」或「多少」的問題。使用數字、統計資料和結構化資料。例如:隨機對照試驗、世代研究、包含數值結果的調查。產生 p 值、信賴區間和需治療人數 (NNT)。
回答“為什麼”或“如何”。運用詞彙、主題和訪談。例如:焦點小組、民族誌研究、紮根理論。探索患者的經驗和信念。
🔬 系統性回顧與統合分析-並非同一回事
系統性評價: 嚴謹、結構化的文獻檢索方法,用於辨識、篩選和批判性地評估所有與某一問題相關的研究。最終結果是對現有證據的定性總結。
統合分析: 一項更進一步的系統性綜述— 數學上的池子 將多項研究的量化結果合併成一個綜合估計值。並非所有系統性回顧都包含薈萃分析(例如,如果研究之間的異質性過大而無法合併)。
🔄 PICO框架
PICO 是建構臨床研究問題的標準架構—用於檢索文獻和設計研究。
| 信 | 代表 | 例 |
|---|---|---|
| P | 人口/患者 | 患有第 2 型糖尿病的成年人 |
| I | 介入 | SGLT2抑制劑 |
| C | 競品對比 | 單獨使用二甲雙胍 |
| O | 結果 | 5 年時的心血管事件 |
🎲 RCT 設計特點(常用測試方法)
| 獨特之處 | 這是什麼意思 | 為什麼重要 |
|---|---|---|
| 隨機化 | 參與者隨機分配到各個小組。 | 消除選擇偏差;平衡混雜因素 |
| 單盲 | 參與者不知道他們的分配情況。 | 減少安慰劑效應和參與者偏差 |
| 雙盲 | 參與者和研究人員均不知道分配情況。 | 消除觀察者偏見和參與者偏見 |
| 三重盲法 | 參與者、研究人員和資料分析師均不知曉分組狀況。 | 最大程度減少偏差 |
| 意向治療分析(ITT) | 無論依從性如何,均在其原始組別中進行分析 | 保留隨機性;反映真實世界使用情況 |
| 根據協議 | 僅對完成試驗方案的受試者進行分析 | 顯示出生物學功效,但高估了實際療效。 |
| 交叉設計 | 參與者依序接受兩種治療。 | 每個人都作為自己的對照;需要一段洗脫期。 |
| 分配隱瞞 | 招募參與者的人員在招募完成之前無法看到下一位參與者將被分配到哪一組。 後 他們已被登記入冊 | 防止招募人員在無意識中(或有意地)將更健康的患者分配到治療組——這種選擇偏差僅靠隨機化無法避免。 |
| 集群隨機對照試驗 | 隨機分組的物件是整個群體(例如全科診所、病房、學校),而不是個體。 | 當個體隨機化不切實際時(例如,測試一種新的諮商方式),可以使用這種方法。這種方法需要更大的樣本量,並且需要對聚類效應進行統計調整。 |
治療意向性分析提供了更多 保守的 療效估計值較低-因為它包含了不依從的參與者。這是臨床決策的首選分析方法。依方案分析會高估療效,但有助於理解生物機制。
⚖️ 優效性、非劣效性和等效性試驗
並非所有試驗都提出相同的問題。 AKT 測試有時會檢驗你是否理解一項試驗的真正目的——以及在解讀試驗結果時,這為何至關重要。
| 試用類型 | 提出的問題 | 共同背景 |
|---|---|---|
| 優效性試驗 | 「新療法 比 比較器? | 大多數標準隨機對照試驗—測試真正的新藥或新方法 |
| 非劣效性試驗 | 「新療法 不比 與比較對象相比,差距是否超過預先設定的較小幅度? | 副作用更少、成本更低或更容易服用的新藥——目標是證明它「足夠好」。 |
| 等效性試驗 | 這兩種治療方法 本質上相同?" | 生物相似藥;仿製藥;不同的給藥途徑 |
一種新型抗凝血劑可能被證實對預防中風「不劣於」華法林——並非更好,但也並非明顯更差——而且使用更簡便(無需監測INR)。即使該藥物並未「勝過」華法林,這仍然是一項具有臨床價值的發現。 AKT可能會要求您正確解讀非劣效性試驗結果。
一項顯示「無顯著差異」的非劣效性試驗是 不會 這與優效性試驗中「無顯著差異」的結果相同。在優效性試驗中,無顯著結果意味著未能證明新藥療效較佳。而在非劣效性試驗中,無顯著差異正是你所期望的結果。
研究偏差、效度和信度
| 偏見類型 | 定義 | 哪些研究設計? | 如何減少它 |
|---|---|---|---|
| 選擇偏差 | 參與者不代表目標族群 | 所有類型 | 隨機化;謹慎抽樣 |
| 回憶偏差 | 病例組(患病者)比對照組更能清楚地回憶起過去的接觸史。 | 病例對照研究 | 客觀資料來源;標準化問卷 |
| 發表偏倚 | 陽性/顯著性研究的發表頻率高於陰性研究。 | 薈萃分析(透過漏斗圖檢測) | 試驗註冊;灰色文獻檢索 |
| 流失偏差 | 參與者失訪會扭曲結果(退出研究者與完成研究者有差異) | 隊列研究、隨機對照試驗 | 意向性治療分析;最大限度減少脫落 |
| 提前期偏差 | 篩檢會給人一種錯覺,即透過更早發現疾病來提高存活率。 | 篩檢研究 | 使用疾病特異性死亡率,而不是診斷後的存活率。 |
| 長度偏差 | 篩檢可以發現更多生長緩慢(侵襲性較低)的疾病。 | 篩檢研究 | 具有疾病特異性結局的隨機對照試驗 |
| 觀察者/評估偏差 | 了解治療分配會影響結果評估 | 隨機對照試驗 | 盲法(單盲、雙盲、三盲) |
| 霍桑效應 | 參與者會改變自己的行為,因為他們知道自己被觀察。 | 所有類型,尤其是觀察型 | 對照組;盲法觀察者 |
| 驗證偏差 | 只有檢測結果呈陽性的患者才會接受金標準確診檢測-因此,敏感度看起來偏高,特異性看起來偏低。 | 診斷測試研究 | 確保所有患者(無論結果呈陽性或陰性)都接受金標準檢測。 |
| 混淆 | 第三個變數與暴露和結果均相關,從而扭曲了表面上的關係。 | 觀察研究 | 隨機化(RCT);分層;多變量分析 |
🔀令人困惑——當兩件事看起來有關聯但實際上沒有關聯時
混雜因素是研究方法論中最重要的概念之一,也是看似令人信服的觀察性研究結果最終被證明是錯誤的最常見原因之一。其核心思想很簡單: 兩件事看起來似乎有聯繫,並不是因為它們直接相互影響,而是因為它們都與一個隱藏的第三個變數有關。
A 混雜因素 (或混雜變項)是與下列因素獨立相關的第三個變項: 都 暴露 以及 結果。它會在你所研究的暴露因素和結果之間建立虛假的(錯誤的)關聯,或掩蓋真實的關聯。
經典範例
| 明顯聯繫 | 混雜因素 | 它解釋了一切 |
|---|---|---|
| 冰淇淋銷售→溺水死亡人數 | 炎熱天氣(夏季) | 天氣炎熱會導致人們吃更多冰淇淋,也會導致更多人游泳,增加溺水事故的發生。冰淇淋本身並不會導致溺水。 |
| 喝咖啡→肺癌 | 抽烟 | 吸煙者平均喝更多咖啡。早期研究曾將咖啡與癌症連結在一起——直到控制了吸菸因素後,這種關聯才消失。 |
| 攜帶打火機→肺癌 | 抽烟 | 吸煙者隨身攜帶打火機。打火機本身沒有生物效應──吸菸才有。 |
| 白髮→心臟病 | 年齡 | 白髮和心臟病都會隨著年齡增加而增加。年齡才是真正的混雜因素,而不是髮色。 |
| 鞋碼→閱讀能力(兒童) | 年齡 | 年紀較大的孩子腳也較大,閱讀能力也較強。年齡可以解釋這兩點。 |
如果一個變數滿足以下條件,則該變數為混雜因素: 三個全部 其中:
- 它與…有關 曝光 (你正在學習的東西)
- 它與…有關 結果 (你所測量的結果)
- 這是 不會 在暴露與結果之間的因果路徑上(這是一個獨立的第三個變量,而不是中間步驟)
- 隨機化 (在隨機對照試驗中)-將已知和未知的混雜因素在各組之間平均分配。這是最有效的保護措施。
- 限制 — 只招募在混雜因素上相似的參與者(例如,咖啡研究中只招募非吸菸者)
- 匹配 — 針對混雜變項的配對病例和對照
- 分層 — 分別分析每個混雜因素水準的結果
- 多變量統計調整 — 同時從統計學角度考慮多個混雜因素
在設計良好的隨機對照試驗中,隨機化會將混雜因素(包括已知和未知的)在各組之間平均分配,從而消除混雜因素對差異的解釋作用。而在隊列研究和病例對照研究中,你只能調整已知且已測量的混雜因子。未測量的混雜因素始終是任何觀察到的關聯的潛在解釋——這就是為什麼觀察性研究永遠無法最終證明因果關係的原因。
✅ 有效性與可靠性-二者有何不同?
這項研究是否測量了其聲稱要測量的指標?研究結果是否準確? Free Introduction 研究可信嗎?存在偏見和混淆因素的威脅。
研究結果能否應用於其他族群或現實環境?在專科中心進行的嚴格控制的隨機對照試驗可能無法反映基層醫療的實際情況。
在相同條件下重複測試是否能得到一致的結果?可透過評分者間信度(kappa統計量)或重測信度來衡量。
衡量兩位評分者之間超越偶然一致性的程度。 κ = 1(完全一致);κ = 0(一致性與偶然一致無異);κ < 0(一致性低於偶然一致)。
風險與治療效果的評估
這是 測試最密集區域 在 AKT 統計學中,你需要熟記這些公式,並且能夠在考試條件下將它們應用於試驗資料表。
關鍵指標
📊 NNT解讀-這些數字究竟代表什麼?
NNT(需治療人數)告訴你需要治療多少患者。 為前線醫護人員打氣,送上由衷的敬意。讓你在送禮的同時,也為香港盡一分力。 為了受益。所以 少 治療所需患者數量越多,療效就越好。 NNT = 2 表示每 2 名患者中就有 1 名獲益——這非常好。 NNT = 100 表示每 100 名患者中只有 1 名獲益——效果差得多。
| NNT範圍 | 粗略解讀 | 範例上下文 |
|---|---|---|
| <10 | 非常有效 | 用於治療某些感染的抗生素;一些急性治療 |
| 10 – 50 | 效果中等 | 許多常見的預防性藥物 |
| > 100 | 效果較弱 | 一些人群層面的預防策略 |
這些閾值是 不會 來自 NICE 或 RCGP 的數據——它們只是粗略的教學輔助工具。 「正確」的 NNT 值始終取決於具體情況:
- 一個 NNT 100或許仍然值得 如果避免的結果是死亡或嚴重的不可逆轉的傷害
- 一個 NNT 5可能不可接受 如果治療出現頻繁或嚴重的副作用
一行規則: NNT(需治療人數)是指治療多少患者才能使一名患者獲益-NNT越低,療效越好。但務必權衡其與疾病後果的嚴重程度和治療負擔。
如果 100 名患者中有 60 名獲益,則絕對風險降低率 (ARR) 為 60% (= 0.6),因此需治療人數 (NNT) ≈ 1 ÷ 0.6 1.7 ——這是一個非常好的結果。 NNT(需治療人數)指的不是受益人數,而是治療所需人數。 為前線醫護人員打氣,送上由衷的敬意。讓你在送禮的同時,也為香港盡一分力。 效益。
📖 比值比和風險比-何時使用?
| 測量 | 用於 | 同步口譯 |
|---|---|---|
| 相對風險 (RR) | 隊列研究、隨機對照試驗 | 直接比較兩組族群的風險。比OR值更直觀。 |
| 比值比(OR) | 病例對照研究 | 比較病例組和對照組的暴露幾率。當疾病罕見時,可近似計算相對風險度(RR)。 |
| 危險比(HR) | 存活分析(事件發生時間) | 類似 RR,但佔比為 什麼時候 事件會隨時間推移而發生。 HR<1表示治療組風險降低。 |
對於常見疾病,與相對風險(RR)相比,優勢比(OR)會高估風險。對於罕見疾病(盛行率<10%),兩者大致相等。病例對照研究會得出優勢比(OR)—您 不能 直接從病例對照研究中計算發生率或相對風險。
🧮 實例分析-根據試驗資料計算 NNT
🎯 情景:他汀類藥物試驗
一項為期 5 年的隨機對照試驗表明,在心血管高風險患者中:安慰劑組有 6% 的人發生心臟病發作,而他汀類藥物組有 4% 的人發生心臟病發作。
治療 50 名患者 5 年,可預防 1 例心臟病發作
聽起來很棒!但實際收益只有2%。
他汀類藥物組的風險是安慰劑組的 67%,相對降低了 33%。
當患者問「這種他汀類藥物對我有幫助嗎?」時,請使用NNT(需治療人數)。 「如果有50個像您一樣的人服用這種藥片5年,就能預防1例心臟病發作。對您個人而言,絕對獲益率為2%。」這比「它可以降低您33%的風險」要誠實得多。
💬 與病患溝通風險(AKT 推薦)
AKT測試通常會檢視你如何向患者解釋統計資料。主要有四種形式:
| 格式 | 例 | 最適合 |
|---|---|---|
| 固有頻率 | 每100人中有5人 | 最便於患者理解 |
| 百分比 | “5%的人” | 廣泛使用,但可能具有誤導性 |
| 神經網絡 | “治療20例,預防1例事件” | 清晰傳達絕對益處 |
| 貓圖 | 100張臉的視覺網格 | 最佳的共同決策視覺化輔助工具 |
如果不說明基線風險,就說「這能降低33%的風險」是誤導性的。基線風險為0.3%,33%的相對風險降低(RRR)意味著您的絕對獲益為0.1%。務必將RRR與基線風險結合起來,或改用絕對風險降低(ARR)/需治療人數(NNT)。
💊 醫藥代表的伎倆-製藥公司如何操縱統計數據
製藥公司代表接受過專門訓練,懂得如何以最有利的方式呈現試驗數據。他們使用了一種簡單但有效的統計技巧:
- 收益 → 以相對風險降低率 (RRR) 表示 因為它聽起來更宏大、更令人印象深刻。
- 危害 → 以絕對風險增加 (ARI) 表示 ——因為它聽起來規模較小,也不太令人擔憂。
例-虛構的他汀類藥物銷售代表拜訪
一種新的他汀類藥物在 5 年內將心臟病發作率從 2% 降低到 1%,但將肌病變發生率從 1% 增加到 2%。
| 代表說的話 | 它的實際意義 |
|---|---|
| 這種藥物透過以下方式降低心臟病發作率 " | 風險回報率 (RRR) 為 50%,但平均收益率 (ARR) 僅為 1%. NNT = 100。治療 100 人 5 年可預防 1 例心臟病發作。 |
| 肌病變風險僅增加 1%" | ARI = 1% — 但實際上這是一個 翻番 肌肉病變風險(相對風險增加 = 100%)。 |
解藥: 總是要問—— “絕對區別是什麼?” 當銷售代表提供相對數字時,請自行換算:ARR = CER − EER,然後 NNT = 1 ÷ ARR。這同樣適用於福利。 以及 危害。
診斷檢測與篩檢—2×2 表格
2×2列聯表是所有診斷統計的基礎。如果您能夠建立和解讀此表,就能回答大多數AKT診斷問題。
2×2 表
| 實際疾病狀況 | ||
|---|---|---|
| 測試結果 | 疾病率 關於演講與演出 | 疾病率 缺席 |
| 檢測結果呈陽性 | 真陽性 (TP) 檢測結果為「是」→患有疾病✓ |
誤報 (FP) 檢測結果為「是」→ 無疾病 ✗ |
| 檢測結果為陰性 | 假陰性 (FN) 檢測結果為陰性 → 患有疾病 ✗ |
真陰性 (TN) 檢驗結果為「否」→ 無疾病 ✓ |
🧠 SnNout & SpPin — 記憶輔助工具(以及它們為何有效)
Sn出局:一個高度 Sen檢測結果呈陽性,如果 N陰性結果,排除疾病可能 出.
如果檢測靈敏度非常高,陰性結果意味著患病的可能性極低(假陰性率低)。使用靈敏度高的檢測方法進行篩檢和排除。
Sp在:一個高度 Sp特定測試,如果 P陽性,決定疾病 In.
如果特異性非常高,陽性檢測結果意味著患病的可能性非常大(假陽性率低)。使用特異性檢測來確診。
📊 盛行率對陽性預測值和陰性預測值的影響-AKT 的關鍵主題
這是診斷統計學中最重要、也最常被檢驗的概念之一。靈敏度和特異性是檢測的固定屬性。但陽性預測值(PPV)和陰性預測值(NPV)會隨著受檢族群中疾病的流行程度而顯著變化。
| <span class="notranslate">EventXtra 6大解決方案</span> | 流行 | PPV | 淨現值 |
|---|---|---|---|
| 對一般人群進行罕見疾病篩檢(例如,對低風險族群進行愛滋病毒篩檢) | 1% | 低(約16%) | 高(約99.9%) |
| 在高風險專科診所進行測試 | 高(約95%) | 高(約95%) |
- 隨著盛行率上升→陽性預測值上升,陰性預測值下降
- 盛行率下降→陽性預測值下降,陰性預測值上升
- 在低盛行率族群中,即使使用特異性很高的檢測方法,大多數陽性結果也是假陽性(陽性預測值低)。
- 在高盛行率族群中,陰性檢測結果仍可能漏診(陰性預測值較低)。
📐 似然比 — 當你想更進一步時
似然比 (LR) 將敏感度和特異性結合成單一數值,用於衡量檢測結果對疾病機率的影響程度。它比陽性預測值/陰性預測值 (PPV/NPV) 更高級,但仍然很有用——並且偶爾會在 AKT 檢測中進行應用。
| LR+ | 對後測機率的影響 |
|---|---|
| > 10 | 機率大幅且往往具有決定性意義的成長 |
| 5-10 | 適度增加 |
| 2-5 | 小幅成長 |
| 1 | 沒有變化(測試無效) |
| 0.1-0.5 | 小幅至中度下降 |
| <0.1 | 大幅下降——強烈否定排除 |
人口統計與流行病學
📊 標準化死亡率 (SMR)
| SMR值 | 同步口譯 |
|---|---|
| = 100 | 死亡率與參考族群相同 |
| > 100 | 超額死亡率(高於預期) |
| <100 | 死亡率低於預期 |
🎯 篩選 — 提前期與長度偏差(AKT 關鍵陷阱)
篩檢能更早發現疾病,使人誤以為生存期有所延長──即使患者最終還是會在同一時間死亡。 「從確診到死亡的生存時間」僅僅是因為早期發現而延長,而非實際治療獲益。患者並沒有活得更久,只是知道病情的時間更長了。
篩檢計畫更有可能發現進展緩慢、隱性疾病(這類疾病的「可檢測臨床前期」較長),而不是進展迅速的侵襲性疾病。這使得篩檢在治療重症疾病方面看起來比實際上更有效。
✅ Wilson & Jungner 篩選標準
在引入篩檢方案之前,它應該符合威爾遜和榮格納標準(最初發表於1968年,至今仍是標準框架)。 AKT測試旨在檢驗受試者對這些標準的了解程度以及將其應用於具體情境的能力。
| # | 標準 | 實際意義 |
|---|---|---|
| 1 | 重要的健康問題 | 這種疾病具有較高的發病率或死亡率—值得進行篩檢。 |
| 2 | 可接受的治療方法 | 檢測出無法治療的疾病毫無意義。 |
| 3 | 具備診斷和治療設施 | 基礎設施必須在啟動前到位。 |
| 4 | 可識別的潛伏期或早期階段 | 該疾病必須具有可檢測的無症狀期。 |
| 5 | 可提供合適的測試 | 檢測方法必須為大眾所接受、安全且具有合理的準確性。 |
| 6 | 人群可接受的測試 | 人們必須願意接受檢查——侵入性或令人不適的檢查可能會降低參與意願。 |
| 7 | 對自然史的充分理解 | 必須了解如果不治療,這種疾病會如何發展。 |
| 8 | 就治療對象達成一致的政策 | 需要明確的流程-不僅要考慮檢測結果,還要考慮後續步驟。 |
| 9 | 經濟效应 | 發現每個案例的成本必須與效益進行權衡。 |
| 10 | 連續過程,而非一次性過程 | 篩檢必須持續進行—疾病發生率仍在上升。 |
前列腺癌PSA篩檢是 不會 之所以將其納入英國國家醫療服務體系(NHS)的國家篩檢計劃,正是因為它難以滿足第5項和第7項標準:PSA檢測的準確性不足(特異性低→假陽性率高),而且許多低級別前列腺癌的自然病程意味著它們在患者一生中都不會引起任何症狀。這直接導致了過度診斷(見下文)。
🔍過度診斷-發現那些原本不會造成問題的問題
過度診斷是指檢測到一種真正的疾病——一種確實存在的疾病——但這種疾病實際上並不會造成嚴重後果。 從未引起任何症狀、傷害或死亡 如果未被發現,患者一生中都可能罹患此病。這不是假陽性(疾病確實存在);而是真陽性,只是原本無需被發現。
過度診斷會將健康人變成病人。它使他們承受焦慮、副作用和治療風險,而這些疾病原本根本不會對他們造成傷害。這是篩檢項目最嚴重的危害之一,也是AKT檢測直接針對的危害之一。
| 新舊程度 | 過度診斷範例 |
|---|---|
| 前列腺癌 | 許多透過PSA檢測出的低度癌症永遠不會發展或引起症狀——男性因此死亡 - 他們,不是 他們 |
| 甲狀腺癌 | 超音波檢查可以發現微小的乳頭狀甲狀腺癌,這些癌症幾乎都是惰性的——檢出率大幅提高,但死亡率卻沒有改變。 |
| 乳管原位癌(乳腺) | 透過乳房X光檢查發現的乳管原位癌—有些永遠不會發展成浸潤性癌。 |
過度診斷 = 發現了一種原本不需要發現的疾病。 過度治療 = 治療原本無需治療的疾病(這可能是過度診斷的結果,也可能獨立發生)。它們是相關但不同的概念。
🔢 年齡標準化
在比較不同族群(例如不同國家、不同時期)的疾病發生率或死亡率時,需要考慮這些族群的年齡分佈可能有差異。即使健康狀況相同,老年族群的死亡率自然也會更高。
年齡標準化是一種統計技術,用於消除不同年齡分佈對比較不同族群健康結果造成的扭曲影響。它得出的結果是,如果兩個人群具有相同的年齡結構(“標準人群”),則應觀察到的比率。
🎗️癌症統計數據-AKT 必知知識
AKT偶爾會測試一些特定的癌症統計數據。您無需具備全面的腫瘤學知識—但這些關鍵數據經常出現,值得了解。
| 癌症 | 關鍵統計數據 | 為什麼重要 |
|---|---|---|
| 睾丸癌 | 10年存活率>98% | 最容易治療的癌症之一——了解這一點對輔導年輕男性很重要 |
| 肺癌 | 英國癌症死亡的主要原因 | 儘管它不是最常見的癌症,但它造成的死亡人數卻比其他任何癌症都多。 |
癌症可能具有很高的致病性。 發生率 (常見)但低 死亡 有些癌症是可以治療的,例如乳癌。有些癌症發生率較低,但死亡率卻很高,例如胰臟癌。 AKT測試可能會檢視您正確解讀癌症統計數據的能力——不要想當然地認為最常見的癌症是最致命的。
⚖️ 健康不平等
健康不平等指的是不同人群之間在健康方面存在的不公平且可避免的差異。它們是英國公共衛生政策的重要關注點,並在《健康知識體系》(AKT)中作為流行病學和社會健康決定因素的組成部分出現。
健康不平等是 不同人群之間健康狀況或健康決定因素分佈方面存在不公平且可避免的差異它們是“可避免的”,因為它們源於社會、經濟或環境條件,而這些條件原則上是可以改變的——而不是源於隨機機會或生物變異。
| 類型 | 英國的例子 |
|---|---|
| 社會經濟 | 貧困地區預期壽命較低;較貧困社區心血管疾病、糖尿病及精神疾病發生率較高 |
| 地理 | 「南北差距」-英格蘭北部部分地區的健康狀況比南部地區差。 |
| 民族 | 南亞裔族群中第二型糖尿病發生率較高;黑人族群中心血管疾病風險較高 |
| 性別 | 男性預期壽命較短,但女性患病年資(發生率)較長。 |
資料分佈與統計顯著性
集中趨勢測度
| 測量 | 定義 | 最佳使用時間 | 小心 |
|---|---|---|---|
| 意思 | 所有數值總和 ÷ 數值個數 | 數據呈常態分佈 | 容易受到異常值的影響 |
| 中位數 | 依序排序後的中間值。如果存在 偶數 對於若干數值,中位數是中間兩個數值的平均值。 | 數據有偏差(例如收入、住院時長) | 忽略極端值。 |
| 模式 | 最常出現的值 | 分類資料;雙峰分佈 | 對於連續數據來說可能毫無意義 |
| 範圍 | 最大值 - 最小值 | 快速感知傳播 | 完全由異常值決定 |
| IQR(四分位數間距) | 第 75 百分位數 - 第 25 百分位數 | 與中位數配對用於偏態數據 | 忽略上下 25% |
| 標準差(SD) | 與均值的平均偏差 | 常態分佈的數據 | 如果資料不服從常態分佈,則會產生誤導。 |
資料類型-名目資料、順序資料、區間資料、比率數據
了解什麼 類型 你擁有的數據決定了哪些總結統計量和統計檢定是適當的。 AKT 測試正是檢驗這一點——通常是透過呈現資料集並詢問應該使用哪種檢定或指標。
| 類型 | 定義 | 包機成本結構範例 | 比喻 |
|---|---|---|---|
| 公稱 | 無自然順序的類別 | 血型(A、B、AB、O);性別;眼睛顏色;死因 | 一盤水果-蘋果和香蕉只是不同而已,沒有哪個「更多」可言。 |
| 序數 | 類別有序,但它們之間的差距是 不會 必然相等 | 紐約心臟協會(NYHA)心臟衰竭分級(I-IV級);疼痛程度(輕度/中度/重度);李克特量表 | 比賽名次-第一名、第二名、第三名。我們知道順序,但第一名和第二名之間的差距可能與第二名和第三名之間的差距大不相同。 |
| 信號間隔 | 按數值間距相等排序,但是 沒有真正的零 | 溫度(攝氏);日曆日期;智商分數 | 溫度計——0°C 並不意味著「沒有溫度」。你也不能絕對地說 20°C 是 10°C 的「兩倍」。 |
| 比 | 有序、相等的間隙,以及 真正的絕對零度 | 身高、體重、血壓、年齡、收入、藥物劑量 | 金錢——0 英鎊表示你真的身無分文。 40 英鎊是 20 英鎊的兩倍。 |
- 名目/順序數據 → 使用非參數檢驗,或以眾數或中位數表示平均值
- 區間/比率數據 (常態分佈)→ 可以使用平均數、標準差、參數檢定
- 您 無法有意義地計算平均值 對於名目資料(例如,「平均血型」是無意義的),或對於區間數據,不能做出比例陳述(你不能說智商為 120 的人比智商為 60 的人「聰明兩倍」)。
🔬 參數檢定與非參數檢定
統計檢定根據其對資料的假設分為兩大類。 AKT 檢定旨在判斷哪種檢驗方法適用於特定情況—您無需進行計算,只需知道何時使用哪種方法即可。
參數檢驗 假設資料呈常態分佈(或樣本夠大,以至於這點無關緊要),且資料至少是區間尺度的。 非參數檢驗 不要做這樣的假設—它們適用於等級或類別,並且適用於偏斜資料、小樣本或有序/名義資料。
| 目的 | 參數測試 | 非參數等價 |
|---|---|---|
| 比較兩個獨立組別的平均值 | 獨立t檢定 | 曼惠特尼 U 檢驗 |
| 比較方法:同一組,2個時間點 | 配對t檢定 | Wilcoxon符號秩檢定 |
| 比較 3 個或更多組別的平均值 | 方差分析(方差分析) | Kruskal-Wallis檢驗 |
| 兩個連續變數之間的相關性 | 皮爾遜相關 | Spearman等級相關 |
| 比較比例/分類數據 | 卡方檢定(χ²) |
- 數據是 偏斜 or 非常態分佈 → 使用非參數方法
- 樣本量較小 (且常態性不確定)→ 使用非參數方法
- 數據是 序數 (例如疼痛評分、李克特量表)→ 使用非參數方法
- 比較 比例或類別 → 卡方檢定
- 大樣本、連續型、近似常態分佈 → 參數檢定適用
🔔 常態分佈——68-95-99.7 法則
常態分佈是一種對稱的鐘形曲線。平均數、中位數和眾數都相等,並且位於曲線的中心。
| 範圍 | 包含值的百分比 |
|---|---|
| 平均值±1個標準差 | |
| 平均值±2個標準差 | |
| 平均值±3個標準差 |
對於正偏態資料(例如收入、全科醫生候診時間、病房血清膽紅素水平),少數高異常值會將平均值向右拉。在這種情況下,應使用… 中位數 ——它更能代表典型值。 AKT 很喜歡檢驗這種差異。
📉 P 值與信賴區間-它們的真正意義
P值
p 值是指觀察到至少與已觀察到的結果一樣極端的結果的機率。 如果原假設成立 (即,如果沒有實際效果)。 不會 零假設成立的機率。
| p值 | 同步口譯 |
|---|---|
| p <0.05 | 具有統計意義-此結果偶然發生的機率小於5%。 |
| p> 0.05 | 統計學意義不顯著—結果可能由偶然因素造成。 |
| p = 0.01 | 如果沒有實際效果,出現此結果的機率為 1%。 |
信賴區間(CI)
95% 信賴區間意味著:如果你重複這項研究 100 次,那麼在其中 95 次中,真實的總體值將落入此範圍內。
- 對於 比 (RR、OR、HR):如果 95% 信賴區間包含 1.0 → 不具統計意義
- 對於 區別 (平均差值,ARR):如果 95% 信賴區間包含 0 → 不具統計意義
- 如果信賴區間完全大於 1(對於比率而言)→ 風險顯著增加
- 如果信賴區間完全低於 1(對於比率而言)→ 風險顯著降低
❌ 第一類錯誤和第二類錯誤-狼來了 vs 錯過狼來了
當零假設實際上為真時,卻拒絕了它。換句話說:當某種療法無效時,卻得出它有效的結論。假陽性率。通常可接受的假陽性率為 5%(α = 0.05,p < 0.05)。
「狼來了」——在沒有狼的時候發出警報。
當原假設實際上為假時,未能拒絕原假設。換句話說:漏診了真實的治療效果。假陰性率。通常可接受的假陰性率為 20%(β = 0.2,功效 = 80%)。
「漏掉了狼」——明明有狼卻說沒有。
功效 = 1 − β。它是正確檢測到真實效應的機率。功效越高,漏檢真實效應的可能性就越小。功效隨樣本量的增加而增加。一項設計良好的試驗需要≥80%的效能。
⚡統計學意義≠臨床意義
這是 AKT 統計中最重要、最常被檢驗的細微差別之一,也是許多受訓者容易忽略的一點。
結果可能是 具有統計學意義 (p < 0.05) 臨床上無意義統計顯著性只能告訴你結果不太可能是偶然因素造成的——它表明 沒有 關於這種影響是否足夠大,以至於在實踐中產生影響。
| <span class="notranslate">EventXtra 6大解決方案</span> | 具有統計學意義嗎? | 臨床上重要嗎? |
|---|---|---|
| 血壓下降1 mmHg,n=50,000,p=0.001 | 可以 | 沒有 |
| 血壓下降15 mmHg,n=30,p=0.08 | 沒有 | 大概是吧 |
| 血壓下降12 mmHg,n=500,p=0.02 | 可以 | 可以 |
總是看著 規模效應 (ARR、NNT、平均差值)以及 p 值和信賴區間。一個不包含 0 或 1 的窄置信區間比單獨的 p 值更有意義——它既能告訴你效應的方向,又能告訴你效應的精確度。
- 窄信賴區間 → 精確估計 → 高度確信真實值接近點估計值(通常來自大樣本)
- 寬信賴區間 → 不確定的估計 → 真實值可能在一個很寬的範圍內(通常來自小樣本或異質樣本)
例如:RR = 1.5 (95% CI 1.4–1.6) → 精確、令人信服。 RR = 1.5 (95% CI 0.6–3.8) → 範圍寬泛、不確定-且跨越 1.0,因此甚至不具統計意義。
📈 均值回歸-臨床實務中隱藏的混雜因素
平均值迴歸是指極端測量值在第二次測量時更接近平均值的統計趨勢— 無論任何干預它是醫學領域最容易被忽視的誤導性結論來源之一。
患者往往在症狀或各項指標最嚴重的時候接受檢查或治療。自然波動意味著這些指標在復測時很可能會改善—這未必是介入的結果。如果沒有對照組,就無法區分均值回歸和真正的治療效果。
| <span class="notranslate">EventXtra 6大解決方案</span> | 治療效果的跡象 | 究竟發生了什麼事 |
|---|---|---|
| 患者一次血壓測量結果非常高 → 開始服藥治療 → 下次就診時血壓下降 | 藥物有效 | 第一次測量結果可能是個異常值;無論如何,重複測量血壓值都會降低。 |
| 學生考試成績很差 → 接受額外輔導 → 下次考試成績更好 | 學費資助 | 低分可能不具代表性;實際表現往往接近平均。 |
| 一位濕疹嚴重發作的患者開始使用新的藥膏→病情有所改善 | 乳膏有效 | 無論是否接受治療,嚴重的病情發作都會隨著時間的推移而自然好轉。 |
- 採取 多次基線測量 並在開始治療前使用平均值
- 使用 控制組 —平均值迴歸對兩組的影響相同,因此組間任何差異都更可能是真實的治療效果。
- 這是最有力的論點之一 隨機對照試驗優於非對照前後研究
統計圖表-需要關注哪些方面
AKT考試中會定期展示圖表並要求你進行解讀。學會辨識每種圖表類型中的關鍵特徵—不要試圖解讀所有內容。只需專注於一個有針對性的觀察結果即可。
| 圖表類型 | 主要用途 | 需要注意的一件事 |
|---|---|---|
| 森林圖 | 薈萃分析結果 | 是否 鑽石 越過無影響垂直線? |
| 漏斗圖 | 發表偏差檢測/全科醫生異常值監測 | 劇情是這樣的嗎? 不對稱的(缺口 = 未發表的研究缺失) |
| 凱茨圖 | 以視覺化的方式向患者傳達 NNT(需治療人數) | 統計彩色「受益」人臉的數量;NNT = 100 ÷ 這些人臉 |
| 拉貝陰謀 | 探討薈萃分析中的異質性 | 對角線上的點 = 零治療效應 |
| 箱線圖 | 數據分佈和傳播 | 中線 = 中位數 (並非平均值);須線以外的點 = 異常值 |
| 費根列線圖 | 測試前機率 → 測試後機率 | 從測試前機率透過 LR 畫一條線,即可唸出測試後機率 |
| 莖葉圖 | 發行-保留原值 | 類似直方圖,但顯示的是單一資料點 |
| Kaplan-Meier曲線 | 存活分析-事件發生時間 | 事件發生時,曲線下降;早期發散且持續分離的曲線顯示治療效果持續存在。 |
| 直方圖 | 連續性資料的分佈 | 曲線形狀:對稱 = 常態分佈;偏態 = 使用中位數而非平均數 |
🌲 森林地塊-詳解
- 每個方格 = 一項研究。方格的大小代表研究的權重(通常取決於樣本量)。
- 水平線 = 該研究的 95% 信賴區間
- 鑽石 底部為匯總的總體估計值。其寬度為匯總的 95% 信賴區間。
- 1.0處的垂直線 = “無效應線”(用於比率)。如果是 CI 線或菱形 越過這條線結果是 不具有統計意義
I² 衡量研究間差異有多少是由於真正的異質性(真實差異)而非偶然因素造成的。
I² < 25% = 低異質性 ✓
I² = 25–50% = 中等異質性
I² > 50% = 存在顯著異質性-合併結果可靠性較低⚠️
📯 漏斗圖 — 發表偏差與全科醫生異常值監測
漏斗圖在 AKT 中以兩種完全不同的形式出現—請務必識別這兩種形式。
以效應量(x軸)為縱座標,以研究的精確度或樣本量(y軸)為橫座標繪製圖表。對稱的倒漏斗圖表示無偏倚。左下角有缺口的非對稱漏斗圖表示遺漏了樣本量較小的陰性研究,從而導致發表偏差。
根據指標(例如轉診率、死亡率)對全科診所進行比較。漏斗線外的數據點是 統計異常值 需要進行調查——但這並不一定能證明表現不佳。
😊 Cates 圖——如何以可視化的方式提取 NNT
Cates 圖(有時稱為「笑臉圖」)使用 100 個笑臉組成的網格來幫助患者直觀地了解絕對的益處和危害。
- 這100張臉孔分別代表每100名接受治療的人中的一人。
- 黃/綠臉 = 受益者(事件得以避免)
- 紅臉 遭受傷害的人
- 灰色/素色面孔 兩種方式都沒有影響
📉 Kaplan-Meier存活曲線—如何解讀它們
Kaplan-Meier (KM) 曲線顯示了隨時間推移的存活機率(或無事件存活機率)。它們出現在 AKT 問卷中,例如關於癌症試驗、心血管研究以及任何追蹤事件發生時間的研究。
| 獨特之處 | 這是什麼意思 |
|---|---|
| Y 軸 | 存活機率(或無事件生存機率)-初始值為 1.0 (100%),並隨時間推移而下降。 |
| X 軸 | 時間(天、月、年) |
| 每一步向下走 | 事件已發生(例如死亡、復發)。步長越大,該點發生的事件就越多。 |
| 線上的刻度線 | 被排除的患者-失訪或研究結束。不是事件。 |
| 兩條曲線早期即分叉,並保持分離狀態。 | 顯示治療效果在整個追蹤期間持續存在 |
| 彎道交叉 | 這表明風險並非隨時間成正比——這使得結果難以解釋。 |
| 中位存活期 | 生存曲線與 50% 相交的時間點-即一半患者發生此事件的時間點。 |
这 對數秩檢定 對兩條KM曲線進行統計學比較。 風險比(HR) 總結了曲線之間的整體差異。 HR < 1 表示治療組隨時間推移事件發生率較低。如果曲線明顯重疊,則 HR 將接近 1(無益處)。
📊 直方圖-分佈概覽
直方圖透過將連續變數(例如年齡、血壓、BMI)的數值分組到不同的區間(箱)中,並顯示每個區間內的觀測值數量,來展示該變數的分佈。與長條圖不同,直方圖中的長條是相接的-因為資料是連續的。
| 三方圈 | 意思 | 使用平均數還是中位數? |
|---|---|---|
| 對稱的鐘形 | 常態分佈-平均數、中位數和眾數均相等。 | 兩者皆可——但通常表示為平均值±標準差 |
| 右偏(正偏) | 右側長尾-少數極高值拉高了平均值 | 中位數(更具代表性) |
| 左偏(負偏) | 左側長尾-少數極低值拉低了平均值 | 中位數(更具代表性) |
| 雙峰(兩個峰) | 數據中存在兩個截然不同的亞組。 | 分別報告兩個峰值。 |
品質改進與臨床審核
| 工具 | 目的 | 主要特色 |
|---|---|---|
| 臨床審核 | 對照組明確的標準衡量實踐;找出並彌補差距。 | 需要製定標準。採用PDSA循環。包含閉環(重新審核)。 不 研究-沒有假設,就沒有新知識產生。 |
| 重大事件分析(SEA) | 對單一重大事件進行系統性的多學科審查 | 不追究責任。注重系統學習,而非個人過錯。團隊內部共享。記錄學習過程和行動。 |
| 根本原因分析 (RCA) | 對重大事件進行深入調查 | 比策略性環境分析 (SEA) 更具結構化。採用「5個為什麼」分析法。識別促成因素和根本原因。通常用於預防重大事故或造成嚴重傷害。 |
| QOF異常報告 | 將患者適當排除在QOF指標之外 | 臨床適用情況:最大耐受劑量、知情患者反對、極度虛弱或臨床禁忌症。 |
🔄 臨床審核與研究-主要區別
| 獨特之處 | 臨床審核 | 研究 |
|---|---|---|
| 目的 | 透過與標準進行比較來改善護理。 | 產生新知識 |
| 假設 | 無——與現有標準進行比較 | 總是有一個假設 |
| 道德批准 | 通常不需要 | 通常需要 |
| 許可 | 通常不需要 | 通常需要 |
| 隨機化 | 決不 | 可能包括隨機對照試驗 |
| 最終結果 | 服務改進;行動計劃 | 新證據;出版物 |
🔁 PDSA循環
計劃-執行-檢查-改進(PDSA)循環是臨床審核和品質改進中使用的持續改進框架。
| 階段 | 怎麼了 |
|---|---|
| 計劃 | 明確問題,設定標準,規劃資料收集 |
| Do | 實施變更或評估目前做法 |
| 研究 | 分析結果;與標準比較;找出差距 |
| 法案 | 實施改進措施;計劃重新審計以形成閉環。 |
臨床計算(AKT公式庫)
這些公式經常出現在 AKT 計算題中。務必記住每個公式,並了解觸發相應臨床事件的臨界值。
🧮 ABPI 工作範例
🎯 情境:72歲的T女士,行走時腿部疼痛
🍷 酒精單位範例
| 飲料 | 體積(毫升) | 酒精濃度% | 計算 | 部隊 |
|---|---|---|---|---|
| 大杯葡萄酒 | 250ml | 250 × 13 ÷ 1000 | 3.25 | |
| 一瓶葡萄酒 | 750ml | 750 × 12 ÷ 1000 | 9.0 | |
| 品脫拉格啤酒(烈性) | 568ml | 5% | 568 × 5 ÷ 1000 | 2.84 |
| 單份烈酒 | 25ml | 25 × 40 ÷ 1000 | 1.0 |
範例
🎯 範例 1:根據試驗表計算所有風險指標
一項隨機對照試驗將患者隨機分配到藥物 X 組或安慰劑組。 3 年後:500 名安慰劑組患者中有 80 人發生中風;500 名藥物 X 組患者中有 40 人發生中風。
🎯 範例 2:建立 2×2 列聯表並計算靈敏度和特異度
一項新的檢測方法應用於200名患者,其中100名患有該疾病。此檢測方法正確辨識出100名患病患者中的85名,並正確辨識出100名健康患者中的80名。
🎯 例 3:兒童劑量計算
一名兒童需要服用300毫克阿莫西林。現有阿莫西林混懸液的規格為250毫克/5毫升。應該服用多少毫升?
公式速查表與記憶輔助工具
風險與治療方案
診斷測試
人口與臨床公式
- SnNout: 敏感測試-陰性結果可排除疾病(篩檢)
- SpPin: 特異性檢測-陽性結果可確診該疾病(確診)
- CI 跨越 1.0 (比率)或 0 (差異)→不顯著
- 森林地塊菱形十字線 → 不顯著
- 漏斗不對稱 → 發表偏差(或全科醫生異常值,如果是在績效背景下)
- 箱線圖中線 → 中位數(不是平均數)
- 68-95-99.7 → 常態分佈中的 ±1SD、±2SD、±3SD
- I² >50% → 顯著異質性
- 或來自病例對照研究 | 來自隊列的RR | 橫斷面調查的盛行率
- 審計 ≠ 研究 (審計措施與標準比較;研究產生新知識)
- 病例對照 → 或(優勢比)-回顧先前暴露情況
- 隊列 → 相對風險 (RR) — 從暴露後向前看
- 截 → 盛行率 — 時間快照
- RCT / SR → 治療問題的黃金標準
培訓師及教學要點
- 學員通常把NNT(需治療人數)當作公式來學習,卻不理解它在臨床上的實際意義-務必確保他們能用病人能理解的句子解釋清楚。
- 敏感度/特異性(檢測特性)與陽性預測值/陰性預測值(受盛行率影響)之間的差異尚不明確-妊娠試驗的類比很貼切。
- 許多受訓人員都知道森林樣地是什麼樣子,但卻無法解釋其意義。 什麼 觀察——重點關注鑽石,以及它是否越過了無效線。
- 提前期偏差常與長度偏差混淆-使用圖表或時間軸來闡明二者的差異。
- 受訓人員經常將臨床審查與研究混淆-請參考英國皇家全科醫師學會自身評估中的例子。
- “這是藥物試驗的總結表——你能告訴我 NNT(需治療人數)以及你會不會給這位病人開這種藥嗎?”
- “請看這張森林圖。這種幹預措施有效嗎?你對這個答案有多大把握?”
- “您的患者FIT檢測結果呈陽性。在低風險人群中,陽性預測值約為3%。您如何向他解釋這一點?”
- “我們發現很多PSA檢測結果都偏高。使用PSA作為篩檢測試有什麼問題呢?”
- “一位同事想把我們醫院的膿毒症治療結果與醫院的進行比較。這算是審計還是研究?需要符合倫理規範嗎?”
- “如果病人問‘這安全嗎?’,你會如何向他解釋五十分之一的副作用發生機率?”
- 您目前如何向患者解釋風險?您使用的是絕對值還是相對值?
- 您能否回想起最近一項引用了重要 NNT 的臨床指引?該指南是什麼?它對您的實踐有何影響?
- 你是否曾經訂購過某種檢測,但不知道它的靈敏度和特異性?你是如何解讀檢測結果的?
- 為什麼製藥公司會選擇以 RRR 而非 ARR 的形式呈現其試驗結果?
🔥 AKT 高收益技巧
這些都是AKT試卷中反覆出現的題型。記住這些題型,你就能取得好成績。
務必先將百分比轉換為小數。 ARR = 5% → NNT = 1 ÷ 0.05 = 20。始終四捨五入。 up 取最接近的整數。 NNT 值越低,治療效果越好。
對於比率(RR、OR、HR):CI 交叉 1.0 = 不顯著。對於差異:CI 交叉 0 = 不顯著。這幾乎是所有森林圖問題中都會出現的情況。
罕見疾病 → 病例對照 → 或。未來將出現新的曝光機會 → 隊列 → RR. 盛行率快照 → 橫截面最佳治療證據 → RCT or 系統性評價/薈萃分析.
篩檢測試 → 需要高靈敏度(不想漏診 → SnNout)。 確認性試驗 → 需要高特異性(不希望有偽陽性 → SpPin)。
即使是特異性很高的檢測(99%),在低盛行率地區其陽性預測值也很低。人群篩檢中的大多數陽性結果都是假陽性。這就是為什麼我們不會對所有人進行所有疾病的篩檢。
如果 鑽石 (合併估計值)越過無效應垂直線 → 整體結果不具統計意義。如果 I² > 50% → 存在顯著異質性 → 合併結果可靠性較低。
漏斗圖左下角的缺口代表發表偏差-有些小型陰性研究未被發表。這會誇大薈萃分析中某種療法的表觀療效。
線 內 盒子是 中位數箱體代表四分位數距(中間 50%)。超出須線的點或圓圈代表離群值。
製藥公司喜歡引用相對風險降低率(RRR),因為它聽起來更驚人。 50% 的 RRR 聽起來很棒——直到你知道基線風險只有 2%(→ 平均風險降低率 ARR = 1%,需治療人數 NNT = 100)。一定要問:基線風險是多少?
分佈偏斜(收入、住院時間、血清膽紅素)→ 使用 中位數 不是均值。平均數容易受到異常值的影響;中位數則不會。
審計:針對…的措施 現有 標準;無需倫理審查;無需假設。研究:產生 新 知識;需要倫理審批;有假設。 AKT反覆測試的關鍵差異在於此。
ITT 分析包括所有隨機分組的參與者,無論其依從性如何。這得出了一個 保守的 療效評估-更符合臨床實務實際。按方案分析會高估療效。
ABPI < 0.9 = 週邊動脈疾病。 ABPI > 1.3 = 血管不可壓迫(鈣化)-結果不可靠。如果 ABPI < 0.8,則停用加壓包紮(請參考您的加壓包紮指南)。
計算受益面(通常為黃色或綠色)。 NNT = 100 ÷(受益面的數量)。 5 個黃色面 → NNT = 20。
常見錯誤與學員陷阱
這些錯誤在AKT的評分標準中反覆出現。每一個錯誤都會導致考生實際失分。
- 計算 NNT 之前忘記將百分比轉換為小數(例如,ARR = 5% → 必須使用 0.05,而不是 5,才能得到 NNT = 20,而不是 0.2)。
- 計算 NNT 四捨五入 向下 而非 up (NNT = 12.5 → 答案是 13,不是 12)
- 混淆了相對風險降低率(RRR)和絕對風險降低率(ARR),並將聽起來更令人印象深刻的相對數值作為臨床效益引用。
- 當置信區間剛好接近 1.0 時,就說結果「顯著」——這必須 不包括 1.0 才有意義
- 箱線圖的中間線代表平均值-它總是平均值。 中位數
- 區分靈敏度和陽性預測值-靈敏度是檢測的固定屬性;陽性預測值取決於盛行率。
- 認為在低盛行率族群中進行高度特異性檢測就能得到可靠的陽性結果-這是錯誤的(陽性預測值低)。
- 區分OR和RR-OR不能直接用作RR,除非疾病非常罕見。
- 病例對照研究得出的是相對風險比(RR),而不是比值比(OR),因為它是從病例組和對照組開始的,而不是從暴露組開始的。
- 混淆臨床審核與研究-聲稱審核需要倫理審批
- 誤解提前期偏差,以為篩檢計畫確實能提高存活率
- 在森林圖中忽略 I² > 50% 會引發人們對合併結果有效性的擔憂。
- 使用平均數來描述偏態資料(例如收入、住院時長)時,應使用中位數。
🏁 最終要點總結
- NNT = 1 ÷ ARR。百分比必須轉換為小數。始終向上取整。 NNT 越低,治療效果越好。
- ARR 具有臨床真實性。 RRR 聽起來很厲害,但可能會誤導人。務必將 RRR 與基準風險結合考慮。
- 靈敏度和特異性是檢測的固定屬性。陽性預測值和陰性預測值會隨疾病盛行率而改變。
- SnNout:靈敏度高的檢測,陰性結果可排除其他可能性。 SpPin:特異性高的檢測,陽性結果可確診其他可能性。
- 森林圖菱形穿過無效應線 → 結果不具統計意義。 I² > 50% → 有異質性問題。
- 漏斗圖不對稱 → 發表偏倚。績效監控中漏斗邊界外的點 → 異常值處理方法。
- 比率的置信區間包含 1.0 → 不顯著。差值的置信區間包含 0 → 不顯著。
- 病例對照研究→OR值。隊列研究→RR值。橫斷面研究→盛行率。隨機對照試驗/系統性回顧→治療的黃金標準。
- 偏態資料 → 使用中位數,而非平均數。箱線圖中間的線代表中位數。超出須線的點代表異常值。
- 臨床審核依據標準進行評估-無需倫理考量,也不需要假設。研究產生新知識-則需要倫理考量。
AKT考試中的統計題目是所有題目中最容易掌握的。花幾個小時學習本頁內容並做一些練習題,就能獲得遠超投入的回報。