Praktyka oparta na dowodach i statystyka medyczna
Ponieważ sformułowanie „przeczytałem coś w internecie” nie do końca jest trafne w kontekście AKT.
Ostatnia aktualizacja: kwiecień 2026 r. · Znana również jako medycyna oparta na faktach (EBM)
📥 Pobrania
Materiały pomocnicze, podsumowania i materiały dydaktyczne — gotowe, gdy będziesz ich potrzebować.
Zasoby internetowe
Starannie dobrany zestaw oficjalnych wskazówek i praktycznych materiałów szkoleniowych dla lekarzy rodzinnych. Bo czasami najlepsze perełki nie kryją się w oficjalnych dokumentach.
Jednominutowe przypomnienie
Skanowanie tego przed zajęciami — czy w noc przed egzaminem AKT? To są rzeczy, które dają punkty.
🧮 Formuły ryzyka
- ARR = CER − EER
- NNT = 1 ÷ ARR
- RRR = ARR ÷ CER
- RR = EER ÷ CER
- NNH = 1 ÷ ARI
🔬 Testy diagnostyczne
- Znaczenie = TP ÷ (TP+FN) → SnNout
- Spec = TN ÷ (TN+FP) → SpPin
- PPV = TP ÷ (TP+FP) ← upadki o niskiej częstości występowania
- NPV = TN ÷ (TN+FN) ← upadki o dużej częstości występowania
📊 Projekty badawcze
- SR/Metaanaliza → najwyższe dowody
- RCT → złoty standard leczenia
- Kohorta → RR i zapadalność
- Przypadek-kontrola → LUB, choroby rzadkie
- Przekrojowe → rozpowszechnienie
📈 Wykresy
- Linia rombowa działki leśnej = nieistotne
- Asymetria lejka = błąd publikacji
- Wykres Catesa: NNT = 100 ÷ żółte ściany
- Wykres pudełkowy linia środkowa = mediana
- I² >50% = znaczna heterogeniczność
📉 Znaczenie
- p < 0.05 = istotne statystycznie
- CI przekracza 1.0 (stosunek) = nieistotne statystycznie
- CI przekracza 0 (różnica) = nieistotne statystycznie
- Średnia = średnia; Mediana = wartość środkowa
- Reguła 68-95-99.7 dla rozkładu normalnego
⚖️ Typy uprzedzeń
- Selekcja → próba niereprezentatywna
- Przypomnij sobie → przypadki zapamiętują więcej
- Publikacja → tylko badania pozytywne
- Czas realizacji → iluzja ekranowania
- Odpływ → rezygnacja zniekształca wyniki
Dlaczego to ma znaczenie w GP i AKT
EBM i statystyka to nie tylko teoria. W gabinecie lekarskim każda rozmowa o opcjach leczenia wiąże się z NNT, niezależnie od tego, czy je nazwiesz, czy nie. Każde badanie krwi ma swoją czułość i swoistość. Każda nowa wytyczna opiera się na projekcie badawczym, który wpływa na poziom zaufania, jaki należy jej pokładać.
W AKT ten temat stanowi znaczną część punktów – około 10–15% materiału, zgodnie z wytycznymi RCGP. To jeden z niewielu obszarów, w których niewielka ilość ukierunkowanych poprawek przynosi korzyści. natychmiastWielu kandydatów traci tu łatwe punkty nie dlatego, że koncepcje są trudne, ale dlatego, że nigdy nie usiądą i nie nauczą się ich systematycznie.
Pytania statystyczne w teście AKT często przedstawiają tabelę danych z badań i proszą o obliczenie wartości, zinterpretowanie wykresu lub wskazanie najlepszego projektu badawczego. Nagradzają metodyczne myślenie, a nie wiedzę medyczną. To sprawia, że są to znaki najbardziej „łatwe do przyswojenia” w tym artykule.
Medycyna oparta na dowodach (EBM)
„Kiedy odbywałem szkolenie w połowie lat 1980., podawałem dożylny wlew lidokainy każdemu pacjentowi, który zgłosił się do mnie po zawale serca. To był standard. Wszyscy to robili. Wydawało się to całkowicie logiczne”.
— Profesor Gordon Guyatt, lekarz, który ukuł termin „medycyna oparta na dowodach”, opisując swoje własne szkolenie przed powstaniem medycyny opartej na dowodach
Później odkrył, że praktyka, w której się szkolił – i którą stosowały setki tysięcy lekarzy na całym świecie – była nie tylko bezużyteczna, ale potencjalnie zabijała ludzi. Nie z powodu zaniedbania. Nie z powodu niekompetencji. Ale dlatego, że nikt nigdy nie sprawdził rzetelnie, czy faktycznie działa.
Ta historia jest powodem istnienia Medycyny Opartej na Faktach — i dlaczego jest ona tak ważna dla każdego pacjenta, jakiego kiedykolwiek spotkasz.
„Świadome, jednoznaczne i rozsądne wykorzystanie najlepszych aktualnych dowodów przy podejmowaniu decyzji dotyczących opieki nad poszczególnymi pacjentami”.
— David Sackett, BMJ 1996 — najczęściej cytowana definicja w medycynie
Mówiąc wprost: EBM nie wymaga leczenia pacjentów na podstawie nawyków, opinii, tradycji czy tego, co powiedział ci profesor, ale opierania decyzji klinicznych na najlepszych dostępnych badaniach — przeprowadzonych skrupulatnie, poddanych krytycznej ocenie i uczciwej interpretacji.
Nie zastępuje ona osądu klinicznego – informuje EBM opiera się na trzech nierozłącznych filarach, które muszą ze sobą współdziałać:
🕰️ Skąd wziął się EBM? — krótka historia
EBM nie pojawił się znikąd. Był kulminacją dekad cichego, rewolucyjnego myślenia w Kanadzie i Wielkiej Brytanii.
| Rok | wydarzenie |
|---|---|
| 1938 | John Paul (Yale) ukuł termin „epidemiologia kliniczna” – ideę, że medycynę należy badać naukowo na populacjach, a nie tylko obserwować u poszczególnych pacjentów |
| 1967 | Uniwersytet McMaster (Hamilton, Kanada) otwiera nową szkołę medyczną z Wydziałem Epidemiologii Klinicznej i Biostatystyki – jak na tamte czasy radykalnym, poświęconym stosowaniu metod badawczych w decyzjach klinicznych |
| 1972 | Archie Cochrane, szkocki epidemiolog, publikuje Skuteczność i wydajność: przypadkowe refleksje na temat usług zdrowotnych — przełomowy tekst, w którym autor dowodzi, że medycyna musi rygorystycznie testować własne metody leczenia. Jego praca ostatecznie dała początek Cochrane Collaboration, nazwanemu na jego cześć. |
| 1981 | David Sackett i współpracownicy z McMaster publikują serię dziewięciu artykułów w czasopiśmie Canadian Medical Association Journal, w których uczą klinicystów, jak krytycznie oceniać literaturę medyczną. To formalny początek ruchu EBM (medycyny opartej na faktach). |
| 1990 | Gordon Guyatt, młody dyrektor rezydentury w McMaster, opracowuje nowy program nauczania i początkowo nazywa go „Medycyną Naukową”. Koledzy się buntują — sugestia, że obecna praktyka nie ma charakteru naukowego, jest zbyt bezpośrednia. |
| 1991 | Guyatt zmienia nazwę podejścia Medycyna oparta na dowodach i publikuje ten termin w artykule redakcyjnym w „ACP Journal Club”. Określenie od razu się przyjęło. |
| 1992 | Przełomowy artykuł w JAMA — „Medycyna oparta na dowodach: nowe podejście do nauczania praktyki medycznej” — wprowadza EBM do świata. Reakcją, jak wspomina Guyatt, była początkowo „wściekłość”. Koledzy mieli wrażenie, że powiedziano im, że nie są dobrymi lekarzami. |
| 1993 | Formalnie założono Cochrane Collaboration — międzynarodową sieć zajmującą się opracowywaniem i rozpowszechnianiem systematycznych przeglądów danych naukowych z zakresu opieki zdrowotnej. |
| 1996 | David Sackett publikuje ostateczną definicję trzech filarów w BMJ. EBM staje się głównym nurtem. |
| 2000-obecnie | EBM staje się integralną częścią brytyjskiego systemu kształcenia: wymagają tego wytyczne NICE, Dobra Praktyka Medyczna GMC oraz program nauczania RCGP. Stanowi on podstawę szkolenia i oceny każdego lekarza w Wielkiej Brytanii. |
⚠️ Jak wyglądała medycyna przed EBM? Problem, który rozwiązała
Przed EBM medycyna opierała się na tym, co Gordon Guyatt trafnie nazwał "GOBSAT" Do Dobrzy starzy chłopcy siedzący przy stoleWytyczne kliniczne zostały napisane przez doświadczonych ekspertów, którzy zebrali swoje osobiste opinie, a to, co stało się z pacjentem, zależało wyłącznie od tego, który lekarz go zbadał.
- Medycyna oparta na wybitności: Traktowałeś pacjentów tak, jak robił to twój profesor. Autorytet wynikał ze stażu pracy, a nie z dowodów. Konsultant, który „zawsze tak robił” przez 30 lat, został odroczony – nawet jeśli „tak” nigdy nie został przetestowany.
- Medycyna oparta na intuicji: Jeśli leczenie wydawało się fizjologicznie uzasadnione, stosowano je. Jeśli tłumienie nieprawidłowych rytmów serca wydawało się logiczne, tłumiono je. Rzadko sprawdzano, czy faktycznie pomagało pacjentom.
- Medycyna oparta na anegdotach: „Z mojego doświadczenia wynika, że…” – to był standard dowodowy. Poszczególne przypadki wpływały na praktykę – nawet jeśli były to przypadki statystycznie odbiegające od normy.
- Ogromna zmienność: Ten sam pacjent zgłaszający się do dwóch różnych szpitali — lub nawet do dwóch różnych lekarzy w tym samym szpitalu — może otrzymać zupełnie inne leczenie dokładnie tego samego schorzenia.
🔴 Przykład, który zmienił medycynę — badanie CAST
To nie jest hipoteza. To jedna z najważniejszych prawdziwych historii we współczesnej medycynie – i jeden z najsilniejszych argumentów, jakich kiedykolwiek potrzebowała EBM.
Przygotowanie — logika, która wydawała się niepodważalna
Zawały serca powodują niebezpieczne zaburzenia rytmu serca (arytmie komorowe). Arytmie komorowe prowadzą do nagłej śmierci. Dlatego: tłumić arytmie → zapobiegać nagłej śmierciWydawało się to tak oczywiste, że od lat 1970. XX wieku leki przeciwarytmiczne – zwłaszcza lidokaina, flekainid i enkainid – były rutynowo podawane pacjentom po zawale serca w szpitalach na całym świecie. Nie sporadycznie. Rutynowo. W ramach standardowej opieki.
Proces – ktoś naprawdę go przetestował
W 1987 roku w badaniu Cardiac Arrhythmia Suppression Trial (CAST) wzięło udział ponad 1,700 pacjentów po zawale serca, których przydzielono losowo do grup otrzymujących leki przeciwarytmiczne (flekainid lub enkainid) lub placebo. Leki działały dokładnie tak, jak powinny – skutecznie hamowały arytmie. Ale wydarzyło się coś nieoczekiwanego.
Wynik — którego nikt się nie spodziewał
Pacjenci przyjmujący leki byli 2.5 razy większe prawdopodobieństwo śmierci niż w przypadku placebo. Badanie musiało zostać przerwane przedwcześnie, ponieważ szkodliwość była tak oczywista. Leki zabijały właśnie tych pacjentów, których miały chronić.
NNH = 21. Na każde 21 pacjentów leczonych flekainidem lub enkainidem przypadała jedna osoba, która w przeciwnym razie przeżyłaby.
Lekcja
Gordon Guyatt — wówczas młody kardiolog — osobiście podawał wlewy lidokainy każdemu pacjentowi po zawale serca, który trafił na jego oddział. Postępował zgodnie z najlepszymi praktykami. Został prawidłowo przeszkolony. Miał dobre intencje. A jednak, bez rygorystycznego badania RCT, ani on, ani jego koledzy nie mieli pojęcia, że leczenie jest szkodliwe. To doświadczenie stało się kluczowe dla jego kariery w zakresie medycyny opartej na faktach (EBM). Historia medycyny, jak później powiedział, „jest pełna terapii opartych głównie na domysłach i intuicji, a nie na solidnych dowodach”.
Przed EBM, to, co otrzymywałeś, zależało od miejsca zamieszkania, szpitala, w którym byłeś i lekarza, który cię przyjął. Ten sam pacjent z tą samą chorobą mógł otrzymać zupełnie inne leczenie w Leeds i Londynie. W różnych szpitalach. W różnych krajach. Zupełnie inne rezultaty.
EBM to zmieniło. Opierając decyzje kliniczne na tym samym materiale dowodowym – tych samych badaniach klinicznych, tych samych przeglądach systematycznych, tych samych wytycznych – nadało medycynie wspólny język i wspólny standard. Dziś pacjent zgłaszający się z zawałem serca w Bradford i pacjent zgłaszający się z zawałem serca w Bristolu powinni otrzymać zasadniczo taką samą opiekę opartą na dowodach. Nie dlatego, że lekarze są identyczni, ale dlatego, że leczenie jest ukierunkowane na dowody, a nie na indywidualne preferencje.
W Wielkiej Brytanii jest to realizowane poprzez ŁADNE wytyczneThe Program nauczania RCGP, Wskaźniki QOF, audyty kliniczne, Egzaminy MRCGP — wszystkie z nich wymagają i oceniają praktykę opartą na dowodach. Podczas przystępowania do egzaminu AKT sprawdzana jest umiejętność stosowania tych ram.
🌍 Świat bez EBM — The International Picture
Zaangażowanie Wielkiej Brytanii w EBM – poprzez NICE, NHS i szkolenia podyplomowe – nie jest powszechne. W wielu częściach świata to, co otrzymasz jako pacjent, nadal w dużej mierze zależy od tego, kto Cię przyjmie, gdzie zgłosisz się i ile możesz zapłacić. Zrozumienie tego pomoże Ci docenić, przed czym EBM chroni Twoich pacjentów.
Opisana poniżej odmiana odzwierciedla systemy i struktury opieki zdrowotnej, a nie kompetencje ani zaangażowanie poszczególnych lekarzy. W każdym z wymienionych krajów praktykuje wielu znakomitych, ciężko pracujących lekarzy. Problemem jest brak infrastruktury standaryzującej – wytycznych, nadzoru, ram szkoleniowych – którą zapewnia EBM. Poszczególni lekarze nie są w stanie sami pokonać problemów systemowych.
| Kraj / region | Jak zmienia się praktyka bez solidnych ram EBM |
|---|---|
| 🇮🇳 Indie (sektor prywatny) | 2018 Lancet Badanie wykazało, że odsetek cięć cesarskich wynosi 40–58% w szpitalach prywatnych w porównaniu z 10–14% w placówkach publicznych – często podyktowany zachętami finansowymi, a nie potrzebami klinicznymi. Nadmierna diagnostyka i polipragmazja są powszechnie udokumentowane w sektorze prywatnym. Ten sam pacjent onkologiczny może otrzymać zupełnie inne leczenie w zależności od miejsca zgłoszenia i możliwości finansowych. |
| 🇵🇰 Pakistan | Znaczne zróżnicowanie w przestrzeganiu zaleceń dotyczących antybiotykoterapii – jeden z najwyższych wskaźników przepisywania antybiotyków w Azji Południowej. Bezpośrednimi konsekwencjami są gruźlica lekooporna i oporność na środki przeciwdrobnoustrojowe. Dostęp do opieki specjalistycznej i ujednoliconych ścieżek leczenia jest w dużym stopniu uzależniony od położenia geograficznego i dochodów. |
| 🇳🇬 Nigeria / 🇬🇭 Ghana | Siarczan magnezu to rekomendowany przez WHO, oparty na dowodach naukowych, niedrogi sposób leczenia eklampsji. Badania pokazują, że znacząco zmniejsza śmiertelność matek. Jednak dostępność i faktyczne stosowanie w placówkach w Nigerii i Ghanie jest bardzo zróżnicowane w zależności od zasobów szpitalnych i wykształcenia lekarzy – co oznacza, że to, czy kobieta z eklampsją przeżyje, czy umrze, może zależeć od tego, do której placówki trafi. |
| 🇸🇩 Sudan / 🇮🇶 Irak | Przedłużający się konflikt i niestabilność zdewastowały infrastrukturę opieki zdrowotnej. W Iraku po 2003 roku doszło do załamania publicznej służby zdrowia, wstrzymania wdrażania wytycznych, a dostęp do podstawowych leków stał się uzależniony od regionu geograficznego. W Sudanie konflikt zakłócił programy szczepień, opiekę zdrowotną nad matkami i leczenie chorób przewlekłych. Zróżnicowanie praktyk w takich środowiskach nie jest kwestią preferencji, lecz dostępności. |
| 🇪🇬 Egipt / 🇮🇷 Iran | W obu krajach istnieją uczelnie medyczne kształcące wykwalifikowanych lekarzy i opublikowano wytyczne EBM (medycyny opartej na faktach), ale ich wdrażanie jest niespójne między sektorem publicznym i prywatnym, a także między obszarami miejskimi i wiejskimi. W Iranie sankcje międzynarodowe wpłynęły na dostępność leków, wymuszając dostosowania odbiegające od protokołów opartych na dowodach naukowych. |
| 🇷🇴 Rumunia | Rumunia dokumentuje tę praktykę plicul („koperta”) — nieformalne płatności gotówkowe dla lekarzy i pielęgniarek w celu zapewnienia opieki. Oficjalnie nielegalne, powszechnie praktykowane. Dochodzenia parlamentarne i dziennikarstwo śledcze potwierdziły, że jakość opieki chirurgicznej może zależeć od tego, ile pacjent może zapłacić prywatnie, niezależnie od jego oficjalnych uprawnień równoważnych z NHS. Szacuje się, że drenaż mózgów doprowadził do odejścia ponad 14 000 lekarzy od czasu przystąpienia do UE. |
| 🇺🇸 Stany Zjednoczone | Najdroższa opieka zdrowotna na świecie – ponad 12 000 dolarów na osobę rocznie – a mimo to wyniki leczenia często nie są lepsze niż w Wielkiej Brytanii. Projekt Dartmouth Atlas udokumentował ogromne zróżnicowanie geograficzne w praktyce klinicznej: ten sam pacjent w Miami może otrzymać dwa razy więcej badań i procedur niż ten sam pacjent w Minneapolis, bez różnicy w wynikach leczenia. Badanie JAMA z 2019 roku oszacowało, że 935 miliardów dolarów – około jedna czwarta wszystkich wydatków na opiekę zdrowotną w USA – jest marnowana na niepotrzebną opiekę. Kryzys opioidowy został częściowo napędzany przez firmy farmaceutyczne, które wpływały na praktyki przepisywania leków poza ramami EBM (medycyny opartej na faktach). |
| 🇫🇷 Francja | Francja ma doskonałą opiekę zdrowotną, ale wskaźniki przepisywania antybiotyków historycznie należą do najwyższych w Europie, co wynika częściowo z kulturowych oczekiwań, że konsultacja lekarska zawsze powinna kończyć się wystawieniem recepty. Kampanie mające na celu ograniczenie tego zjawiska („Antybiotyki nie są automatyczne”) pomogły, ale ten trend ilustruje, jak presja kulturowa i komercyjna może przeważać nad opartymi na dowodach zaleceniami, nawet w zaawansowanych systemach. |
| 🇮🇹 Włochy | Jakość opieki zdrowotnej w północnych Włoszech (Mediolan, Bolonia) należy do najlepszych w Europie. W niektórych częściach południowych Włoch sytuacja jest zupełnie inna – dłuższy czas oczekiwania na operację onkologiczną, mniej konsekwentne stosowanie programów badań przesiewowych, niższe przestrzeganie wytycznych opieki zdrowotnej. Pochodzenie geograficzne w obrębie tego samego kraju może znacząco wpływać na wyniki leczenia. |
| 🇬🇷 Grecja / 🇪🇸 Hiszpania | Kryzys oszczędnościowy w Grecji (2010–2015) doprowadził do cięć wydatków na opiekę zdrowotną o ponad 25%, powodując udokumentowane niedobory leków, redukcję personelu i pogorszenie jakości. Ponad 35 000 pracowników służby zdrowia wyemigrowało. W Hiszpanii odnotowano znaczne zróżnicowanie regionalne wskaźników przeżywalności w przypadku raka — rozwijający się guz może zachowywać się inaczej w zależności od regionu, w którym mieszkasz, nie dlatego, że różni się biologia, ale dlatego, że system stosuje leczenie oparte na dowodach naukowych. |
W systemach opieki zdrowotnej, w których nie ma solidnych ram EBM ani powszechnych uprawnień, związek między płatnością a jakością leczenia jest często bezpośredni i udokumentowany:
- W niektórych indyjskich szpitalach prywatnych pacjent zgłaszający się z bólem w klatce piersiowej, który może sobie pozwolić na prywatną opiekę, może otrzymać natychmiastowe cewnikowanie i założenie stentów. Ten sam pacjent w szpitalu publicznym może czekać godzinami na EKG.
- W niektórych częściach Afryki Subsaharyjskiej decyzja o tym, czy dziecko chore na ciężką malarię otrzyma terapię skojarzoną opartą na artemizyninie (standard oparty na dowodach), czy starszy, mniej skuteczny lek, zależy od tego, do jakiej placówki trafi i na ile może sobie pozwolić jego rodzina.
- W krajach, w których nie ma powszechnego dostępu do leków, środki chemioterapeutyczne stosowane w leczeniu raka mogą być dostępne wyłącznie dla osób, które mogą sobie na nie pozwolić, co oznacza, że te same nowotwory mogą mieć zupełnie różne rezultaty w zależności wyłącznie od dochodów.
- W Rumunii i niektórych innych krajach Europy Wschodniej udokumentowano, że jakość zabiegu chirurgicznego — staranność chirurga, jakość nadzoru anestezjologicznego, a nawet dostępność opieki pielęgniarskiej pooperacyjnej — zależy od nieformalnej płatności, a nie od potrzeb klinicznych.
Za każdym razem, gdy wsiadasz do samolotu pasażerskiego, korzystasz z jednego z najskuteczniejszych systemów bezpieczeństwa, jakie kiedykolwiek zbudowali ludzie. Nie dlatego, że poszczególni piloci są wyjątkowo utalentowani – choć tak jest. Ale dlatego, że lotnictwo opiera się na… standaryzowane, sprawdzone pod względem dowodowym protokołyKażdy pilot, każda linia lotnicza, każdy kraj stosuje te same listy kontrolne przed lotem, te same procedury lądowania i te same protokoły awaryjne. System chroni Cię niezależnie od tego, na którego pilota trafisz.
Medycyna bez EBM to lotnictwo bez list kontrolnych. Twoje bezpieczeństwo zależy wyłącznie od tego, czy trafisz na dobrego pilota, czy ten pilot przeszedł szkolenie wystarczająco niedawno, czy ma dobry dzień i czy usłyszał najnowsze pomysły od kogoś, komu ufa.
EBM zastępuje szczęście systemami. Zastępuje „z mojego doświadczenia” „w 15 000 badań z udziałem 2 milionów pacjentów”. Zastępuje opinię osoby, która akurat jest na szczycie hierarchii, nagromadzonymi dowodami zbiorowego doświadczenia klinicznego ludzkości. Czy nie wolałbyś tego dla swoich pacjentów? Czy Twoi pacjenci nie woleliby tego dla siebie?
- Każda wytyczna NICE, którą stosujesz, jest wynikiem systematycznego przeglądu dowodów — ktoś wykonał pracę, aby upewnić się, że to, co robisz, jest poparte najlepszą dostępną wiedzą naukową
- Każde pytanie AKT dotyczące statystyki i metod badawczych sprawdza Twoją zdolność do krytycznej oceny dowodów — bycia aktywnym odbiorcą EBM, a nie biernym naśladowcą instrukcji
- Kiedy wyjaśniasz pacjentowi NNT, omawiasz ograniczenia badania przesiewowego lub odmawiasz przepisania antybiotyku, który nie jest wskazany, praktykujesz EBM — świadomie, wyraźnie i rozsądnie
- A gdy przedstawiciel firmy farmaceutycznej siedzi naprzeciwko ciebie i mówi ci, że jego nowy lek zmniejsza ryzyko wystąpienia zdarzeń sercowo-naczyniowych o 35%, twoje pierwsze pytanie – „35% względne czy bezwzględne?” – to pytanie, którego medycyna EBM uczyła się zadawać
Projekty badań i hierarchia dowodów
Zanim zinterpretujesz jakikolwiek wynik, musisz wiedzieć Skąd to pochodziRóżne modele badań odpowiadają na różne pytania, generują różne statystyki i charakteryzują się różnym poziomem wiarygodności.
Piramida Dowodów
Najsilniejsze dowody na górze, najsłabsze na dole
⬆ Najsilniejsze dowody | ⬇ Najsłabsze dowody
| Projekt badania | Kierunek | Najlepsze dla: | Generuje | Kluczowa słabość |
|---|---|---|---|---|
| Przegląd systematyczny / metaanaliza | Do | Najlepszy ogólny dowód na dane pytanie | Połączona wielkość efektu | Tylko tak dobre, jak badania podstawowe; heterogeniczność |
| RCT (randomizowane badanie kontrolowane) | Naprzód | Czy leczenie X jest skuteczne? | RR, ARR, NNT | Drogie, sztuczne otoczenie, kwestie etyczne |
| Badanie kohortowe | Do przodu (prospektywnie) lub do tyłu (retrospektywnie) | Czy ekspozycja powoduje skutki? Częstość występowania? | Ryzyko względne (RR), częstość występowania | Wyczerpywanie się; kosztowne w dłuższej perspektywie; mylące |
| Badanie typu „przypadek-kontrola” | Do tyłu | Choroby rzadkie; czynniki ryzyka | Współczynnik szans (OR) | Błąd przypominania; nie można bezpośrednio obliczyć częstości występowania |
| Badanie przekrojowe | Pojedyncza migawka | Jak powszechne jest obecnie X? (częstość występowania) | Rozpowszechnienie | Nie można ustalić związku przyczynowo-skutkowego; niejednoznaczność czasowa |
| Raport przypadku / Opinia eksperta | Do | Generowanie hipotez; rzadkie zdarzenia | Tylko opis | Wysoce podatny na stronniczość, nieuogólnialny |
📖 Badania jakościowe a ilościowe
Odpowiada na pytania „ile” lub „ile”. Wykorzystuje liczby, statystyki i dane strukturalne. Przykłady: RCT, badania kohortowe, ankiety z wynikami liczbowymi. Generuje wartości p, przedziały ufności, NNT.
Odpowiada na pytania „dlaczego” lub „jak”. Używa słów, tematów i wywiadów. Przykłady: grupy fokusowe, badania etnograficzne, teoria ugruntowana. Analizuje doświadczenia i przekonania pacjentów.
Przegląd systematyczny kontra metaanaliza – to nie to samo
Przegląd systematyczny: Rygorystyczne, ustrukturyzowane przeszukiwanie literatury, które identyfikuje, wybiera i krytycznie ocenia wszystkie istotne badania dotyczące danego zagadnienia. Rezultatem jest jakościowe podsumowanie dowodów.
Metaanaliza: Przegląd systematyczny, który idzie o krok dalej — matematycznie łączy Wyniki ilościowe z wielu badań można łączyć w jedną, łączoną ocenę. Nie wszystkie przeglądy systematyczne obejmują metaanalizę (np. jeśli badania są zbyt heterogeniczne, aby je łączyć).
🔄 Struktura PICO
PICO to standardowa struktura pytań w badaniach klinicznych — stosowana przy przeszukiwaniu literatury i projektowaniu badań.
| List | Oznacza | Przykład |
|---|---|---|
| P | Populacja / Pacjent | Dorośli z cukrzycą typu 2 |
| I | Interwencja | Inhibitory SGLT2 |
| C | Porównanie | Metformina sama |
| O | Wynik | Zdarzenia sercowo-naczyniowe w wieku 5 lat |
🎲 Cechy projektu RCT (często testowane)
| Cecha | Co to znaczy | Dlaczego jest to ważne |
|---|---|---|
| Randomizacja | Uczestnicy przydzielani do grup losowo | Eliminuje błędy selekcji, równoważy czynniki zakłócające |
| Pojedyncza ślepa | Uczestnicy nie znają swojego przydziału | Zmniejsza efekt placebo i stronniczość uczestników |
| Podwójna roleta | Ani uczestnicy, ani badacze nie znają przydziału | Eliminuje stronniczość obserwatora ORAZ stronniczość uczestnika |
| Potrójna ślepa próba | Uczestnicy, badacze ORAZ analitycy danych nie mieli wiedzy | Maksymalna redukcja odchyleń |
| Zamiar Leczenia (ITT) | Analizowano w oryginalnej grupie niezależnie od przestrzegania | Zachowuje randomizację; odzwierciedla rzeczywiste wykorzystanie |
| Zgodnie z protokołem | Analizowano tylko wtedy, gdy ukończono protokół | Wykazuje skuteczność biologiczną, ale przecenia korzyści w świecie rzeczywistym |
| Projekt zwrotnicy | Uczestnicy otrzymują oba zabiegi w kolejności | Każda osoba działa jako własna kontrola, potrzebny jest okres wypłukiwania |
| Ukrywanie alokacji | Osoba rekrutująca uczestników nie może zobaczyć, do której grupy zostanie przydzielony kolejny uczestnik, dopóki: po zostali zapisani | Zapobiega podświadomemu (lub celowemu) przydzielaniu przez rekrutera zdrowszych pacjentów do grupy leczonej – jest to forma błędu selekcji, której sama randomizacja nie zapobiega |
| Klastrowe RCT | Całe grupy (np. gabinety lekarzy rodzinnych, oddziały, szkoły) są dobierane losowo, a nie indywidualnie | Stosowana, gdy randomizacja indywidualna jest niepraktyczna (np. w przypadku testowania nowego stylu konsultacji). Wymaga większych rozmiarów próby i korekty statystycznej w celu uwzględnienia efektu klastrowania. |
Zamiar leczenia daje więcej konserwatywny (niższa) ocena skuteczności — ponieważ obejmuje uczestników nieprzestrzegających zaleceń. Jest to preferowana analiza w decyzjach klinicznych. Zgodnie z protokołem, przecenia skuteczność, ale jest przydatna do zrozumienia mechanizmu biologicznego.
⚖️ Badania wyższości, niegorszości i równoważności
Nie wszystkie badania kliniczne zadają to samo pytanie. AKT od czasu do czasu sprawdza, czy rozumiesz, co badanie kliniczne faktycznie miało na celu wykazać – i dlaczego ma to znaczenie przy interpretacji jego wyników.
| Typ próbny | Zadane pytanie | Wspólny kontekst |
|---|---|---|
| Badanie wyższości | „Czy nowe leczenie lepiej komparator?" | Większość standardowych RCT — testowanie naprawdę nowego leku lub podejścia |
| Badanie niegorszości | „Czy nowe leczenie nie gorzej niż porównawczy o więcej niż określony z góry niewielki margines?" | Nowy lek z mniejszą liczbą skutków ubocznych, niższym kosztem lub łatwiejszym podawaniem — celem jest pokazanie, że jest „wystarczająco dobry” |
| Badanie równoważności | „Czy te dwa zabiegi zasadniczo to samo?" | Leki biopodobne; leki generyczne; różne drogi podania |
Nowy antykoagulant może okazać się „nie gorszy” od warfaryny w profilaktyce udaru mózgu – nie lepszy, ale nie istotnie gorszy – a jednocześnie łatwiejszy w stosowaniu (brak monitorowania INR). To klinicznie cenne odkrycie, nawet jeśli lek nie „pokonał” warfaryny. AKT może poprosić o prawidłową interpretację wyników badania niegorszości.
Badanie niegorszości, które nie wykazuje „żadnej istotnej różnicy”, to nie to samo, co badanie przewagi, które wykazuje „brak istotnej różnicy”. W badaniu przewagi, wynik nieistotny oznacza, że nie udało się udowodnić, że nowy lek działa lepiej. W badaniu niegorszości, wynik nieistotny to dokładnie to, na co liczyłeś.
Błąd badawczy, trafność i rzetelność
| Rodzaj stronniczości | Definicja | Jakie projekty badawcze? | Jak to zmniejszyć |
|---|---|---|---|
| Odchylenie selekcji | Uczestnicy nie są reprezentatywni dla populacji docelowej | Wszystkie typy | Randomizacja; staranne dobieranie próbek |
| Przypomnij sobie stronniczość | Osoby chore (przypadki) pamiętają wcześniejsze narażenia wyraźniej niż osoby z grupy kontrolnej | Badania kliniczno-kontrolne | Obiektywne źródła danych; standaryzowane pytania |
| Stronniczość publikacji | Badania pozytywne/znaczące są publikowane częściej niż badania negatywne | Metaanalizy (wykryte za pomocą wykresu lejkowego) | Rejestracja próbna; przeszukanie literatury szarej |
| Błąd odejścia | Utrata uczestników w trakcie obserwacji zniekształca wyniki (osoby, które zrezygnowały, różnią się od tych, które ukończyły badanie) | Badania kohortowe, RCT | Analiza ITT; minimalizacja liczby osób rezygnujących z leczenia |
| Błąd czasu realizacji | Badania przesiewowe dają iluzję lepszego przeżycia dzięki wcześniejszemu wykryciu choroby | Badania przesiewowe | Użyj śmiertelności specyficznej dla danej choroby, a nie przeżywalności od momentu diagnozy |
| Odchylenie długości | Badania przesiewowe pozwalają wykryć wolniej rozwijającą się (mniej agresywną) chorobę | Badania przesiewowe | RCT z wynikami specyficznymi dla danej choroby |
| Błąd obserwatora/oceny | Wiedza o przydziale leczenia wpływa na ocenę wyników | RCTs | Oślepiające (pojedyncze, podwójne, potrójne) |
| Efekt Hawthorne | Uczestnicy zmieniają swoje zachowanie, ponieważ wiedzą, że są obserwowani | Wszystkie typy, zwłaszcza obserwacyjne | Grupy kontrolne; obserwatorzy niewidomi |
| Błąd weryfikacji | Tylko pacjenci z pozytywnym wynikiem testu przechodzą test potwierdzający, który jest złotym standardem — czułość wydaje się więc fałszywie wysoka, a swoistość fałszywie niska | Badania testów diagnostycznych | Upewnij się, że wszyscy pacjenci (zarówno z wynikiem pozytywnym, jak i negatywnym) zostaną poddani testowi stanowiącemu złoty standard |
| Mylące | Trzecia zmienna jest powiązana zarówno z ekspozycją, jak i wynikiem, co zniekształca pozorną zależność | Badania obserwacyjne | Randomizacja (RCT); stratyfikacja; analiza wieloczynnikowa |
🔀 Zaskakujące — gdy dwie rzeczy wydają się być powiązane, ale tak nie jest
Zjawisko zakłócania to jedno z najważniejszych pojęć w metodologii badań — i jeden z najczęstszych powodów, dla których pozornie przekonujące wyniki obserwacji okazują się błędne. Kluczowa myśl jest prosta: dwie rzeczy mogą wydawać się powiązane nie dlatego, że bezpośrednio na siebie wpływają, ale dlatego, że obie są powiązane z ukrytą trzecią zmienną.
A czynnik zakłócający (lub zmienna zakłócająca) jest trzecią zmienną, która jest niezależnie powiązana z obie ekspozycja oraz wynik. Tworzy pozorne (fałszywe) skojarzenie — lub maskuje prawdziwe — między ekspozycją a badanym wynikiem.
Klasyczne przykłady
| Widoczne połączenie | Zakłócacz | Dlaczego to wszystko wyjaśnia |
|---|---|---|
| Sprzedaż lodów → utonięcia | Gorąca pogoda (lato) | Upały powodują zarówno więcej jedzenia lodów, jak i więcej pływania → więcej utonięć. Lody nie powodują utonięć. |
| Picie kawy → rak płuc | Palenie | Palacze piją średnio więcej kawy. Wczesne badania wiązały kawę z rakiem — dopóki nie zaczęto kontrolować palenia. |
| Noszenie lżejszej → rak płuc | Palenie | Palacze noszą zapalniczki. Zapalniczka nie ma żadnego wpływu biologicznego, w przeciwieństwie do palenia. |
| Siwe włosy → choroba serca | Wiek | Zarówno siwienie włosów, jak i choroby serca nasilają się z wiekiem. Czynnikiem zakłócającym jest wiek, a nie kolor włosów. |
| Rozmiar buta → zdolność czytania (u dzieci) | Wiek | Starsze dzieci mają większe stopy I lepiej czytają. Wiek wyjaśnia oba te zjawiska. |
Zmienna jest czynnikiem zakłócającym, jeżeli spełnia wszystkie trzy z tych:
- Jest to związane z ekspozycja (rzecz, którą studiujesz)
- Jest to związane z wynik (wynik, który mierzysz)
- Jest nie na drodze przyczynowo-skutkowej między narażeniem a skutkiem (jest to odrębna trzecia zmienna, a nie krok pomiędzy)
- Randomizacja (w RCT) — rozkłada znane i nieznane czynniki zakłócające równo między grupami. To najsilniejsza ochrona.
- Ograniczenie — zapisuj tylko uczestników, którzy mają podobny czynnik zakłócający (np. tylko osoby niepalące w badaniu dotyczącym kawy)
- Dopasowywanie — przypadki par i kontrole zmiennej zakłócającej
- Stratyfikacja — analizuj wyniki osobno dla każdego poziomu czynnika zakłócającego
- Wielowymiarowa korekta statystyczna — statystycznie uwzględnić jednocześnie wiele czynników zakłócających
W dobrze przeprowadzonym RCT randomizacja rozkłada czynniki zakłócające (zarówno znane, jak i nieznane) równomiernie między grupami, eliminując czynnik zakłócający jako wyjaśnienie różnic. W badaniach kohortowych i badaniach typu przypadek-kontrola można korygować tylko o czynniki zakłócające, o których się wie i które zmierzono. Niezmierzone czynniki zakłócające zawsze pozostają potencjalnym wyjaśnieniem zaobserwowanego związku – dlatego badania obserwacyjne nigdy nie mogą definitywnie udowodnić związku przyczynowo-skutkowego.
✅ Ważność i niezawodność — jaka jest różnica?
Czy badanie mierzy to, co rzekomo mierzy w badanej populacji? Czy wyniki to Czy badanie jest wiarygodne? Zagrożone stronniczością i wprowadzaniem w błąd.
Czy wyniki można odnieść do innych populacji lub rzeczywistych warunków? Badanie RCT z ścisłą kontrolą przeprowadzone w ośrodku specjalistycznym może nie odzwierciedlać tego, co dzieje się w podstawowej opiece zdrowotnej.
Czy test daje spójne wyniki po powtórzeniu w tych samych warunkach? Pomiaru dokonuje się za pomocą rzetelności między oceniającymi (statystyka Kappa) lub rzetelności testu-powtórnego.
Mierzy zgodność między dwoma oceniającymi w stopniu wykraczającym poza przypadek. κ = 1 (doskonała zgodność); κ = 0 (zgodność nie lepsza niż przypadkowa); κ < 0 (gorsza niż przypadkowa).
Pomiar ryzyka i efektów leczenia
To jest obszar najbardziej testowany w statystyce AKT. Musisz znać te wzory na pamięć i umieć je zastosować do tabel danych testowych w warunkach egzaminacyjnych.
Kluczowe wskaźniki
📊 Interpretacja NNT — co tak naprawdę oznaczają te liczby?
NNT informuje Cię, ilu pacjentów musisz leczyć pierwszej aby skorzystać. Więc mniej Im więcej pacjentów trzeba leczyć, aby uzyskać jedną korzyść, tym skuteczniejsze jest leczenie. NNT = 2 oznacza, że 1 na 2 pacjentów odnosi korzyść — to doskonały wynik. NNT = 100 oznacza, że tylko 1 na 100 korzyści — znacznie słabszy wynik.
| Zasięg NNT | Szorstka interpretacja | Przykładowy kontekst |
|---|---|---|
| <10 | Bardzo skuteczne | Antybiotyki na niektóre infekcje; niektóre ostre metody leczenia |
| 10 - 50 | Umiarkowany efekt | Wiele powszechnie stosowanych leków zapobiegawczych |
| > 100 | Słaby efekt | Niektóre strategie zapobiegawcze na poziomie populacji |
Te progi są nie z NICE lub RCGP — są to jedynie wstępne pomoce dydaktyczne. „Właściwy” NNT zawsze zależy od kontekstu:
- NNT z 100 może być nadal warte zachodu jeśli zapobiegniętym skutkiem jest śmierć lub poważne i nieodwracalne uszkodzenie ciała
- NNT z 5 może być nie do przyjęcia jeśli leczenie powoduje częste lub poważne skutki uboczne
Zasada jednolinijkowa: NNT informuje, ilu pacjentów leczysz, aby jeden odniósł korzyść – niższy = silniejszy efekt. Zawsze jednak bierz to pod uwagę w kontekście powagi skutków i obciążenia leczeniem.
Jeżeli 60 na 100 pacjentów odniesie korzyść, to ARR wynosi 60% (= 0.6), co daje NNT = 1 ÷ 0.6 ≈ 1.7 — doskonały wynik. NNT to nie liczba osób, które skorzystają, to liczba osób, które leczysz, aby uzyskać pierwszej zasiłek.
📖 Współczynnik szans i współczynnik ryzyka — kiedy się ich używa?
| Zmierzyć | Używany w | Interpretacja |
|---|---|---|
| Ryzyko względne (RR) | Badania kohortowe, RCT | Bezpośrednio porównuje ryzyko w dwóch grupach. Bardziej intuicyjny niż OR. |
| Współczynnik szans (OR) | Badania kliniczno-kontrolne | Porównuje prawdopodobieństwo narażenia w przypadkach zachorowań i w grupie kontrolnej. Przybliża ryzyko narażenia, gdy choroba występuje rzadko. |
| Współczynnik ryzyka (HR) | Analiza przeżycia (czas do zdarzenia) | Podobnie jak RR, ale uwzględnia jeśli chodzi o komunikację i motywację zdarzenia następują w czasie. HR <1 = zmniejszone ryzyko w grupie leczonej. |
W przypadku chorób powszechnych iloraz szans (OR) przecenia ryzyko w porównaniu z RR. W przypadku chorób rzadkich (częstość występowania <10%) są one mniej więcej równe. Badanie typu „przypadek-kontrola” generuje iloraz szans (OR) – Urządzenia główne i akcesoria z jednego modelu nie mogą być używane z innym modelem, a modeli MXNUMX/MXNUMX nie można rozbudować do wersji MXNUMX. bezpośrednio obliczyć częstość występowania lub RR na podstawie badania typu „przypadek-kontrola”.
🧮 Przykład praktyczny — obliczanie NNT na podstawie danych próbnych
🎯 Scenariusz: Badanie statyn
Badanie RCT trwające 5 lat wykazało, że wśród pacjentów z grupy wysokiego ryzyka sercowo-naczyniowego: zawał serca wystąpił u 6% pacjentów w grupie placebo, w porównaniu do 4% w grupie statyn.
Leczenie 50 pacjentów przez 5 lat w celu zapobieżenia 1 zawałowi serca
Brzmi imponująco! Ale całkowita korzyść to tylko 2%.
W grupie przyjmującej statyny ryzyko wyniosło 67% ryzyka w porównaniu z grupą placebo, co stanowi względną redukcję na poziomie 33%.
Kiedy pacjent pyta: „Czy ta statyna mi pomoże?”, użyj NNT. „Jeśli 50 osób takich jak ty będzie brać tę tabletkę przez 5 lat, zapobiegnie to jednemu zawałowi serca. Dla ciebie osobiście oznacza to 2% bezwzględnej korzyści”. To o wiele bardziej uczciwe niż „Zmniejsza ryzyko o 33%”.
💬 Informowanie pacjentów o ryzyku (AKT Favourite)
AKT często sprawdza, jak wyjaśnić pacjentom informacje statystyczne. Istnieją cztery główne formaty:
| Format: | Przykład | Najlepsze dla: |
|---|---|---|
| Naturalna frekwencja | „5 na 100 osób” | Najłatwiejsze do zrozumienia dla pacjentów |
| Odsetek | „5% ludzi” | Szeroko stosowane, ale może wprowadzać w błąd |
| NNT | „Leczyć 20, aby zapobiec 1 zdarzeniu” | Komunikuje jasno absolutne korzyści |
| Działka Catesa | Siatka wizualna 100 twarzy | Najlepsza pomoc wizualna do wspólnego podejmowania decyzji |
Stwierdzenie „zmniejsza to ryzyko o 33%” bez podania ryzyka bazowego jest mylące. 33% RRR w stosunku do 0.3% oznacza, że bezwzględna korzyść wynosi 0.1%. Zawsze należy łączyć RRR z ryzykiem bazowym lub podawać ARR/NNT.
💊 Trik przedstawiciela firmy farmaceutycznej – jak firmy farmaceutyczne manipulują statystykami
Przedstawiciele firm farmaceutycznych są szkoleni w zakresie prezentowania danych z badań w jak najkorzystniejszym świetle. Stosują prostą, ale skuteczną sztuczkę statystyczną:
- Korzyści → podane jako względna redukcja ryzyka (RRR) — ponieważ brzmi to bardziej imponująco i potężniej
- Szkody → cytowane jako bezwzględny wzrost ryzyka (ARI) — ponieważ brzmi mniej groźnie i mniej niepokojąco
Przykład praktyczny — wizyta fikcyjnej przedstawicielki ds. statyn
Nowa statyna zmniejsza ryzyko zawałów serca o 2% do 1% w ciągu 5 lat, ale zwiększa ryzyko miopatii o 1% do 2%.
| Co mówi przedstawiciel | Co to właściwie oznacza |
|---|---|
| „Ten lek zmniejsza liczbę zawałów serca o 50%" | RRR = 50% — ale ARR wynosi tylko 1%. NNT = 100. Leczyć 100 osób przez 5 lat, aby zapobiec 1 zawałowi serca. |
| Ryzyko miopatii wzrasta jedynie o 1%" | ARI = 1% — ale tak naprawdę to podwojenie ryzyka miopatii (względny wzrost ryzyka = 100%). |
Antidotum: zawsze pytaj — „Jaka jest zasadnicza różnica?” Gdy przedstawiciel handlowy podaje wartość względną, przelicz ją samodzielnie: ARR = CER − EER, następnie NNT = 1 ÷ ARR. Dotyczy to również świadczeń. oraz szkodzi.
Testy diagnostyczne i badania przesiewowe — tabela 2×2
Tabela kontyngencji 2×2 stanowi podstawę wszelkich statystyk diagnostycznych. Jeśli potrafisz ją zbudować i odczytać, będziesz w stanie odpowiedzieć na większość pytań diagnostycznych AKT.
Stół 2×2
| RZECZYWISTY STAN CHOROBY | ||
|---|---|---|
| WYNIK TESTU | Choroba Teraźniejszość | Choroba Nieobecny |
| Test pozytywny | Prawdziwie pozytywne (TP) Test wskazuje TAK → ma chorobę ✓ |
Fałszywy wynik pozytywny (FP) Test mówi TAK → brak choroby ✗ |
| Test negatywny | Fałszywy negatywny (FN) Test mówi NIE → ma chorobę ✗ |
Prawdziwie negatywna (TN) Test mówi NIE → brak choroby ✓ |
🧠 SnNout i SpPin — pomoce pamięciowe (i dlaczego działają)
Snna zewnątrz: bardzo Sentest sytuacyjny, jeśli Nujemne, rządzi chorobą wyczerpane.
Jeśli czułość jest bardzo wysoka, wynik ujemny testu oznacza, że choroba jest bardzo mało prawdopodobna (niski wskaźnik wyników fałszywie ujemnych). Użyj czułego testu do badania przesiewowego i wykluczenia choroby.
Spw: Bardzo Sptest bezpieczeństwa, jeśli Ppozytywny, rządzi chorobą In.
Jeśli swoistość jest bardzo wysoka, pozytywny wynik testu oznacza, że choroba jest bardzo prawdopodobna (niski wskaźnik wyników fałszywie dodatnich). Użyj specyficznego testu, aby potwierdzić diagnozę.
📊 Wpływ rozpowszechnienia na PPV i NPV — krytyczny temat AKT
To jedna z najważniejszych i najdokładniej przetestowanych koncepcji w statystyce diagnostycznej. Czułość i swoistość to stałe właściwości testu. Jednak wartość predykcyjna dodatnia (PPV) i wartość bieżąca dodatnia (NPV) zmieniają się diametralnie w zależności od częstości występowania choroby w badanej populacji.
| Scenariusz | Rozpowszechnienie | PPV | NPV |
|---|---|---|---|
| Badanie przesiewowe populacji ogólnej w kierunku rzadkich chorób (np. HIV u osób o niskim ryzyku) | 1% | NISKI (~16%) | WYSOKI (~99.9%) |
| Badanie w klinice specjalistycznej wysokiego ryzyka | 50% | WYSOKI (~95%) | WYSOKI (~95%) |
- W miarę rozpowszechnienia ↑ → PPV ↑, NPV ↓
- W miarę rozpowszechnienia ↓ → PPV ↓, NPV ↑
- W populacji o niskiej częstości występowania większość wyników pozytywnych to wyniki fałszywie dodatnie (niska wartość predykcyjna dodatnia) — nawet w przypadku testu o wysokiej specyficzności
- Negatywny wynik testu w populacji o wysokiej częstości występowania choroby może nadal nie wykryć jej (niższa wartość NPV)
📐 Współczynniki prawdopodobieństwa — gdy chcesz pójść dalej
Współczynniki wiarygodności (LR) łączą czułość i swoistość w jedną wartość, która informuje, o ile wynik testu zmienia prawdopodobieństwo choroby. Bardziej zaawansowane niż PPV/NPV, ale przydatne — i czasami testowane w AKT.
| LR+ | Wpływ na prawdopodobieństwo po teście |
|---|---|
| > 10 | Duży i często decydujący wzrost prawdopodobieństwa |
| 5-10 | Umiarkowany wzrost |
| 2-5 | Mały wzrost |
| 1 | Brak zmian (test jest bezużyteczny) |
| 0.1-0.5 | Niewielki do umiarkowanego spadek |
| Duży spadek — silne wykluczenie negatywne |
Statystyka populacji i epidemiologia
📊 Standaryzowany współczynnik umieralności (SMR)
| Wartość SMR | Interpretacja |
|---|---|
| = 100 | Śmiertelność taka sama jak w populacji odniesienia |
| > 100 | Nadmierna śmiertelność (wyższa niż oczekiwano) |
| <100 | Niższa niż oczekiwano śmiertelność |
🎯 Badanie przesiewowe — błąd czasu realizacji i długości (kluczowe pułapki AKT)
Badania przesiewowe wykrywają chorobę wcześniej, co sprawia wrażenie poprawy przeżywalności – nawet jeśli pacjent umiera w tym samym momencie. „Czas przeżycia od diagnozy” został po prostu wydłużony dzięki wczesnemu wykryciu, a nie dzięki rzeczywistym korzyściom płynącym z leczenia. Pacjent nie żyje dłużej; po prostu wie o chorobie dłużej.
Programy badań przesiewowych z większym prawdopodobieństwem wykrywają wolno rozwijającą się, indolentną chorobę (która ma dłuższą „wykrywalną fazę przedkliniczną”) niż agresywną chorobę o szybkim przebiegu. To sprawia, że badania przesiewowe wydają się skuteczniejsze niż są w rzeczywistości w przypadku ciężkich postaci choroby.
✅Kryteria przesiewowe Wilsona i Jungnera
Przed wprowadzeniem programu badań przesiewowych powinien on spełniać kryteria Wilsona i Jungnera (pierwotnie opublikowane w 1968 roku, nadal stanowiące standard). Test AKT sprawdza zarówno znajomość tych kryteriów, jak i ich zastosowanie w konkretnych scenariuszach.
| # | Kryterium | Co to oznacza w praktyce |
|---|---|---|
| 1 | Ważny problem zdrowotny | Stan ten wiąże się ze znaczną zachorowalnością lub śmiertelnością — warto podjąć wysiłek w celu przeprowadzenia badań przesiewowych |
| 2 | Dostępne akceptowane leczenie | Nie ma sensu wykrywać choroby, której nie można leczyć |
| 3 | Istnieją placówki diagnostyczne i lecznicze | Przed uruchomieniem musi być gotowa infrastruktura |
| 4 | Rozpoznawalny etap utajony lub wczesny | Choroba musi mieć wykrywalną fazę przedobjawową |
| 5 | Dostępny odpowiedni test | Test musi być akceptowalny dla populacji, bezpieczny i w miarę dokładny |
| 6 | Test akceptowalny dla populacji | Ludzie muszą być gotowi się na to poddać – inwazyjne lub niewygodne testy mogą zniechęcić do podjęcia leczenia |
| 7 | Historia naturalna właściwie zrozumiana | Trzeba wiedzieć, jak choroba postępuje, jeśli nie jest leczona |
| 8 | Uzgodniona polityka dotycząca tego, kogo leczyć | Potrzebne są jasne protokoły — nie tylko wykrywanie, ale także to, co dzieje się dalej |
| 9 | Opłacalność | Koszty znalezienia każdej sprawy muszą być zrównoważone z korzyściami |
| 10 | Proces ciągły, nie jednorazowy | Badania przesiewowe muszą być ciągłe, ponieważ zachorowalność nadal rośnie |
Badanie PSA w kierunku raka prostaty to nie jest częścią krajowego programu badań przesiewowych NHS właśnie dlatego, że ma problemy z kryteriami 5 i 7: PSA nie jest wystarczająco dokładnym testem (niska swoistość → wiele wyników fałszywie dodatnich), a naturalny przebieg wielu nowotworów prostaty o niskim stopniu złośliwości oznacza, że nigdy nie wywołają one objawów w ciągu życia pacjenta. To bezpośrednio prowadzi do naddiagnostyki (patrz poniżej).
🔍 Nadmierna diagnostyka — znajdowanie problemów, które nie spowodowałyby problemów
Naddiagnozowanie ma miejsce, gdy wykryta zostanie prawdziwa choroba — taka, która rzeczywiście istnieje — ale ta choroba nigdy nie powodowały objawów, szkód ani śmierci w ciągu życia pacjenta, jeśli nie zostanie wykryty. Nie jest to wynik fałszywie dodatni (choroba jest prawdziwa); jest to wynik prawdziwie dodatni, którego nie trzeba było wykrywać.
Naddiagnozowanie zamienia zdrowych ludzi w pacjentów. Naraża ich na lęk, skutki uboczne i ryzyko leczenia schorzenia, które nigdy by im nie zaszkodziło. To jedna z największych szkód programów przesiewowych – i to właśnie test AKT bezpośrednio je wykrywa.
| Stan | Przykład naddiagnostyki |
|---|---|
| Rak prostaty | Wiele nowotworów o niskim stopniu złośliwości wykrytych za pomocą PSA nigdy nie rozwija się i nie powoduje objawów — mężczyźni umierają w ich, nie od im |
| Rak tarczycy | Badanie USG pozwala wykryć niewielkie brodawkowate nowotwory tarczycy, które są niemal zawsze łagodne – wykrywalność wzrosła, ale śmiertelność pozostała bez zmian |
| DCIS (piersi) | Rak przewodowy in situ wykryty mammografią — niektóre nowotwory nigdy nie staną się rakiem inwazyjnym |
Nadmierna diagnoza = znalezienie choroby, której znalezienie nie było konieczne. Nadmierne leczenie = leczenie choroby, która nie wymagała leczenia (co może być następstwem naddiagnostyki lub występować niezależnie). Są to powiązane, ale odrębne pojęcia.
🔢 Standaryzacja wieku
Porównując wskaźniki zachorowań lub śmiertelności między różnymi populacjami (np. w różnych krajach, różnych okresach), należy uwzględnić fakt, że populacje te mogą mieć różny rozkład wiekowy. Osoby starsze będą naturalnie charakteryzować się wyższą śmiertelnością, nawet jeśli ich stan zdrowia jest równie dobry.
Standaryzacja wieku to technika statystyczna, która eliminuje zniekształcający wpływ różnych rozkładów wiekowych podczas porównywania wyników zdrowotnych między populacjami. Pozwala ona uzyskać wskaźnik, który byłby obserwowany, gdyby obie populacje miały tę samą strukturę wiekową („populacja standardowa”).
🎗️ Statystyki dotyczące raka — najważniejsze informacje AKT
AKT od czasu do czasu bada konkretne statystyki dotyczące raka. Nie potrzebujesz dogłębnej wiedzy onkologicznej — ale te najważniejsze liczby się pojawiają i warto je znać.
| Rak | Kluczowa statystyka | Dlaczego jest to ważne |
|---|---|---|
| Rak jąder | >98% 10-letniego przeżycia | Jeden z najłatwiej uleczalnych nowotworów – ważna informacja dla młodych mężczyzn udzielających porad |
| Rak płuc | Główna przyczyna zgonów z powodu raka (Wielka Brytania) | Mimo że nie jest to najczęstszy nowotwór, zabija więcej osób niż jakikolwiek inny |
Rak może mieć wysoki padanie (powszechne), ale niskie śmiertelność (uleczalny), jak rak piersi. Może też mieć niższą zapadalność, ale bardzo wysoką śmiertelność, jak rak trzustki. Test AKT może sprawdzić Twoją zdolność do prawidłowej interpretacji statystyk dotyczących raka — nie zakładaj, że najczęstszy rak jest najbardziej śmiertelny.
⚖️ Nierówności w dostępie do opieki zdrowotnej
Nierówności zdrowotne opisują niesprawiedliwe, możliwe do uniknięcia różnice w zdrowiu między różnymi grupami ludzi. Stanowią one istotny punkt ciężkości brytyjskiej polityki zdrowia publicznego i pojawiają się w AKT w kontekście epidemiologii i społecznych uwarunkowań zdrowia.
Nierówności w zakresie opieki zdrowotnej są niesprawiedliwe, możliwe do uniknięcia różnice w stanie zdrowia lub w rozkładzie czynników determinujących zdrowie pomiędzy różnymi grupami populacjiMożna ich „uniknąć”, ponieważ wynikają z warunków społecznych, ekonomicznych lub środowiskowych, które w zasadzie można zmienić, a nie z przypadku czy zmienności biologicznej.
| Typ | Przykłady w Wielkiej Brytanii |
|---|---|
| Społeczno-ekonomiczny | Niższa średnia długość życia w obszarach dotkniętych ubóstwem; wyższy wskaźnik chorób układu krążenia, cukrzycy i chorób psychicznych w biedniejszych społecznościach |
| Geograficzny | „Podział Północ-Południe” – gorsze wyniki zdrowotne w częściach północnej Anglii w porównaniu z Południem |
| Etniczny | Wyższy wskaźnik zachorowań na cukrzycę typu 2 w populacjach Azji Południowej; wyższe ryzyko chorób sercowo-naczyniowych w populacjach czarnoskórych |
| Płeć | Mężczyźni mają krótszą oczekiwaną długość życia, ale kobiety żyją dłużej w złym stanie zdrowia (zachorowalność) |
Dystrybucja danych i znaczenie statystyczne
Miary tendencji centralnej
| Zmierzyć | Definicja | Najlepiej stosować, kiedy | Uważaj |
|---|---|---|---|
| Oznaczać | Suma wszystkich wartości ÷ liczba wartości | Dane są rozłożone normalnie | Łatwo ulega przekłamaniom przez wartości odstające |
| Mediana | Wartość środkowa po posortowaniu w kolejności. Jeśli istnieje liczba parzysta W przypadku wartości mediana jest średnią dwóch środkowych liczb. | Dane zniekształcone (np. dochód, długość pobytu w szpitalu) | Ignoruje rzeczywiste wartości w skrajnych punktach |
| Moda | Najczęściej występująca wartość | Dane kategoryczne; rozkłady bimodalne | Może być bezsensowne w przypadku danych ciągłych |
| łodzie | Maksimum − Minimum | Szybkie poczucie rozprzestrzeniania się | Całkowicie zdeterminowane przez wartości odstające |
| IQR (zakres międzykwartylowy) | 75. percentyl − 25. percentyl | W połączeniu z medianą dla danych skośnych | Ignoruje górne i dolne 25% |
| Odchylenie standardowe (SD) | Średnia różnica od średniej | Dane o rozkładzie normalnym | Wprowadzające w błąd, jeśli dane nie są rozłożone normalnie |
🗂️ Typy danych — nominalne, porządkowe, interwałowe, ilorazowe
Zrozumieć co rodzaj Ilość posiadanych danych decyduje o tym, które statystyki podsumowujące i które testy statystyczne są odpowiednie. Test AKT weryfikuje to — zazwyczaj poprzez prezentację zbioru danych i zapytanie, jakiego testu lub miary użyć.
| Typ | Definicja | Przykłady | Analogia |
|---|---|---|---|
| Nominalny | Kategorie bez naturalnego porządku | Grupa krwi (A, B, AB, 0); płeć; kolor oczu; przyczyna zgonu | Miska z owocami – jabłka i banany są po prostu różne, żadne z nich nie jest „bardziej” |
| Porządkowy | Kategorie uporządkowane, ale przerwy między nimi są nie koniecznie równy | Klasa niewydolności serca NYHA (I–IV); skala bólu (łagodny/umiarkowany/silny); skala Likerta | Pozycje w wyścigu — 1., 2., 3. Znamy kolejność, ale różnica między 1. a 2. miejscem może znacznie różnić się od różnicy między 2. a 3. miejscem. |
| Przedział | Uporządkowane z równymi odstępami między wartościami, ale brak prawdziwego zera | Temperatura w °C; daty kalendarzowe; wyniki testów IQ | Termometr – 0°C nie oznacza „braku temperatury”. Nie można powiedzieć, że 20°C jest „dwa razy cieplejsze” niż 10°C w żadnym sensie absolutnym. |
| Stosunek | Uporządkowane, równe odstępy ORAZ prawdziwe zero absolutne | Wzrost, waga, ciśnienie krwi, wiek, dochód, dawka leku | Pieniądze — 0 funtów oznacza, że naprawdę nic nie masz. 40 funtów to dwa razy więcej niż 20 funtów |
- Dane nominalne/porządkowe → użyj testów nieparametrycznych, mody lub mediany dla średnich
- Dane interwałowe/stosunkowe (rozkład normalny) → można używać średniej, odchylenia standardowego, testów parametrycznych
- You nie można sensownie obliczyć średniej w przypadku danych nominalnych (np. „średnia grupa krwi” to nonsens) lub formułuj proporcjonalne stwierdzenia w przypadku danych interwałowych (nie można powiedzieć, że ktoś z IQ równym 120 jest „dwa razy bardziej inteligentny” niż ktoś z IQ równym 60)
🔬 Testy parametryczne i nieparametryczne
Testy statystyczne dzielą się na dwie rodziny w zależności od założeń, jakie przyjmują w odniesieniu do danych. Test AKT sprawdza, który typ testu jest odpowiedni w danym scenariuszu — nie trzeba wykonywać obliczeń, wystarczy wiedzieć, kiedy którego użyć.
Testy parametryczne Załóżmy, że dane mają rozkład normalny (lub próbka jest na tyle duża, że nie ma to większego znaczenia) i że dane są co najmniej na poziomie przedziałowym. Testy nieparametryczne nie zakładaj tego typu założeń — opierają się na rangach lub kategoriach i nadają się do danych skośnych, małych próbek lub danych porządkowych/nominalnych.
| Cel | Test parametryczny | Równoważnik nieparametryczny |
|---|---|---|
| Porównaj średnie 2 niezależnych grup | Niezależny test t | Test U Manna-Whitneya |
| Porównanie oznacza: ta sama grupa, 2 punkty czasowe | Sparowany test t | Test Wilcoxona dla rang znakowych |
| Porównaj średnie 3 lub więcej grup | ANOVA (Analiza wariancji) | Test Kruskala-Wallisa |
| Korelacja między dwiema zmiennymi ciągłymi | Korelacja Pearsona | Korelacja rang Spearmana |
| Porównaj proporcje / dane kategoryczne | Do | Test chi-kwadrat (χ²) |
- Dane są przekrzywiony or nie normalnie dystrybuowane → użyj nieparametrycznego
- Mała wielkość próbki (i niepewna normalność) → użyj nieparametrycznego
- Dane są porządkowy (np. wyniki bólu, Likert) → użyj nieparametrycznych
- Porównując proporcje lub kategorie → test chi-kwadrat
- Duża próbka, ciągła, w przybliżeniu normalna → test parametryczny jest w porządku
🔔 Rozkład normalny — reguła 68-95-99.7
Rozkład normalny to symetryczna krzywa w kształcie dzwonu. Średnia, mediana i moda są równe i znajdują się w środku.
| łodzie | % wartości uwzględnionych |
|---|---|
| Średnia ± 1 SD | 68% |
| Średnia ± 2 SD | 95% |
| Średnia ± 3 SD | 99.7% |
W przypadku danych o dodatnim skosie (np. dochody, czas oczekiwania na lekarza rodzinnego, poziom bilirubiny w surowicy na oddziale), średnia jest przesunięta w prawo przez kilka dużych wartości odstających. W takim przypadku należy użyć mediana — lepiej odzwierciedla wartość typową. AKT uwielbia testować to rozróżnienie.
📉 Wartości p i przedziały ufności – co one naprawdę oznaczają
Wartości p
Wartość p to prawdopodobieństwo zaobserwowania wyników co najmniej tak ekstremalnych, jak te zaobserwowane jeśli hipoteza zerowa jest prawdziwa (czyli jeśli nie ma realnego efektu). To jest nie prawdopodobieństwo, że hipoteza zerowa jest prawidłowa.
| Wartość p | Interpretacja |
|---|---|
| p <0.05 | Istotne statystycznie — prawdopodobieństwo, że wynik ten wystąpił przypadkowo, wynosi mniej niż 5%. |
| p> 0.05 | Nieistotne statystycznie — wynik może być przypadkowy |
| p = 0.01 | 1% szans na uzyskanie takiego wyniku, jeśli nie będzie żadnego realnego efektu |
Przedziały ufności (CI)
95% CI oznacza, że jeśli powtórzysz badanie 100 razy, w 95 przypadkach prawdziwa wartość populacji będzie mieścić się w tym zakresie.
- Dla stosunek (RR, OR, HR): jeśli 95% CI obejmuje 1.0 → nieistotne statystycznie
- Dla różnica (różnica średnich, ARR): jeśli 95% CI obejmuje 0 → nieistotne statystycznie
- Jeżeli CI jest w całości powyżej 1 (dla wskaźników) → znacznie zwiększone ryzyko
- Jeżeli CI jest całkowicie poniżej 1 (dla wskaźników) → ryzyko znacznie zmniejszone
❌ Błędy typu I i II — płacz wilka kontra chybienie wilka
Odrzucenie hipotezy zerowej, gdy jest ona prawdziwa. Innymi słowy: stwierdzenie, że leczenie działa, gdy nie działa. Odsetek wyników fałszywie dodatnich. Konwencjonalnie akceptowalny na poziomie 5% (α = 0.05, p < 0.05).
„Krzyk wilka” — bicie na alarm, gdy nie ma wilka.
Nieodrzucenie hipotezy zerowej, gdy w rzeczywistości jest ona fałszywa. Innymi słowy: brak rzeczywistego efektu leczenia. Odsetek wyników fałszywie ujemnych. Konwencjonalnie akceptowalny na poziomie 20% (β = 0.2, moc = 80%).
„Tęsknię za wilkiem” — mówię, że nie ma wilka, mimo że jest.
Moc = 1 − β. Jest to prawdopodobieństwo prawidłowego wykrycia prawdziwego efektu. Większa moc = mniejsze prawdopodobieństwo przeoczenia rzeczywistego efektu. Moc rośnie wraz z większymi próbami. Dobrze zaprojektowane badanie wymaga mocy ≥80%.
⚡ Znaczenie statystyczne ≠ Znaczenie kliniczne
To jeden z najważniejszych i najczęściej sprawdzanych niuansów statystyki AKT — a jednocześnie taki, którego wielu uczestników szkoleń nie rozumie.
Wynik może być statystycznie znaczące (p < 0.05) podczas gdy klinicznie bez znaczenia. Istotność statystyczna mówi jedynie, że wynik prawdopodobnie nie jest dziełem przypadku – mówi nic czy efekt ten jest na tyle duży, aby miał znaczenie w praktyce.
| Scenariusz | Czy jest to statystycznie istotne? | Czy ma to znaczenie kliniczne? |
|---|---|---|
| Spadek ciśnienia krwi o 1 mmHg, n=50,000, p=0.001 | Tak | Nie |
| Spadek ciśnienia krwi o 15 mmHg, n=30, p=0.08 | Nie | Prawdopodobnie tak |
| Spadek ciśnienia krwi o 12 mmHg, n=500, p=0.02 | Tak | Tak |
Zawsze patrz na rozmiar efektu (ARR, NNT, średnia różnica) wraz z wartościami p i przedziałami ufności. Wąski przedział ufności wykluczający zero lub jeden jest bardziej miarodajny niż sama wartość p – wskazuje zarówno kierunek, jak i precyzję efektu.
- Wąski CI → dokładna ocena → duże prawdopodobieństwo, że prawdziwa wartość jest bliska ocenie punktowej (zwykle z dużej próby)
- Szeroki CI → niepewna ocena → prawdziwa wartość może mieścić się w dowolnym miejscu w szerokim zakresie (zwykle z małej lub heterogenicznej próbki)
Przykład: RR = 1.5 (95% CI 1.4–1.6) → precyzyjne, przekonujące. RR = 1.5 (95% CI 0.6–3.8) → szerokie, niepewne — przekraczające 1.0, więc nawet nieistotne.
📈 Regresja do średniej — ukryty czynnik zakłócający praktykę kliniczną
Regresja do średniej to statystyczna tendencja, w której skrajny pomiar jest bliższy średniej przy drugim pomiarze — niezależnie od jakiejkolwiek interwencjiJest to jedno z najbardziej niedocenianych źródeł błędnych wniosków w medycynie.
Pacjenci są często badani lub leczeni dokładnie wtedy, gdy ich objawy lub wyniki pomiarów są najgorsze. Naturalna zmienność oznacza, że wyniki pomiarów prawdopodobnie i tak ulegną poprawie po ponownym badaniu – niekoniecznie dzięki interwencji. Bez grupy kontrolnej niemożliwe jest odróżnienie regresji do średniej od rzeczywistego efektu leczenia.
| Scenariusz | Jak wygląda efekt leczenia | Co naprawdę może się wydarzyć |
|---|---|---|
| Pacjent ma bardzo wysokie ciśnienie krwi podczas jednego pomiaru → rozpoczął leczenie farmakologiczne → niższe ciśnienie krwi podczas kolejnej wizyty | Lek działa | Pierwszy odczyt mógł być wartością odstającą; ciśnienie krwi i tak byłoby niższe podczas ponownego pomiaru |
| Uczeń uzyskał bardzo słaby wynik na teście → dostał dodatkowe korepetycje → następnym razem uzyskał lepszy wynik | Czesne pomogło | Słaby wynik może być niereprezentatywny; naturalna wydajność skłania się ku średniej |
| Pacjent z ciężkim zaostrzeniem egzemy zaczyna stosować nowy krem → zaostrzenie się poprawia | Krem jest skuteczny | Ciężkie zaostrzenia choroby ustępują naturalnie z czasem, niezależnie od leczenia |
- Brać wielokrotne pomiary bazowe i użyj średniej przed rozpoczęciem leczenia
- Użyj Grupa kontrolna — regresja do średniej wpływa na obie grupy w równym stopniu, więc wszelkie różnice między grupami są najprawdopodobniej rzeczywistym efektem leczenia
- To jeden z najsilniejszych argumentów za RCT w porównaniu z niekontrolowanymi badaniami przed i po
Wykresy statystyczne — na co zwracać uwagę
AKT regularnie prezentuje wykresy i prosi o ich interpretację. Naucz się dostrzegać kluczowe cechy w każdym typie wykresu — nie próbuj czytać wszystkiego. Wystarczy jedna, ukierunkowana obserwacja.
| Typ wykresu | Pierwsze użycie | Jedna rzecz, na którą należy zwrócić uwagę |
|---|---|---|
| Działka leśna | Wyniki metaanalizy | Czy diament przekroczyć pionową linię bez efektu? |
| Fabuła lejka | Wykrywanie błędów publikacji / monitorowanie wartości odstających GP | Czy to jest fabuła? asymetryczny? (Luka = brak niepublikowanych badań) |
| Działka Catesa | Komunikowanie NNT pacjentom w sposób wizualny | Policz kolorowe twarze „korzyści”; NNT = 100 ÷ te twarze |
| Działka L'Abbé | Badanie heterogeniczności w metaanalizach | Kropka na linii przekątnej = zerowy efekt leczenia |
| Wykres pudełkowy i wąsowy | Dystrybucja i rozprzestrzenianie danych | Linia środkowa = mediana (nie oznaczają średniej); kropki za wąsami = wartości odstające |
| Nomogram Fagana | Prawdopodobieństwo przed testem → prawdopodobieństwo po teście | Narysuj linię od prawdopodobieństwa przed testem przez LR, aby odczytać prawdopodobieństwo po teście |
| Wykres łodygowo-liściowy | Dystrybucja — zachowuje pierwotne wartości | Podobny do histogramu, ale pokazujący poszczególne punkty danych |
| Krzywa Kaplana-Meiera | Analiza przeżycia — czas do zdarzenia | Liczba kroków spada, gdy dochodzi do zdarzeń; krzywe, które wcześnie się rozchodzą i pozostają od siebie oddalone, sugerują trwałe korzyści z leczenia |
| Histogram | Dystrybucja danych ciągłych | Kształt krzywej: symetryczny = rozkład normalny; skośny = użyj mediany, a nie średniej |
🌲 Działki leśne — w szczegółach
- Każdy kwadrat = jedno badanie. Rozmiar kwadratu = waga badania (zwykle zależna od wielkości próby)
- Linie poziome = 95% przedział ufności dla tego badania
- Diament na dole = łączna ocena ogólna. Jej szerokość = łączny 95% CI
- Linia pionowa przy 1.0 = „linia bez efektu” (dla współczynników). Jeśli linia CI lub romb przekracza tę linię, ten wynik jest nieistotne statystycznie
Wskaźnik I² mierzy, w jakim stopniu różnice między badaniami wynikają z prawdziwej heterogeniczności (rzeczywistych różnic), a w jakim stopniu są wynikiem przypadku.
I² < 25% = niska heterogeniczność ✓
I² = 25–50% = umiarkowana heterogeniczność
I² > 50% = znaczna heterogeniczność — łączny wynik jest mniej wiarygodny ⚠️
📯 Wykresy lejkowe — błąd publikacji i monitorowanie wartości odstających GP
Wykresy lejkowe pojawiają się w teście AKT w dwóch zupełnie różnych kontekstach — upewnij się, że rozpoznajesz oba.
Wykresy wielkości efektu (oś x) w stosunku do precyzji lub wielkości badania (oś y). Symetryczny lejek odwrócony = brak odchylenia. Asymetryczny lejek z przerwą w lewym dolnym rogu = brak małych negatywnych badań → odchylenie publikacji.
Porównuje praktyki lekarzy rodzinnych pod względem wskaźników (np. wskaźników skierowań, śmiertelności). Punkty danych poza liniami lejka są… statystyczne wartości odstające uzasadniającym dochodzenie — niekoniecznie będącym dowodem złej wydajności.
😊 Wykresy Catesa — jak wizualnie wyodrębnić NNT
Wykres Catesa (czasami nazywany „wykresem uśmiechniętych buźek”) wykorzystuje siatkę 100 twarzy, aby pomóc pacjentom zwizualizować bezwzględne korzyści i szkody.
- Każda ze 100 twarzy przedstawia jedną osobę na 100 poddanych leczeniu
- Żółte/zielone twarze = ludzie, którym udało się zapobiec (zdarzeniom)
- Czerwone twarze = ludzie, którzy doświadczyli krzywdy
- Szare/gładkie twarze = brak efektu w obie strony
📉 Krzywe przeżycia Kaplana-Meiera — jak je odczytywać
Krzywe Kaplana-Meiera (KM) pokazują prawdopodobieństwo przeżycia (lub pozostania bez zdarzeń) w czasie. Pojawiają się w pytaniach AKT dotyczących badań nad rakiem, badań sercowo-naczyniowych i wszelkich badań śledzących czas do wystąpienia zdarzenia.
| Cecha | Co to znaczy |
|---|---|
| Oś Y | Prawdopodobieństwo przeżycia (lub przeżycia bez zdarzeń) — zaczyna się od 1.0 (100%) i spada z czasem |
| Oś X | Czas (dni, miesiące, lata) |
| Każdy krok w dół | Wystąpiło zdarzenie (np. śmierć, nawrót). Większe kroki = więcej zdarzeń w tym momencie |
| Znaczniki na linii | Pacjenci ocenzurowani — utracono możliwość dalszej obserwacji lub badanie zostało zakończone. Nie są to wydarzenia. |
| Dwie krzywe rozchodzące się wcześnie i pozostające osobno | Sugeruje utrzymanie korzyści z leczenia w trakcie całego okresu obserwacji |
| Krzywe przecinające się | Sugeruje, że zagrożenie nie jest proporcjonalne w czasie — co komplikuje interpretację |
| Mediana przeżycia | Punkt czasowy, w którym krzywa przeżycia przekracza 50% — punkt, w którym u połowy pacjentów wystąpiło zdarzenie |
test log-rank porównuje statystycznie dwie krzywe KM. współczynnik ryzyka (HR) Podsumowuje ogólną różnicę między krzywymi. HR < 1 = grupa leczona ma mniej zdarzeń w czasie. Jeśli krzywe w znacznym stopniu się pokrywają, HR będzie bliskie 1 (brak korzyści).
📊 Histogramy — rozkład w skrócie
Histogram przedstawia rozkład zmiennej ciągłej (np. wieku, ciśnienia krwi, BMI) poprzez grupowanie wartości w przedziały (kosze) i pokazywanie, ile obserwacji przypada na każdy z nich. W przeciwieństwie do wykresu słupkowego, słupki się stykają – ponieważ dane są ciągłe.
| Shape | Znaczenie | Użyć średniej czy mediany? |
|---|---|---|
| Symetryczny kształt dzwonka | Rozkład normalny — średnia, mediana, moda – wszystkie równe | Albo — ale konwencjonalnie średnia ± SD |
| Skośność prawostronna (dodatnia) | Długi ogon w prawo — kilka bardzo wysokich wartości podnoszących średnią | Mediana (bardziej reprezentatywna) |
| Skośność lewostronna (ujemna) | Długi ogon po lewej stronie — kilka bardzo niskich wartości obniżających średnią | Mediana (bardziej reprezentatywna) |
| Bimodalny (dwa szczyty) | Dwie odrębne podgrupy w danych | Zgłoś oba szczyty osobno |
Poprawa jakości i audyt kliniczny
| Narzędzie | Cel | Kluczowe funkcje |
|---|---|---|
| Audyt kliniczny | Oceniaj praktykę w odniesieniu do wyraźnych standardów, identyfikuj i usuwaj luki | Wymaga określonego standardu. Wykorzystuje cykl PDSA. Obejmuje zamknięcie pętli (ponowny audyt). Nie badania — brak hipotez, brak nowej wiedzy. |
| Analiza istotnych zdarzeń (SEA) | Systematyczny, wielodyscyplinarny przegląd pojedynczego, istotnego zdarzenia | Bez obwiniania. Koncentruje się na uczeniu się systemu, a nie na błędach indywidualnych. Dzielenie się wiedzą w zespole. Dokumentowanie nauki i działań. |
| Analiza przyczyn źródłowych (RCA) | Szczegółowe badanie poważnych incydentów | Bardziej ustrukturyzowana niż SEA. Wykorzystuje technikę „5 razy dlaczego”. Identyfikuje przyczyny współistniejące i pierwotne. Często w przypadku zdarzeń, które nigdy nie miały miejsca, lub poważnych szkód. |
| Raportowanie wyjątków QOF | Właściwe wykluczenie pacjentów ze wskaźników QOF | Klinicznie odpowiednie w przypadku: maksymalnie tolerowanej terapii, świadomego sprzeciwu pacjenta, skrajnej słabości lub przeciwwskazań klinicznych. |
🔄 Audyt kliniczny a badania — kluczowe różnice
| Cecha | Audyt kliniczny | Badania |
|---|---|---|
| Cel | Poprawa opieki poprzez porównanie ze standardami | Generuj nową wiedzę |
| Hipoteza | Brak — porównuje się z istniejącym standardem | Zawsze ma hipotezę |
| Zatwierdzenie etyki | Zwykle nie jest wymagane | Zwykle wymagane |
| Zgoda | Zwykle nie jest wymagane | Zwykle wymagane |
| Randomizacja | Nigdy | Może obejmować RCT |
| Wynik końcowy | Poprawa usług; plan działania | Nowe dowody; publikacja |
🔁 Cykl PDSA
Cykl Planuj-Działaj-Badaj-Działaj (PDSA) stanowi ramy ciągłego doskonalenia stosowane w audycie klinicznym i poprawie jakości.
| STAGE | Co się dzieje |
|---|---|
| Plan | Zdefiniuj pytanie, ustal standard, zaplanuj zbieranie danych |
| Do | Wdrożenie zmiany lub pomiar bieżącej praktyki |
| Badanie | Przeanalizuj wyniki, porównaj je ze standardem, zidentyfikuj luki |
| działać | Wdrażanie ulepszeń; planowanie ponownego audytu w celu zamknięcia pętli |
Obliczenia kliniczne (Bank formuł AKT)
Te wzory pojawiają się w pytaniach dotyczących obliczeń AKT. Poznaj każdy z nich i kliniczne punkty odcięcia, które uruchamiają działanie.
🧮 Przykładowy wykres ABPI
🎯 Scenariusz: Pani T., 72 lata, odczuwa ból nogi podczas chodzenia
🍷 Przykłady rozwiązań dla jednostki alkoholowej
| Drink | Objętość (ml) | Zawartość alkoholu | Obliczenie | Jednostki |
|---|---|---|---|---|
| Duży kieliszek do wina | 250ml | 13% | 250 × 13 ÷ 1000 | 3.25 |
| Butelka wina | 750ml | 12% | 750 × 12 ÷ 1000 | 9.0 |
| Pint lager (mocny) | 568ml | 5% | 568 × 5 ÷ 1000 | 2.84 |
| Pojedyncza miarka spirytusowa | 25ml | 40% | 25 × 40 ÷ 1000 | 1.0 |
Przykłady rozwiązań
🎯 Przykład 1: Obliczanie wszystkich metryk ryzyka z tabeli próbnej
W badaniu RCT pacjenci są losowo przydzielani do grupy otrzymującej lek X lub placebo. Po 3 latach: 80 z 500 pacjentów otrzymujących placebo miało udar; 40 z 500 pacjentów otrzymujących lek X miało udar.
🎯 Przykład 2: Konstruowanie tabeli 2×2 i obliczanie czułości i swoistości
Nowy test został zastosowany u 200 pacjentów, z których 100 jest chorych. Test prawidłowo identyfikuje 85 ze 100 chorych i 80 ze 100 bez choroby.
🎯 Przykład 3: Obliczanie dawki pediatrycznej
Dziecko potrzebuje 300 mg amoksycyliny. Dostępna zawiesina to 250 mg/5 ml. Jaką objętość należy podać?
Arkusz ściągawek z formułami i pomocami pamięciowymi
Wzory ryzyka i leczenia
Testy diagnostyczne
Populacyjne i kliniczne formuły
- SnNout: Test czuły — negatywny wyklucza chorobę (badanie przesiewowe)
- SpPin: Test specyficzny — pozytywne reguły w chorobie (potwierdzenie)
- CI przekracza 1.0 (stosunek) lub 0 (różnica) → nieistotna
- Linia diamentowych krzyży działek leśnych → nieistotne
- Asymetria lejka → błąd publikacji (lub odchylenie GP w kontekście wydajności)
- Wykres pudełkowy, linia środkowa → MEDIANA (nie średnia)
- 68-95-99.7 → ±1SD, ±2SD, ±3SD w rozkładzie normalnym
- I² >50% → znaczna heterogeniczność
- LUB z kontroli przypadku | RR z kohorty | Występowanie w przekroju poprzecznym
- Audyt ≠ Badania (środki audytowe kontra standardy; badania generują nową wiedzę)
- Kontrola przypadku → LUB (współczynnik szans) — spojrzenie wstecz na ekspozycje
- Kohorta → RR (ryzyko względne) — idąc naprzód od ekspozycji
- Przekrój poprzeczny → Występowanie — MIGAWKA w czasie
- RCT / SR → Złoty standard w pytaniach dotyczących leczenia
Trener i Perły Nauczania
- Uczestnicy szkoleń często uczą się NNT jako wzoru, nie rozumiejąc jego rzeczywistego znaczenia klinicznego — należy upewnić się, że potrafią wyjaśnić go w zdaniu zrozumiałym dla pacjenta
- Rozróżnienie między czułością/swoistością (właściwościami testu) a PPV/NPV (wpływem częstości występowania) jest słabo poznane — analogia do testu ciążowego sprawdza się dobrze
- Wielu stażystów wie, jak wygląda działka leśna, ale nie potrafi tego wyjaśnić co patrzeć — skupić się na diamencie i na tym, czy przekracza on linię braku efektu
- Błąd związany z czasem realizacji zamówienia jest często mylony z błędem związanym z długością — aby zilustrować różnicę, użyj diagramów lub osi czasu
- Uczestnicy szkoleń często mylą audyt kliniczny z badaniami — skorzystaj z własnych przykładów z ocen RCGP
- „Oto tabela podsumowująca badanie kliniczne leku. Czy możesz mi podać NNT i czy przepisałbyś ten lek temu pacjentowi?”
- „Spójrz na tę działkę leśną. Czy interwencja jest skuteczna? Jak bardzo jesteś pewien tej odpowiedzi?”
- „Twój pacjent ma pozytywny wynik testu FIT. Wartość predykcyjna dodatnia (PPV) w populacji niskiego ryzyka wynosi około 3%. Jak mu to wytłumaczysz?”
- „Widzimy wiele wysokich wyników PSA. Jaki jest problem ze stosowaniem PSA jako badania przesiewowego?”
- „Kolega chce porównać nasze wyniki dotyczące sepsy z wynikami Trustu. Czy to audyt, czy badania? Czy to wymaga etyki?”
- „Jak wyjaśniłbyś pacjentowi, który pyta: »Czy to bezpieczne?«, że prawdopodobieństwo wystąpienia skutku ubocznego wynosi 1 do 50?”
- Jak obecnie wyjaśniają Państwo ryzyko pacjentom? Czy posługują się Państwo wartościami bezwzględnymi, czy względnymi?
- Czy przypominasz sobie niedawne wytyczne kliniczne, które powoływały się na istotny NNT — co to było i jak wpłynęło to na Twoją praktykę?
- Czy kiedykolwiek zleciłeś test, nie znając jego czułości/swoistości? Jak zinterpretowałeś wynik?
- Dlaczego firma farmaceutyczna zdecydowała się przedstawić wyniki swoich badań jako RRR, a nie ARR?
🔥 Końcówki AKT High-Yield
Oto wzorce, które powtarzają się w arkuszach AKT. Zapamiętaj je, a zdobędziesz punkty.
Zawsze najpierw zamieniaj procenty na ułamki dziesiętne. ARR = 5% → NNT = 1 ÷ 0.05 = 20. Zawsze okrągłe up do najbliższej liczby całkowitej. Niższy NNT = skuteczniejsze leczenie.
W przypadku współczynników (RR, OR, HR): CI przecina 1.0 = nieistotne. W przypadku różnic: CI krzyżuje się 0 = nieistotne. To pytanie pojawia się w prawie każdym pytaniu dotyczącym działek leśnych.
Rzadka choroba → sprawa-kontrola → LUB. Nowe narażenie w przyszłości → kohorta → RR. Migawka rozpowszechnienia → przekrój poprzeczny. Najlepsze dowody na skuteczność leczenia → RCT or SR/metaanaliza.
Badanie przesiewowe → chcesz uzyskać wysoką czułość (nie chcesz przegapić przypadków → SnNout). Test potwierdzający → chcesz uzyskać wysoką specyficzność (nie chcesz wyników fałszywie dodatnich → SpPin).
Nawet wysoce specyficzny test (99%) daje niską wartość predykcyjną dodatnią (PPV) w warunkach niskiej prewalencji. Większość pozytywnych wyników badań przesiewowych w populacji to wyniki fałszywie dodatnie. Dlatego nie badamy wszystkich pod kątem wszystkiego.
Jeśli diament (szacunek zbiorczy) przekracza pionową linię braku efektu → ogólny wynik NIE jest statystycznie istotny. Jeśli I² > 50% → znaczna heterogeniczność → wynik zbiorczy jest mniej wiarygodny.
Luka w lewym dolnym rogu wykresu lejkowego = błąd publikacji – nie opublikowano małych badań o negatywnym wyniku. To zawyża pozorny efekt leczenia w metaanalizie.
Linia wewnątrz pudełko jest medianaPole = IQR (środkowe 50%). Kropki lub kółka za wąsami = wartości odstające.
Firmy farmaceutyczne uwielbiają powoływać się na RRR, bo brzmi to lepiej. RRR na poziomie 50% brzmi niesamowicie – dopóki nie dowiesz się, że ryzyko bazowe wynosiło zaledwie 2% (→ ARR = 1%, NNT = 100). Zawsze pytaj: jakie było ryzyko bazowe?
Rozkłady skośne (dochód, pobyt w szpitalu, bilirubina w surowicy) → wykorzystanie mediana nie jest średnią. Średnia jest wyznaczana przez wartości odstające, mediana nie.
Audyt: środki przeciwko Przede wszystkim system został opracowany standard; nie potrzeba etyki; nie ma hipotez. Badania: generują nowych wiedza; wymaga zatwierdzenia etycznego; ma hipotezę. Kluczowe rozróżnienie, które AKT wielokrotnie testuje.
Analiza ITT obejmuje wszystkich uczestników randomizowanych, niezależnie od przestrzegania zaleceń. Daje to konserwatywny Oszacowanie skuteczności — bardziej realistyczne w praktyce klinicznej. Analiza per-protocol przecenia efekt.
ABPI < 0.9 = choroba tętnic obwodowych. ABPI > 1.3 = naczynia nieuciskające (zwapnione) — wynik niewiarygodny. Bandażowanie uciskowe jest przeciwwskazane, jeśli ABPI < 0.8 (sprawdź swoje wytyczne dotyczące ucisku).
Policz ścianki z korzyściami (zazwyczaj żółte lub zielone). NNT = 100 ÷ (liczba ścianek z korzyściami). 5 żółtych ścianek → NNT = 20.
Typowe błędy i pułapki praktykantów
Oto błędy, które powtarzają się w systemach oceniania AKT. Każdy z nich to realny punkt stracony przez prawdziwych kandydatów.
- Zapomnienie o zamianie procentów na liczby dziesiętne przed obliczeniem NNT (np. ARR = 5% → należy użyć 0.05, a nie 5, aby uzyskać NNT = 20, a nie 0.2)
- Zaokrąglanie NNT na dół zamiast up (NNT = 12.5 → odpowiedź to 13, nie 12)
- Pomylenie RRR z ARR i podanie bardziej imponująco brzmiącej wartości względnej jako korzyści klinicznej
- Określenie wyniku jako „istotnego”, gdy CI zbliża się do 1.0 — musi nie obejmują 1.0 jest znaczące
- Stwierdzenie, że środkowa linia wykresu pudełkowego jest średnią — zawsze jest średnią mediana
- Mylenie wrażliwości z PPV — wrażliwość jest stałą właściwością testu; PPV zależy od częstości występowania
- Sądząc, że wysoce specyficzny test przeprowadzony w populacji o niskiej częstości występowania da wiarygodny pozytywny wynik — tak się nie stanie (niska wartość predykcyjna dodatnia)
- Pomylenie OR z RR — OR nie mogą być bezpośrednio używane jako RR, chyba że choroba jest rzadka
- Twierdzenie, że badanie typu „przypadek-kontrola” generuje RR – generuje OR, ponieważ zaczyna się od przypadków i kontroli, a nie od narażonej kohorty
- Mylenie audytu klinicznego z badaniami — twierdzenie, że audyt wymaga zatwierdzenia etycznego
- Błędne interpretowanie błędu czasu realizacji badań przesiewowych jako faktu, że program badań przesiewowych rzeczywiście poprawia przeżywalność
- Zapomnienie, że I² >50% na wykresie leśnym budzi wątpliwości co do wiarygodności łącznego wyniku
- Używając średniej do opisu danych przekłamanych (np. dochodów, długości pobytu w szpitalu) — użyj mediany
🏁 Podsumowanie
- NNT = 1 ÷ ARR. Zawsze zamieniaj procenty na ułamki dziesiętne. Zawsze zaokrąglaj w górę. Niższy NNT = lepsze leczenie.
- ARR jest klinicznie uczciwy. RRR brzmi imponująco, ale może być mylący. Zawsze łącz RRR z ryzykiem bazowym.
- Czułość i swoistość są stałymi właściwościami testu. Wartości predykcyjne i wartości bieżące zmieniają się w zależności od częstości występowania choroby.
- SnNout: testy czułe wykluczają wynik negatywny. SpPin: testy specyficzne wykluczają wynik pozytywny.
- Diament na wykresie leśnym przecina linię braku efektu → wynik nieistotny statystycznie. I² >50% → obawy o heterogeniczność.
- Asymetria wykresu lejkowego → błąd publikacji. Punkty poza granicami lejka w monitorowaniu wydajności → praktyki odstające.
- CI dla ilorazu obejmującego 1.0 → nieistotne statystycznie. CI dla różnicy obejmującej 0 → nieistotne statystycznie.
- Przypadek-kontrola → OR. Kohorta → RR. Przekrojowe → częstość występowania. RCT/SR → złoty standard leczenia.
- Dane skośne → użyj mediany, a nie średniej. Środkowa linia wykresu pudełkowego = mediana. Kropki za wąsami = wartości odstające.
- Audyt kliniczny mierzy zgodność ze standardami – nie wymaga etyki, nie wymaga hipotez. Badania generują nową wiedzę – etyka jest wymagana.
Pytania ze statystyki w teście AKT należą do najłatwiejszych do opanowania. Kilka godzin spędzonych nad tą stroną i kilka pytań praktycznych zwrócą się znacznie bardziej, niż byłyby one warte.