Retatrutide — co oznacza „statystycznie istotny” wynik?

Wyniki badań klinicznych często zawierają krótkie, pozornie niewiele mówiące oznaczenie:

p < 0,05

Dla osoby bez przygotowania statystycznego może wyglądać jak techniczny szczegół.

W rzeczywistości jest to jedna z informacji, które pomagają odpowiedzieć na bardzo ważne pytanie:

Czy obserwowana różnica między badanymi grupami może być zgodna z przypadkową zmiennością, czy dane przemawiają przeciwko takiemu wyjaśnieniu?

I właśnie tutaj pojawia się pojęcie istotności statystycznej.

Ale trzeba od razu zaznaczyć jedną rzecz:

statystycznie istotny wynik nie oznacza automatycznie, że efekt jest duży, ważny dla pacjenta albo że działa tak samo u każdego.

To jedna z najważniejszych zasad czytania badań klinicznych.

FDA podkreśla, że w interpretacji wyników należy patrzeć nie tylko na wartość p, ale również na wielkość efektu i przedział ufności, ponieważ p-value i przedział ufności odpowiadają na częściowo różne pytania.


Najpierw najprościej: czym jest istotność statystyczna?

Wyobraźmy sobie badanie, w którym:

  • jedna grupa otrzymuje retatrutide,
  • druga otrzymuje placebo.

Po określonym czasie sprawdzamy zmianę masy ciała.

Jeżeli retatrutide powoduje większą średnią redukcję masy ciała niż placebo, pojawia się pytanie:

czy ta różnica rzeczywiście wynika z działania badanego preparatu, czy mogła pojawić się przypadkowo w wyniku zmienności danych?

Statystyka pomaga ocenić właśnie tę niepewność.

W uproszczeniu:

im mniej prawdopodobne jest uzyskanie obserwowanej różnicy przy założeniu, że nie ma rzeczywistego efektu, tym silniejsze są dane przeciwko hipotezie o braku różnicy.

To jest podstawowa idea stojąca za testowaniem hipotez.


Czym jest hipoteza zerowa?

Żeby zrozumieć p-value, trzeba najpierw zrozumieć pojęcie hipotezy zerowej.

W typowym badaniu porównawczym hipoteza zerowa zakłada, że nie ma różnicy między porównywanymi grupami w odniesieniu do badanego efektu.

Przykładowo:

H₀: retatrutide i placebo nie różnią się pod względem średniej zmiany masy ciała.

Badanie zbiera dane i sprawdza, jak bardzo obserwowany wynik jest zgodny z takim założeniem.

Jeżeli wynik jest bardzo mało zgodny z hipotezą zerową, uzyskujemy argument przemawiający przeciwko niej.

To właśnie tutaj pojawia się p-value.


Co właściwie oznacza p-value?

Najprostsze poprawne wyjaśnienie brzmi:

p-value opisuje, jak zaskakujące byłyby zaobserwowane dane lub jeszcze bardziej ekstremalne dane, gdyby założenie hipotezy zerowej było prawdziwe.

To bardzo ważne, ponieważ p-value nie oznacza:

  • prawdopodobieństwa, że lek działa,
  • prawdopodobieństwa, że wynik jest prawdziwy,
  • prawdopodobieństwa, że lek jest skuteczny u konkretnej osoby,
  • wielkości efektu.

Jeżeli w badaniu otrzymujemy:

p = 0,01

nie oznacza to:

„jest 99% szans, że retatrutide działa”.

To błędna interpretacja.

P-value mówi coś innego: przy założeniu określonej hipotezy zerowej obserwowany wynik byłby stosunkowo mało zgodny z tym założeniem.

FDA zwraca uwagę, że p-value powinno być interpretowane razem z wielkością efektu i przedziałem ufności, a nie jako samodzielny wskaźnik znaczenia wyniku.


Dlaczego często używa się granicy 0,05?

W wielu badaniach klinicznych stosuje się poziom istotności:

α = 0,05.

Jeżeli uzyskana wartość p jest mniejsza od przyjętego poziomu, wynik określa się jako statystycznie istotny w ramach przyjętego testu.

Czyli:

p < 0,05 → wynik statystycznie istotny

ale:

p ≥ 0,05 → brak podstaw do odrzucenia hipotezy zerowej przy tym poziomie istotności.

I tutaj trzeba uważać na język.

Nie należy mówić:

„p ≥ 0,05 oznacza, że lek nie działa”.

Prawidłowe stwierdzenie brzmi:

wynik nie dostarczył wystarczających dowodów do odrzucenia hipotezy zerowej przy przyjętym poziomie istotności.

To ogromna różnica.

Brak istotności statystycznej nie jest automatycznie dowodem braku efektu.


Czy p < 0,05 oznacza, że wynik jest ważny?

Nie zawsze.

I właśnie tutaj dochodzimy do jednej z najważniejszych różnic:

istotność statystyczna

versus

znaczenie kliniczne.

Wyobraźmy sobie badanie, w którym nowa terapia zmniejsza masę ciała średnio o:

0,3 kg więcej niż placebo.

Jeżeli badanie obejmuje bardzo dużą liczbę uczestników, różnica może osiągnąć bardzo małą wartość p.

Statystycznie:

istotna.

Ale czy 0,3 kg jest klinicznie istotną różnicą?

To już zupełnie inne pytanie.

Dlatego samo:

p < 0,05

nie mówi nam, czy efekt jest duży, mały, praktycznie ważny albo wart uwagi z punktu widzenia pacjenta.


I odwrotnie — duży efekt może nie być statystycznie istotny

To również jest możliwe.

Wyobraźmy sobie małe badanie, w którym:

  • grupa retatrutide traci średnio dużo więcej masy ciała,
  • ale uczestników jest niewielu,
  • wyniki między poszczególnymi osobami mocno się różnią.

Możemy otrzymać duży obserwowany efekt, ale szeroki zakres niepewności.

Wtedy p-value może przekroczyć 0,05.

Czy oznacza to:

„na pewno nie ma efektu”?

Nie.

Może oznaczać, że badanie nie dostarczyło wystarczająco precyzyjnych danych, aby z określonym poziomem pewności wykazać różnicę.

To jeden z powodów, dla których wielkość badania ma znaczenie.


Co daje większa liczba uczestników?

Większe badanie może dostarczyć bardziej precyzyjnych oszacowań efektu.

W uproszczeniu:

więcej danych → zwykle mniejsza niepewność oszacowania → węższy przedział ufności.

FDA zwraca uwagę, że niepewność oszacowania jest związana m.in. z wielkością próby, a przedziały ufności pozwalają ocenić precyzję oszacowanego efektu.

Nie oznacza to jednak, że samo zwiększanie liczby uczestników automatycznie „naprawia” każde badanie.

Jeżeli badanie jest źle zaprojektowane, większa liczba uczestników nie rozwiązuje wszystkich problemów.


Przykład z retatrutide

W badaniu fazy 2 dotyczącym otyłości uczestniczyło 338 osób.

Po 48 tygodniach średnia zmiana masy ciała wyniosła:

  • około −8,7% przy 1 mg,
  • −17,1% przy 4 mg,
  • −22,8% przy 8 mg,
  • −24,2% przy 12 mg,

w porównaniu z około −2,1% w grupie placebo.

To bardzo duże różnice między grupami.

W badaniu analizowano je statystycznie, ale przy interpretacji nie wystarczy powiedzieć:

„wynik był istotny statystycznie”.

Trzeba również spojrzeć na:

  • wielkość różnicy,
  • przedział ufności,
  • liczebność grup,
  • czas obserwacji,
  • punkt końcowy,
  • sposób analizy,
  • działania niepożądane.

Dopiero wtedy można odpowiedzialnie ocenić znaczenie wyniku.


Przedział ufności — drugi element, którego nie powinno się pomijać

Załóżmy, że badanie pokazuje:

różnica między grupami: −10 punktów procentowych

oraz:

95% CI: −12 do −8.

W bardzo uproszczonym ujęciu przedział ufności pokazuje zakres wartości efektu zgodnych z danymi i zastosowaną metodą statystyczną.

W tym przykładzie cały przedział znajduje się poniżej zera.

To sugeruje, że różnica jest nie tylko statystycznie istotna, ale również oszacowanie efektu jest stosunkowo precyzyjne.

Teraz wyobraźmy sobie:

różnica: −10 punktów procentowych

ale:

95% CI: −25 do +5.

Tutaj sytuacja wygląda zupełnie inaczej.

Punktowe oszacowanie nadal wynosi −10, ale zakres niepewności jest szeroki i obejmuje również brak różnicy.

Dlatego samo spojrzenie na pojedynczą liczbę:

„−10%”

może być mylące.


P-value i przedział ufności mówią o różnych rzeczach

To bardzo przydatne uproszczenie:

P-value

pomaga odpowiedzieć:

Jak mocne są dane przeciwko hipotezie zerowej?

Przedział ufności

pomaga odpowiedzieć:

Jak duży może być rzeczywisty efekt i jak precyzyjnie go oszacowaliśmy?

FDA opisuje tę różnicę bardzo podobnie: test hipotezy koncentruje się na istnieniu efektu, natomiast przedział ufności dostarcza informacji o jego wielkości i precyzji oszacowania.

Dlatego najlepsza interpretacja nie brzmi:

„p < 0,05, więc wszystko jest jasne”.

Lepsza brzmi:

„wynik spełnia kryterium istotności statystycznej, a przedział ufności pokazuje zakres i precyzję oszacowanego efektu”.


Co oznacza „statystycznie istotny” w badaniach retatrutide?

Załóżmy, że badanie porównuje retatrutide z placebo.

Jeżeli wynik głównego punktu końcowego ma:

p < 0,001

oznacza to bardzo silne dane przeciwko hipotezie zerowej w ramach zastosowanego testu.

Nie oznacza natomiast:

  • że 99,9% osób odpowie na leczenie,
  • że efekt jest 99,9% pewny,
  • że lek jest skuteczny u każdego,
  • że efekt będzie trwały,
  • że lek jest bezpieczny,
  • że efekt jest klinicznie ważny w każdym aspekcie.

To wszystko są inne pytania.


Dlaczego p < 0,001 robi wrażenie?

Ponieważ jest to bardzo mała wartość p.

W przypadku TRIUMPH-1 wszystkie badane dawki retatrutide wykazały dla głównego wyniku dotyczącego masy ciała p < 0,001 względem placebo.

To bardzo mocny sygnał statystyczny.

Ale nawet tutaj nie należy zatrzymywać się na samym p-value.

W tym samym badaniu trzeba spojrzeć również na wielkość efektu:

  • około −19,0% przy 4 mg,
  • około −28,3% przy 12 mg po 80 tygodniach.

W tym przypadku mamy więc zarówno:

bardzo silną istotność statystyczną,

jak i

duży efekt obserwowany na poziomie grupy.

To znacznie bardziej informacyjny obraz niż samo „p < 0,001”.


Czy mniejsze p oznacza większy efekt?

Nie.

To jeden z najczęstszych błędów.

Porównajmy dwa hipotetyczne badania.

Badanie A

Różnica:

−15 kg

p = 0,02

Badanie B

Różnica:

−0,5 kg

p < 0,001

Nie możemy powiedzieć, że terapia B jest skuteczniejsza dlatego, że ma mniejsze p.

P-value nie jest skalą wielkości efektu.

Na wartość p wpływają m.in.:

  • wielkość efektu,
  • liczba uczestników,
  • zmienność danych,
  • sposób analizy.

Dlatego p-value nie zastępuje informacji o wielkości efektu.


Dlaczego bardzo duże badanie może wykazać „drobiazg”?

Im większa liczba obserwacji, tym łatwiej wykryć niewielkie różnice, jeżeli dane są odpowiednio precyzyjne.

Możemy więc otrzymać:

bardzo małą wartość p

dla

bardzo małego efektu.

Statystycznie może to być bezdyskusyjnie istotne.

Klinicznie — może mieć niewielkie znaczenie.

Dlatego badania kliniczne nie powinny być interpretowane wyłącznie poprzez próg:

p < 0,05.


Co to jest istotność kliniczna?

Istotność kliniczna odpowiada na zupełnie inne pytanie:

Czy zaobserwowany efekt ma znaczenie dla zdrowia, funkcjonowania lub decyzji dotyczących pacjenta?

W przypadku retatrutide można pytać np.:

  • czy zmiana masy ciała jest wystarczająco duża, aby mieć znaczenie kliniczne?
  • czy zmniejszenie obwodu talii jest istotne?
  • czy poprawa HbA1c ma znaczenie dla kontroli cukrzycy?
  • czy poprawa bezdechu sennego przekłada się na istotne korzyści?
  • czy zmiana bólu stawu kolanowego jest odczuwalna dla pacjenta?

Nie na każde z tych pytań odpowiada samo p-value.


Statystyczna istotność nie mówi też niczego sama w sobie o bezpieczeństwie

To bardzo ważne w przypadku leków.

Możemy mieć:

istotny statystycznie efekt dotyczący masy ciała

i jednocześnie:

działania niepożądane, które również występują częściej.

Jedno nie „kasuje” drugiego.

Skuteczność i bezpieczeństwo analizuje się osobno, a następnie ocenia ich bilans korzyści i ryzyka.

W badaniu fazy 2 retatrutide najczęstsze działania niepożądane dotyczyły przewodu pokarmowego i były zależne od dawki.

Dlatego nawet bardzo silny wynik statystyczny dotyczący utraty masy ciała nie oznacza automatycznie, że:

„lek jest bezpieczny”.

To zupełnie inna część oceny.


Co jeśli badanie ma wiele punktów końcowych?

Tutaj pojawia się kolejny problem statystyczny.

Wyobraźmy sobie, że badacze sprawdzają:

  • masę ciała,
  • HbA1c,
  • LDL,
  • triglicerydy,
  • ciśnienie,
  • CRP,
  • obwód talii,
  • kilka objawów,
  • kilkanaście dodatkowych parametrów.

Jeżeli każdy wynik testujemy osobno przy poziomie 0,05, rośnie prawdopodobieństwo, że przynajmniej jeden wynik wyjdzie istotny statystycznie tylko przypadkiem.

FDA określa ten problem jako multiplicity, czyli wielokrotność testowania. Przy dużej liczbie punktów końcowych lub porównań ryzyko fałszywie dodatnich wniosków rośnie, dlatego w odpowiednio zaprojektowanych badaniach stosuje się strategie kontrolowania tego problemu.


Dlatego ważne jest, co było głównym punktem końcowym

To bardzo istotne przy czytaniu informacji prasowych.

Badanie może zawierać:

jeden główny punkt końcowy

oraz

wiele drugorzędowych punktów końcowych.

Jeżeli główny punkt końcowy został osiągnięty, jest to bardzo ważna informacja.

Jeżeli natomiast główny punkt końcowy nie został osiągnięty, ale jeden z wielu drugorzędowych wyników jest istotny statystycznie, nie można automatycznie powiedzieć:

„badanie wykazało skuteczność”.

Trzeba sprawdzić wcześniej określony plan statystyczny i sposób kontrolowania wielokrotnego testowania.


Dlaczego nie można wybierać tylko najlepszych wyników?

Wyobraźmy sobie badanie, w którym analizuje się 30 różnych parametrów.

Jeżeli później wybierzemy tylko trzy, które wyszły najlepiej, i przedstawimy je jako najważniejsze, czytelnik może odnieść wrażenie, że cały zestaw wyników był jednoznacznie pozytywny.

To byłaby nieuczciwa interpretacja.

Dlatego w dobrych badaniach bardzo ważne są:

  • wcześniej określone punkty końcowe,
  • protokół,
  • plan analizy statystycznej,
  • odpowiednie metody kontroli wielokrotności,
  • transparentne raportowanie.

FDA podkreśla znaczenie odpowiedniego planowania i kontroli ryzyka błędnych wniosków przy wielu testach.


Co oznacza „wynik statystycznie nieistotny”?

To również często jest źle interpretowane.

Jeżeli badanie daje:

p = 0,08

nie możemy powiedzieć:

„udowodniono, że nie ma efektu”.

Możemy powiedzieć:

wynik nie spełnił przyjętego kryterium istotności statystycznej.

Dlaczego?

Ponieważ może istnieć rzeczywisty efekt, ale badanie mogło być:

  • zbyt małe,
  • zbyt krótkie,
  • zbyt zmienne,
  • niedostatecznie precyzyjne.

Przedział ufności może pomóc zobaczyć, jak szeroka jest niepewność.


p = 0,049 i p = 0,051 — czy naprawdę dzieli je przepaść?

Nie.

To bardzo dobry przykład pokazujący, dlaczego próg 0,05 nie powinien być traktowany jak magiczna granica między:

„prawda”

a

„nieprawda”.

Wynik:

p = 0,049

spełnia tradycyjne kryterium p < 0,05.

Wynik:

p = 0,051

go nie spełnia.

Ale różnica między tymi wartościami jest minimalna.

Nie ma sensu traktować pierwszego wyniku jako „udowodnionego”, a drugiego jako „dowodu braku efektu”.

Właśnie dlatego coraz większy nacisk kładzie się na cały obraz danych, w tym wielkość efektu, przedziały ufności, projekt badania i wcześniejsze założenia analizy.


Co jeśli wynik jest istotny, ale przedział ufności jest bardzo szeroki?

Wtedy wiemy, że dane przemawiają przeciwko hipotezie zerowej, ale możemy mieć ograniczoną precyzję co do wielkości efektu.

Przykład:

różnica = −15%

95% CI = −30% do −1%.

Wynik może być statystycznie istotny.

Ale niepewność co do wielkości efektu jest bardzo duża.

Rzeczywisty efekt może być bliski 1%, ale może też być znacznie większy.

Dlatego dobry artykuł naukowy nie powinien mówić tylko:

„wynik był istotny statystycznie”.

Powinien pokazywać również:

jak duży był efekt i z jaką precyzją został oszacowany.


Co oznacza przedział ufności 95%?

To temat, który często jest upraszczany w sposób prowadzący do błędów.

Nie należy interpretować 95% CI jako:

„jest 95% prawdopodobieństwa, że prawdziwy efekt znajduje się w tym konkretnym przedziale”.

W klasycznym podejściu częstościowym poprawna interpretacja dotyczy procedury, która przy wielokrotnym stosowaniu generowałaby przedziały zawierające prawdziwą wartość z określoną częstością.

Dla czytelnika artykułu można to jednak praktycznie uprościć:

przedział ufności pokazuje zakres wartości efektu zgodnych z danymi i przyjętą metodą statystyczną oraz informuje o precyzji oszacowania.

To wystarczy, aby poprawnie czytać większość publikowanych wyników klinicznych.

FDA również wskazuje, że przedział ufności jest ważnym narzędziem oceny niepewności i precyzji oszacowania efektu.


Czy statystyczna istotność zależy od liczby uczestników?

Tak.

Liczba uczestników jest jednym z elementów wpływających na precyzję oszacowania i moc statystyczną badania.

Przy bardzo małej liczbie uczestników nawet duża różnica może być trudna do wiarygodnego wykazania.

Przy bardzo dużej liczbie uczestników nawet niewielka różnica może osiągnąć istotność statystyczną.

Dlatego:

p-value bez informacji o wielkości badania jest niewystarczające do pełnej interpretacji.


A co z badaniami retatrutide?

W przypadku retatrutide mamy już przykład ewolucji danych:

Faza 2

Badanie obejmowało 338 osób i pokazało wyraźną zależność efektu od dawki oraz duże różnice w zmianie masy ciała względem placebo.

Faza 3

TRIUMPH-1 dostarczyło danych z dużo większej populacji i dłuższego okresu obserwacji. Przy 12 mg średnia redukcja masy ciała wyniosła 28,3% po 80 tygodniach, a różnice względem placebo były statystycznie istotne na poziomie p < 0,001.

To pokazuje, jak zmienia się siła danych wraz z rozwojem programu klinicznego.

Ale nawet tutaj nie kończymy analizy na p-value.


Czy p < 0,001 oznacza, że retatrutide działa „bardzo mocno”?

Nie bezpośrednio.

To dwa różne pojęcia.

p-value mówi o statystycznej sile danych przeciwko hipotezie zerowej.

Wielkość efektu mówi o tym, jak duża była obserwowana różnica.

W przypadku TRIUMPH-1 mamy oba elementy:

  • bardzo małe p-value,
  • dużą średnią różnicę w masie ciała względem placebo.

Dopiero połączenie tych informacji daje znacznie pełniejszy obraz.


Statystycznie istotny ≠ gwarantowany

To zdanie warto zapamiętać.

Jeżeli badanie pokazuje statystycznie istotny efekt, oznacza to, że:

dane przemawiają przeciwko określonej hipotezie zerowej.

Nie oznacza natomiast, że:

  • każdy człowiek zareaguje,
  • każdy zareaguje tak samo,
  • efekt będzie trwały,
  • nie wystąpią działania niepożądane,
  • korzyść będzie taka sama w każdej populacji,
  • substancja została zatwierdzona przez regulatora.

To wszystko są oddzielne pytania.


Statystycznie istotny ≠ klinicznie istotny

To drugie zdanie, które warto zapamiętać.

Możemy mieć:

dużą próbę + mały efekt + bardzo małe p

albo:

małą próbę + duży efekt + p > 0,05.

W pierwszym przypadku wynik może być statystycznie istotny, ale klinicznie mało znaczący.

W drugim może istnieć interesujący sygnał kliniczny, którego badanie nie potrafiło wystarczająco precyzyjnie potwierdzić.

Dlatego prawidłowa interpretacja badań klinicznych zawsze wymaga patrzenia na więcej niż jedną liczbę.


Jak czytać wynik badania w praktyce?

Kiedy widzisz zdanie:

„Retatrutide powodowało istotną statystycznie redukcję masy ciała”.

Nie kończ czytania.

Zadaj sobie kolejno kilka pytań.

1. Jaka była różnica między grupami?

Nie tylko:

ile schudła grupa retatrutide?

ale:

ile schudła grupa kontrolna?

FDA podkreśla, że w badaniach kontrolowanych kluczowe jest porównanie zmian między grupami, a nie samo porównanie wartości przed i po leczeniu w jednej grupie.

2. Jaki był przedział ufności?

Pokazuje, jak precyzyjnie oszacowano efekt.

3. Jakie było p-value?

Pomaga ocenić siłę danych względem hipotezy zerowej.

4. Jaki był główny punkt końcowy?

Czy był to wcześniej określony główny wynik badania?

5. Jak długo trwało badanie?

Efekt po 12 tygodniach i po 80 tygodniach to nie to samo.

6. Ilu było uczestników?

Mała i duża próba dają różny poziom precyzji.

7. Czy wynik był klinicznie istotny?

To osobne pytanie od statystyki.

8. Co z bezpieczeństwem?

Skuteczność nigdy nie powinna być analizowana w oderwaniu od działań niepożądanych.


Dlaczego media często upraszczają p-value?

Bo:

„p < 0,001”

brzmi znacznie bardziej jednoznacznie niż:

„wynik był zgodny z hipotezą o efekcie przy określonych założeniach statystycznych, a jego precyzję opisuje przedział ufności”.

Problem polega na tym, że pierwsza wersja jest efektowna, ale bez kontekstu może prowadzić do błędnych wniosków.

Właśnie dlatego strategia RETAFIT zakłada rozróżnienie danych od interpretacji i unikanie nadinterpretacji wyników.


Czego p-value nie mówi?

To warto zebrać w jednym miejscu.

P-value nie mówi:

❌ jakie jest prawdopodobieństwo, że lek działa,

❌ jakie jest prawdopodobieństwo, że wynik jest „prawdziwy”,

❌ ile kilogramów straci konkretny człowiek,

❌ jak duży jest efekt kliniczny,

❌ czy lek jest bezpieczny,

❌ czy efekt będzie trwały,

❌ czy wynik można przenieść na każdą populację,

❌ czy lek jest lepszy od każdej alternatywy,

❌ czy lek powinien zostać zatwierdzony.

To wszystko wymaga dodatkowych danych.


Co wiemy?

Wiemy, że istotność statystyczna jest elementem formalnej oceny wyników badań klinicznych.

Wiemy, że p-value pomaga ocenić dane w odniesieniu do określonej hipotezy zerowej.

Wiemy, że samo p-value nie opisuje wielkości efektu ani jego precyzji. Dlatego należy analizować je razem z wielkością efektu i przedziałem ufności.

Wiemy, że w badaniach z wieloma punktami końcowymi istnieje problem wielokrotnego testowania i zwiększonego ryzyka fałszywie dodatnich wyników.

Wiemy, że wyniki badań retatrutide wykazują silne różnice między grupami w odniesieniu do redukcji masy ciała, a w TRIUMPH-1 wszystkie badane dawki osiągnęły p < 0,001 względem placebo.


Czego jeszcze nie wiemy?

Sama istotność statystyczna nie mówi nam, jak ważny będzie efekt dla konkretnej osoby.

Nie pozwala również przewidzieć indywidualnej odpowiedzi.

Nie mówi, jak długo efekt będzie utrzymywał się u każdej osoby.

Nie odpowiada sama w sobie na pytanie o długoterminowe bezpieczeństwo.

Nie mówi również, czy dany wynik można bezpośrednio przenieść na każdą inną populację.

Dlatego wynik:

„statystycznie istotny”

jest dopiero jednym elementem układanki.


FAQ — istotność statystyczna w badaniach retatrutide

Czy p < 0,05 oznacza, że lek działa?

Nie. Oznacza, że wynik spełnia przyjęte kryterium istotności statystycznej względem określonej hipotezy zerowej. Trzeba jeszcze ocenić wielkość efektu, przedział ufności, projekt badania i jego znaczenie kliniczne.

Czy p < 0,001 oznacza, że efekt jest ogromny?

Nie. P-value nie jest miarą wielkości efektu.

Czy p = 0,06 oznacza, że lek nie działa?

Nie. Oznacza, że przy przyjętym poziomie istotności wynik nie spełnił kryterium statystycznego. Może nadal istnieć efekt, którego badanie nie oszacowało wystarczająco precyzyjnie.

Czy im mniejsze p, tym lepszy lek?

Nie. Można mieć bardzo małe p przy niewielkim efekcie.

Czy duży efekt zawsze będzie statystycznie istotny?

Nie. W małym lub bardzo zmiennym badaniu nawet duży efekt może nie osiągnąć przyjętego poziomu istotności.

Czy przedział ufności jest ważniejszy niż p-value?

Nie chodzi o wybór jednego z nich. Obie informacje są komplementarne. P-value pomaga ocenić siłę danych względem hipotezy zerowej, a przedział ufności pokazuje zakres i precyzję oszacowanego efektu.

Czy statystycznie istotny wynik oznacza klinicznie ważny efekt?

Nie. Istotność statystyczna i kliniczna to dwa różne pojęcia.

Czy statystycznie istotny wynik oznacza, że każdy osiągnie taki efekt?

Nie. Jak wyjaśnialiśmy w poprzednim artykule, wynik badania jest wynikiem grupy, a indywidualne odpowiedzi mogą się różnić.

Czy wynik p < 0,001 w TRIUMPH-1 jest ważny?

Tak — jest to bardzo silny wynik statystyczny dla badanego porównania. Ale jego interpretacja nadal wymaga uwzględnienia wielkości efektu, przedziałów ufności, populacji, czasu obserwacji i bezpieczeństwa.

Czy retatrutide jest już zatwierdzonym lekiem?

Nie. Retatrutide pozostaje substancją badaną klinicznie. Wynik statystycznie istotny w badaniu klinicznym nie jest równoznaczny z decyzją regulatora o zatwierdzeniu.


Podsumowanie

„Statystycznie istotny” nie oznacza „udowodniono wszystko”.

To określenie mówi o statystycznej ocenie danych w odniesieniu do określonej hipotezy.

Wartość p pomaga ocenić, jak trudno byłoby uzyskać obserwowany wynik — lub wynik bardziej ekstremalny — przy założeniu hipotezy zerowej.

Ale sama wartość p nie mówi:

jak duży jest efekt,

jak precyzyjnie został oszacowany,

czy ma znaczenie kliniczne,

czy występuje u każdego,

ani

czy korzyści przewyższają ryzyko.

Dlatego przy czytaniu badań retatrutide najlepiej patrzeć na cały zestaw informacji:

wynik → różnica między grupami → wielkość efektu → przedział ufności → p-value → główny punkt końcowy → czas obserwacji → bezpieczeństwo → kontekst populacji.

W przypadku retatrutide dane z badań fazy 2 i 3 pokazują bardzo wyraźne efekty dotyczące redukcji masy ciała, a w TRIUMPH-1 wyniki dla głównego punktu końcowego były statystycznie istotne na poziomie p < 0,001.

Ale właśnie dlatego warto nauczyć się czytać co znajduje się za tą jedną liczbą.

Bo statystyka nie ma odpowiadać na pytanie:

„Czy wynik wygląda imponująco?”

Ma pomóc odpowiedzieć na znacznie bardziej konkretne pytanie:

„Jak mocne są dane, jak duży jest obserwowany efekt i jak precyzyjnie możemy go oszacować?”

I to jest znacznie lepszy sposób czytania badań klinicznych niż samo szukanie magicznego p < 0,05.


Stan informacji: wrzesień 2026 r.

Retatrutide pozostaje substancją badaną klinicznie i nie jest obecnie zatwierdzonym lekiem. Materiał ma charakter edukacyjny i nie stanowi porady medycznej.