Dodano: 21.09.2026

Nowe badania rzucają światło na to, jak AI można stosować w medycynie. Po pierwsze, nie ma dowodów na to, że AI zmniejsza liczbę błędów medycznych. Po drugie, jeśli AI niepoprawnie triażuje pacjentów, często problemem jest prompt, a nie same umiejętności AI.
Pierwsze badanie opublikowane w Nature Medicine przeprowadzono w 16 kenijskich placówkach podstawowej opieki zdrowotnej. Łącznie objęło 9691 pacjentów oraz 103 lekarzy. 52 klinicystów wspierało się systemem wspomagania decyzji klinicznych opartym na dużym modelu językowym, a 51 pracowało bez AI.
Celem badania było określenie liczby pacjentów, których leczenie zakończyło się niepowodzeniem, czyli gdy m.in.: pacjent ponownie zgłasza się do lekarza z utrzymującymi się objawami, leczenie trzeba kontynuować na wyższym poziomie opieki zdrowotnej (u specjalisty) albo skierować chorego na SOR, nie wystawiono skierowania, nawet jeśli było wymagane; nieprawidłowo przepisano leki, postawiono błędną diagnozę albo wystąpiło zdarzenie zagrażające życiu lub zgon.
Po 14 dniach obserwacji naukowcy doszli do wniosku, że nie było żadnej różnicy między lekarzami diagnozującymi i leczącymi z pomocą AI oraz bez AI. W grupie korzystającej z AI niepowodzenie leczenia zarejestrowano u 102 na 4693 pacjentów (2,2 proc.). Z kolei w grupie kontrolnej – u 94 na 4654 pacjentów (2,0 proc.). Różnica była statystycznie nieistotna.
Jest to jedno z niewielu badań przeprowadzonych w warunkach klinicznych. Wiele wcześniejszych, ale zrealizowanych w warunkach laboratoryjnych, sugerowało, że najlepsze wyniki osiąga AI.
Ale jest też dobra wiadomość: według badania, praca z AI wyraźnie poprawia jakość dokumentacji medycznej. Lekarze, którzy z niej korzystali, częściej notowali prawidłowe rozpoznanie, dokumentacja była bardziej kompletna, a plan leczenia – jasno określony.
Kolejny mit obalili badacze z Microsoftu i Carnegie Mellon University: AI stosowana do triażu pacjentów w stanach zagrożenia życia podejmuje dobre decyzje, ale wymaga odpowiedniego skalibrowania.
Naukowcy postanowili podważyć wnioski z badania „ChatGPT Health performance in a structured test of triage recommendations”, które pod lupę wzięło skuteczność ChatGPT Health: System prawidłowo zakwalifikował jedynie 48 proc. przypadków wymagających natychmiastowej pomocy. W przypadku 10 proc. pacjentów zalecił pilną pomoc medyczną, choć taka nie była potrzebna. Wśród przypadków, których AI nie rozpoznała jako wymagających pilnej pomocy, znalazły się m.in. cukrzycowa kwasica ketonowa i niewydolność oddechowa.
W pracy „High-Stakes Decisions with Language Models: Insights from Emergency Triage” opublikowanej na początku sierpnia, autorzy sprawdzili, czy model rzeczywiście aż tak źle triażuje chorych. W swojej analizie przeanalizowali łącznie 1248 przypadków, w których 640 zaklasyfikowano jako wymagające pilnej pomocy.
Badacze oddzielili ocenę prawdopodobieństwa wystąpienia stanu nagłego od decyzji o skierowaniu pacjenta na SOR. W przypadku GPT-5-mini, czyli modelu stosowanego przez ChatGPT Health, AUROC – wskaźnik pokazujący, jak model potrafi odróżnić przypadki pilne od niepilnych – wynosił 0,99, co oznaczało wysoką zdolność AI do prawidłowej klasyfikacji stanu chorego. Dla GPT-5.4 było to 0,95, DeepSeek-V4-Pro 0,97, a dla Claude Fable 5 – 0,99.
Następnie naukowcy zmienili prompt, precyzując, jak należy traktować obydwa rodzaje błędów: przeoczenie stanu nagłego oraz niepotrzebne skierowanie pacjenta do szpitala. Przy założeniu, że przeoczenie stanu nagłego jest pięć lub dziesięć razy kosztowniejsze niż niepotrzebne skierowanie, odsetek prawidłowo wykrytych przypadków nagłych przez GPT-5-mini wzrósł o około 50 proc., bez zwiększenia liczby niepotrzebnych skierowań. W rozszerzonej analizie poprawa wyniosła około 30 proc., a liczba niepotrzebnych skierowań wzrosła tylko nieznacznie.
Ale nie każdy błąd AI można naprawić lepszym promptem. Jeśli model nie rozpoznaje, że pacjent znajduje się w stanie zagrożenia zdrowia lub życia, problemem jest jego zdolność do oceny sytuacji medycznej. Jeśli natomiast prawidłowo ocenia ryzyko, ale mimo to podejmuje niewłaściwą decyzję, trzeba jasno określić, według jakich kryteriów powinien działać.
Nie ma jednego optymalnego sposobu kalibrowania systemów triażowania przez AI. Wszystko zależy od kontekstu sytuacji. W przypadku SOR-u ważniejsze może być uniknięcie przeoczenia ciężkiego przypadku, nawet kosztem większej liczby niepotrzebnie wystawionych skierowań (i wyższych kosztów). Inaczej może wyglądać to w małej placówce, gdzie zasoby są ograniczone.
Autorzy rekomendują, aby w systemach wysokiego ryzyka prompt zawierał pożądane priorytety, a modele były testowane w całym zakresie możliwych kompromisów między bezpieczeństwem a liczbą niepotrzebnych interwencji. Proponują także stosowanie zewnętrznych progów decyzyjnych lub rozwiązań hybrydowych opartych na AI i interwencji człowieka. Właściwa polityka decyzyjna jest tak samo ważna jak same umiejętności AI. Wiedzą to lekarze, którzy też muszą szybko podejmować decyzje w stanach zagrożenia życia lub zdrowia, balansując między ryzykiem a niepotrzebnymi badaniami i stresem dla pacjenta.
Czytaj także: Autonomiczna AI jest gotowa, aby leczyć pacjentów