Lilith.
⌕
Ilustracja redakcyjna: Gemini obsłużył 98 prawdziwych pacjentów, ale każdy czat nadzorował lekarz
Ilustracja Lilith · remiks redakcyjny

Prospektywne badanie opublikowane w The Lancet sprawdziło konwersacyjny system AMIE podczas rzeczywistych wizyt w pilnej opiece podstawowej. Spośród 114 zakwalifikowanych dorosłych 98 ukończyło zarówno czat z AI, jak i późniejszą wizytę u lekarza. To warunki znacznie bliższe praktyce klinicznej niż test na syntetycznych przypadkach, ale nadal było to badanie wykonalności z wyjątkowo ścisłym nadzorem.

AMIE rozmawiała z pacjentami przed wizytą i przekazywała lekarzom podsumowanie

Pacjenci prowadzili tekstową rozmowę z AMIE maksymalnie 5 dni przed wizytą dotyczącą jednego pilnego problemu. System zbierał wywiad, przedstawiał możliwe diagnozy i proponował tematy do omówienia z lekarzem. Lekarz podstawowej opieki mógł następnie przeczytać transkrypcję i automatyczne podsumowanie przed spotkaniem.

AMIE korzystała z Gemini 2.5 Pro i specjalnie dostosowanego agentowego workflow, a nie ze zwykłego chatbota bez dodatkowej konfiguracji. Po pierwszych 50 spotkaniach badacze przeszli na Gemini 2.5 Flash z powodu opóźnień. System nie miał dostępu do dokumentacji medycznej, ale prowadził własny wywiad z pacjentem i na bieżąco utrzymywał podsumowanie, diagnostykę różnicową oraz projekt planu postępowania.

Jakość zbliżyła się do lekarzy, lecz praktyczność planów pozostała w tyle

Zaślepiona ocena nie wykazała istotnej różnicy między AMIE a lekarzami w ogólnej jakości diagnostyki różnicowej ani w adekwatności i bezpieczeństwie planów postępowania. Lekarze tworzyli jednak plany bardziej praktyczne i opłacalne. Ta różnica oddziela dobrze brzmiącą poradę medyczną od decyzji, którą można wykonać w konkretnej przychodni.

Lekarze wypełnili ankiety po 60 z 98 przypadków. W 44 przypadkach przeczytali wynik AMIE przed wizytą, w 33 uznali go za pomocny w przygotowaniu, a w 25 stwierdzili, że mógł zmienić ich działanie. Badanie mierzy więc także wartość uporządkowanego wywiadu przed wizytą, a nie wyłącznie rywalizację modelu z lekarzem.

Zero przerwanych czatów wymagało stałego nadzoru lekarza

Zgodnie z wcześniej określonymi zasadami lekarze nadzorujący nie musieli przerwać żadnej ze 100 ukończonych rozmów z AMIE. Każdy czat obserwował jednak na żywo lekarz odpowiedzialny za bezpieczeństwo, korzystając z udostępnionego ekranu. W pięciu interakcjach nadzorcy uzupełnili informacje kliniczne, a w jednej odnotowali halucynację. Brak przerwanych rozmów nie oznacza zatem braku błędów ani bezpieczeństwa bez nadzoru.

Badanie przeprowadzono w jednym ośrodku akademickim, wyłącznie wśród anglojęzycznych dorosłych i bez grupy kontrolnej dla głównych celów bezpieczeństwa. Nie sprawdzano samodzielnego użycia w domu ani pracy z pełną dokumentacją medyczną. Wyniki wspierają wykonalność pod nadzorem, a nie zastąpienie lekarza.

Kolejny test musi zmierzyć samodzielność, wyniki pacjentów i koszt nadzoru

Potrzebne są większe badania kontrolowane w różnych systemach ochrony zdrowia i językach. Powinny śledzić wyniki pacjentów, błędną ocenę pilności, powroty do opieki oraz sytuacje, w których model i lekarz się nie zgadzają. Równie ważne są koszt nadzoru bezpieczeństwa oraz czas, który lekarze oszczędzają lub tracą na sprawdzanie wyników.

Jeśli AMIE skróci zbieranie wywiadu i przekaże lekarzowi użyteczne podsumowanie, może przynieść wartość jeszcze przed osiągnięciem autonomicznej diagnostyki. Przejście od tej roli do samodzielnego doradcy klinicznego wymaga jednak dowodów, których badanie z lekarzem przy każdym ekranie jeszcze nie dostarcza.

Werdykt Lilith

AMIE weszła do gabinetu z przekonującym głosem, ale za jej krzesłem cały czas stał lekarz z ręką na wyłączniku. Postęp jest realny, samodzielny dyżur jeszcze się nie zaczął.

Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.

Oryginalne źródło ↗ ↗