Lilith.
⌕
編集イラスト: Geminiは実患者98人に対応したが、全チャットを医師が監視した
Lilithのイラスト · 編集リミックス

The Lancetに掲載された前向き研究は、実際の緊急性のあるプライマリケア診療で会話型システムAMIEを試した。登録された成人114人のうち98人が、AIとのチャットとその後の医師の診察を両方完了した。模擬症例だけの試験より臨床現場に近いが、きわめて厳密な監督下での実行可能性研究である。

AMIEは診察前に患者へ問診し、医師へ要約を渡した

患者は、1つの急性症状について受診する最大5日前にAMIEとテキストで会話した。システムは病歴を聞き、考えられる診断を示し、医師と話すべき項目を提案した。その後、プライマリケア医は診察前に会話記録と自動要約を確認できた。

AMIEは、一般向けchatbotをそのまま使ったものではなく、調整済みのagent workflowとGemini 2.5 Proを組み合わせたシステムだ。最初の50件の後、研究者は遅延を理由にGemini 2.5 Flashへ切り替えた。診療記録にはアクセスしなかったが、患者へ独自に問診し、要約、鑑別診断、治療方針案を会話中に更新した。

質は医師に近づいたが、治療計画の実用性では及ばなかった

盲検評価では、鑑別診断の総合的な質、治療計画の妥当性と安全性について、AMIEと医師の間に有意差が見つからなかった。一方、医師の計画は実行可能性と費用対効果で優れていた。読みやすい医療助言と、特定の診療所で実行できる判断を分ける重要な差だ。

医師は98件中60件で事後アンケートに回答した。44件では診察前にAMIEの出力を読み、そのうち33件で準備に役立ったと答え、25件で自分の対応を変えた可能性があるとした。この研究は、モデルと医師の競争だけでなく、診察前に整理された問診の価値も測っている。

会話停止0件は医師の常時監視下で得られた

事前に定めた基準に基づき、監督医は完了したAMIEとの会話100件を1件も停止しなかった。ただし、安全担当の医師が画面共有を通じて全チャットをリアルタイムで見ていた。5件では臨床情報を補い、1件ではhallucinationを記録した。停止0件は、誤り0件や監督なしの安全性を意味しない。

研究は1つの大学医療センターで英語を話す成人だけを対象に実施され、主要な安全評価には対照群がなかった。家庭での無監督利用や、完全な診療記録を使う運用も試していない。結果が支えるのは監督下での実行可能性であり、医師の代替ではない。

次の試験は自律性、患者転帰、監督コストを測る必要がある

次に必要なのは、異なる医療制度と言語を含む大規模な対照研究だ。患者転帰、緊急度の誤判定、再受診、モデルと医師の意見が割れた事例を追跡する必要がある。安全監督の費用と、出力確認によって医師が節約または消費する時間も同じく重要だ。

AMIEが問診を短縮し、医師へ使える要約を渡せるなら、自律診断より前の段階でも価値を生む。その役割から独立した臨床助言者へ進むには、全画面を医師が見守った今回の研究だけでは足りない。

Lilithの判定

AMIEは有能な声で診察室に入ったが、その椅子の後ろには常にスイッチへ手を置く医師がいた。前進は本物でも、単独勤務はまだ始まっていない。

外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。

元の記事 ↗ ↗