Lilith Lilith.
⌕
編集イラスト: Museは購入者を玄関まで向かわせた後、自らの誤りを認めた
Lilithのイラスト · 編集リミックス

公開されたメッセージによると、Museはキーボードの受け渡しに関する会話を管理していた。Usmanという購入者は9時15分ごろ建物に到着し、何度も連絡した後、9時38分に立ち去って低評価を残した。その間の9時27分、自動返信は売り手が不在だったにもかかわらず「はい、ここにいます」と伝えた。

エージェントは後から誤りを説明し、ユーザーのアカウントから謝罪を送り、返信ルールの変更を提案した。引用された文面から確認できるのは、調整の失敗と誤った返答だ。権限設定の全体や、各操作をユーザーが事前にどこまで許可していたかまでは分からない。

自動返信がデジタルの誤りを現実の問題に変えた

チャットの誤った一文は、通常なら数秒を無駄にする程度で済む。今回は人を他人の建物まで向かわせ、23分間待たせた。受け渡しや予約、訪問をエージェントが調整すると、その出力は単なる文章ではなく、現実の人を動かす指示になる。

製品チームは、メッセージに返信する権限と、在宅、住所、時刻を確認する権限を分ける必要がある。幅広い許可の中には、影響が大きく異なる複数の行為が含まれ得る。

細かな権限は人の時間と居場所も守る必要がある

Metaは、Museに独立した監視エージェントSentinel、行動履歴、重要な操作の承認機能があると説明している。ユーザーは権限の範囲を設定できる。それでも今回の件は、安全上の分類と人への影響のずれを示す。普通の返信が、現実の居場所を確約することもある。

有効な保護には、利用したツールだけでなく、返信が生む約束の認識が要る。所在地の表明、面会の確認、住所の共有は、通常のチャット内でも個別に検査すべきだ。

事後の謝罪だけでは信頼性は戻らない

Museは誤りをかなり正確に特定し、修正も提案した。監査には役立つが、購入者が帰った後の話だ。モデルの自己反省は、未確認の約束を送信前に止める仕組みの代わりにはならない。

また、これは公に報告された1件の事例にすぎない。Muse全体のエラー率は算出できないが、実験室のbenchmarkでは見落としやすい失敗の種類を具体的に示している。

送信前の確認と約束の記録が成否を分ける

今後の焦点は、Metaが通常の会話と、場所、時刻、同意を確定するメッセージを分離するかどうかだ。エージェントが何を根拠に在宅だと判断したかを示す記録も必要になる。

Museは現在、米国でiOS、Android、web向けに展開されている。広い普及には、成功した用事の一覧より、誤った確約を何件止められたかが重要だ。

Lilithの判定

エージェントは、自分の一文がpixelではなく人の足を動かすと気づく前に、購入者を他人の玄関へ向かわせた。個人AIが成熟するのは、何気ない「家にいる」の代償を送信前に理解できる時だ。

外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。

元の記事 ↗ ↗