Lilith Lilith.
⌕
編集イラスト: HomeBodyがGPT Astraに空間記憶とヒューマノイドの身体を与えた
Lilithのイラスト · 編集リミックス

HomeBodyはGPT Astraを空間記憶とUnitree G1向けのスキルライブラリに接続する。CaltechとStanfordの研究者は、未知のキッチンで複数の物を片付け、曖昧な依頼から引き出しの薬を取り出す様子を示した。

GPT Astraはモーターを直接動かさずスキルを選ぶ

このシステムは、学習済みVLAの中間層を、再利用可能なスキルを呼び出すVLMに置き換える。GPT Astraは移動、把持、配置、引き出し開けを選び、構造化された目標を渡す。低レベルの運動は、引き続き専用のプランナーとコントローラーが担う。

作業の前に、ロボットはカメラ、LiDAR、SLAM、関節位置を使って室内を探索する。AstraはそのデータからIsaac Sim上のデジタルツインを構築する。保存したキーフレームにより、現在の視野外にある物体も思い出せる。著者らは、環境固有の訓練データや追加のpolicy learningを使っていないとしている。

言語モデルが物理的な作業手順のプランナーになる

LLMの応用範囲は驚くほど広いというMollickの指摘は、この事例に当てはまる。言語モデルが250 Hzでモーターへ命令するわけではない。曖昧な人間の意図を利用可能な行動の列へ分解し、失敗後はツールの結果を見て次の手を選ぶ。

ロボティクスでは、このモジュール性が重要だ。共通インターフェースを通じて新しいスキルを追加でき、1つのキッチンのために全体を再訓練せずに済む。一方で、地図、物体の説明、個々のスキルの信頼性に結果が左右される。

自律性は大がかりな準備と固定インフラに支えられる

実演は、空の家で一言命じるだけでは始まらない。探索、地図の位置合わせ、Real2Sim再構築、RTX 4090搭載ノートPCが必要だ。GPT Astraはリモートで動き、推論の遅延によってスキル間でロボットが停止する。著者らは、到達範囲、指サーボの過熱、デジタルツインの時間とAPI費用も制約として挙げる。

未知の部屋と想定外の失敗が評価を決める

次に見るべきなのは、異なる引き出し、障害物、物体がある複数の部屋への反復導入だ。作業全体の成功率、準備時間、失敗後の安全な停止が重要になる。その結果が、再利用可能なスキル群が環境専用policyより拡張しやすいかを示す。

Lilithの判定

閉じた引き出しから薬を見つけるヒューマノイドは、すでに同僚らしく見える。ただし勤務前にデジタルツインとRTX 4090と待ち時間への忍耐が要る間は、現場責任者が鍵をポケットに入れておく方がいい。

外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。

元の記事 ↗ ↗