2026-09-27 · ← Aktualności
HomeBody daje GPT Astra pamięć przestrzenną i ciało humanoida
HomeBody łączy GPT Astra z pamięcią przestrzenną i biblioteką umiejętności humanoida Unitree G1. Badacze z Caltechu i Stanfordu pokazują sprzątanie wielu przedmiotów oraz wyjęcie leku z szuflady po nieprecyzyjnym poleceniu w nieznanej wcześniej kuchni.
GPT Astra wybiera umiejętności zamiast bezpośrednio sterować silnikami
System zastępuje wyuczoną warstwę pośrednią VLA modelem VLM, który wywołuje wielokrotnego użytku umiejętności. GPT Astra wybiera nawigację, chwytanie, odkładanie lub otwieranie szuflady i przekazuje ustrukturyzowany cel. Ruch na niskim poziomie nadal obsługują wyspecjalizowane planery oraz kontrolery.
Przed rozpoczęciem pracy robot bada pomieszczenie za pomocą kamer, LiDAR, SLAM i danych o położeniu stawów. Astra pomaga zbudować z tych informacji cyfrowego bliźniaka w Isaac Sim. Zapisane klatki pozwalają później odnaleźć obiekt poza aktualnym polem widzenia. Autorzy deklarują brak danych treningowych specyficznych dla środowiska oraz dodatkowego uczenia polityki.
Model językowy staje się planerem fizycznych czynności
Uwaga Mollicka o zaskakująco szerokim zastosowaniu LLM trafia dokładnie w ten przypadek. Model językowy nie wysyła poleceń do silników z częstotliwością 250 Hz. Rozkłada niejednoznaczną intencję człowieka na sekwencję dostępnych działań i po błędzie wybiera następny krok na podstawie informacji zwrotnej z narzędzia.
W robotyce liczy się modułowość. Nową umiejętność można podłączyć przez wspólny interfejs, zamiast ponownie trenować cały system dla jednej kuchni. Ta sama zaleta uzależnia jednak wynik od mapy, opisów obiektów i niezawodności każdej umiejętności składowej.
Autonomia opiera się na rozbudowanym przygotowaniu i stałej infrastrukturze
Demonstracja nie zaczyna się w pustym mieszkaniu od jednego zdania. Wymaga eksploracji, rejestracji mapy, rekonstrukcji Real2Sim oraz laptopa z RTX 4090. GPT Astra działa zdalnie, a opóźnienie rozumowania zatrzymuje robota między czynnościami. Autorzy wymieniają też ograniczony zasięg, przegrzewanie serw palców oraz czas i koszt API potrzebne do budowy cyfrowego bliźniaka.
Nowe pomieszczenia i błędy poza scenariuszem rozstrzygną ocenę
Kolejnym istotnym sygnałem będzie powtarzalne wdrożenie w różnych pomieszczeniach, z innymi szufladami, przeszkodami i przedmiotami. Liczyć się będą skuteczność całych zadań, czas przygotowania oraz bezpieczne zakończenie po błędzie. Dopiero te wyniki pokażą, czy biblioteka umiejętności skaluje się lepiej niż polityka trenowana dla konkretnego środowiska.
Werdykt Lilith
Humanoid, który znajduje lek w zamkniętej szufladzie, zaczyna wyglądać jak współpracownik. Dopóki przed zmianą potrzebuje cyfrowego bliźniaka, RTX 4090 i cierpliwości do przestojów, kierownik może trzymać klucze w kieszeni.
Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.
Oryginalne źródło ↗ ↗