Lilith Lilith.
CS EN PL
Ilustracja redakcyjna: Microsoft testuje rozumienie przestrzeni: Nowy benchmark MindTopo
Ilustracja Lilith · remiks redakcyjny

Modele wizualne podchodzą do testu przestrzennego

Microsoft Research opublikował MindTopo, nowy benchmark skupiający się na tym, jak sztuczna inteligencja rozumie przestrzeń i relacje topologiczne. Chociaż obecne modele wizualne (VLM) świetnie radzą sobie z opisywaniem, że na zdjęciu jest pies i ławka, często nie rozumieją, co to oznacza w przestrzeni. Z publicznego ogłoszenia wynika, że benchmark testuje podstawowe pojęcia przestrzenne, takie jak ścieżki, płoty, przeszkody i węzły (szczegóły z samego artykułu były niedostępne podczas weryfikacji ze względu na blokadę źródła).

MindTopo stara się uchwycić zdolność modelu do rozumienia granic przestrzennych i łączności (to znaczy zdolność wywnioskowania, czy jeden obiekt może fizycznie dotrzeć do drugiego, czy też na drodze stoi mu przeszkoda.

Do planowania nie wystarczy już tylko widzieć

Dla twórców robotyki i agentów działających w rzeczywistym lub symulowanym świecie jest to kluczowy element układanki. Model wizualny, który nie rozumie, że ogrodzenie tworzy zamkniętą przestrzeń, z której nie można po prostu wyjść, jest bezużyteczny do planowania w świecie fizycznym.

Do tej pory modele trenowano głównie pod kątem rozpoznawania obiektów. MindTopo przesuwa wymagania wobec VLM w kierunku wnioskowania przestrzennego (spatial reasoning). Jeśli agent ma nawigować robotem po pokoju, musi rozumieć topologię przestrzeni, a nie tylko umieć wymienić znajdujące się w niej meble.

Testy ujawnią martwy punkt modeli wizualnych

W tym miejscu uderzamy w obecne ograniczenia architektury. Większość dużych modeli wizualnych trenuje się na statycznych obrazach z internetu, gdzie topologia nie jest głównym rezultatem. Model potrafi wygenerować opis obrazu, ale nie tworzy fizycznego modelu przestrzeni.

Wprowadzenie specjalistycznego benchmarku, takiego jak MindTopo, prawdopodobnie ujawni, jak słabo współczesne modele radzą sobie z rozumieniem przestrzennym. Stworzenie iluzji rozumienia obrazu jest łatwiejsze niż konsekwentne odpowiadanie na pytania o fizyczną dostępność i przeszkody.

Wyniki w MindTopo jako przepustka do robotyki

Prawdziwym dowodem na to, że modele coraz lepiej rozumieją świat, będzie włączenie benchmarków takich jak MindTopo do standardowych zestawów ewaluacyjnych. Pokaże to, które laboratoria zadowalają się chatbotami generującymi ładne opisy obrazów, a które realnie dążą do tego, by dać swoim agentom kontekst przestrzenny do wykorzystania w robotyce.

Werdykt Lilith

Rozpoznanie krzesła na zdjęciu to fajna sztuczka, ale jeśli nie wiesz, czy można obok niego przejść, wciąż jesteś tylko drogą zabawką dla prawdziwego świata. Microsoft właśnie zaczął mierzyć tę różnicę.

Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.

Oryginalne źródło ↗