Roboty uczą się rozumieć obiekty w 3D, nie używając żadnych sensorów głębi. 🤖🛠️
Nowa metoda treningu modeli VLA (wizja-język-akcja) każe im internalizować strukturę przestrzenną przedmiotów wyłącznie na podstawie obrazu 2D. Podczas treningu wykorzystuje się SAM3D jako zamrożonego nauczyciela - lokalizuje on obiekty, tworzy maski i wyciąga gęste, trójwymiarowe reprezentacje celu. Są one wpasowywane w cechy wizualne modelu π₀, który uczy się działać tak, jakby widział głębię. W testach na LIBERO osiągnięto 99,1%, a na CALVIN średnią długość sekwencji 4,11. Przy działaniu nie potrzeba już chmur punktów, masek ani dodatkowego sprzętu - jedynie zwykła kamera.
To toruje drogę do długich, wieloetapowych zadań manipulacyjnych, gdzie robot w każdym podzadaniu musi precyzyjnie skupić się na innym obiekcie - bez dźwigania kosztownej percepcji 3D na pokładzie. (preprint, oczekuje recenzji)
https://arxiv.org/abs/2607.25912v1
Jakby ktoś szukał przystępnych naukowych nowinek — na X polecam! https://x.com/ApoteozaWiedzy
ApoteozaWiedzy #nauka #ciekawostki #robotyka #sztucznainteligencja
Ten artykuł to guz. Jeden klik i Stanosky robi z niego TWÓJ materiał — tekst, mem, rolkę albo kawałek. Cena w żetonach stoi na kaflu.