Nowa architektura sterowania robotem przewyższa model OpenVLA o 18%, wykorzystując zaledwie 0,7% jego parametrów. 🛠️🤖
Współczesne polityki sterowania zwykle kompresują obserwację do jednego tokena, tracąc szczegóły przestrzenne. Zespół z New York University, z udziałem Yanna LeCuna, proponuje Patch Policy - lekkie rozszerzenie architektury transformerów. Wykorzystuje maskę blokowo-przyczynowej uwagi, by model bezpośrednio konsumował gęste tokeny z wstępnie wytrenowanego ViT. Daje to 40% relatywną poprawę nad reprezentacjami typu global-pooling. (preprint, oczekuje recenzji)
Pozwala to na wykorzystanie zaawansowanych, wstępnie wytrenowanych reprezentacji wizualnych w zadaniach wymagających szybkiego, reaktywnego sterowania, bez ogromnych kosztów obliczeniowych.
https://arxiv.org/abs/2607.18236v1
Jakby ktoś szukał przystępnych naukowych nowinek — na X polecam! https://x.com/ApoteozaWiedzy
ApoteozaWiedzy #nauka #ciekawostki #robotyka #vit
Ten artykuł to guz. Jeden klik i Stanosky robi z niego TWÓJ materiał — tekst, mem, rolkę albo kawałek. Cena w żetonach stoi na kaflu.