Slika je izdala VLA Model Helix: En-SECTENSKEG

Feb 27, 2025 Pustite sporočilo

Pred kratkim je Figure AI, inovativno podjetje na področju robotike v Združenih državah Amerike, izdal velik preboj: model splošnega namena vizualnega jezika (VLA), imenovan Helix. Ta model prvič uresničuje neprekinjeni nadzor nad celotnim zgornjim delom telesa humanoidnega robota in odlično vključuje zaznavanje, razumevanje jezika in nadzor učenja.

 

Pojav modela Helix pomeni pomemben korak naprej pri operativni prožnosti humanoidnih robotov. S preprostimi ukazi v naravnem jeziku lahko robot zlahka dojame skoraj vsak majhen gospodinjski predmet, tudi tiste, ki se med treningom nikoli niso dotaknili, brez predhodnih demonstracij ali programiranja po meri. Ta sposobnost je posledica močne sposobnosti posploševanja modela Helix.

humanoid robot

Slika AI je poudarila, da je model Helix ustvaril številne industrijske prve. Prvič omogoča visoko hitrost neprekinjenega nadzora celotnega zgornjega dela telesa humanoidnega robota, vključno s fleksibilnim nadzorom zapestja, trupa, glave in vsakega prsta. Pri testiranju je robot uspešno predelal na tisoče novih predmetov, ki so bili zamašeni z neorganizacijo, od steklovine in igrač do orodij in oblačil, brez predhodnih demonstracij ali programiranja.

 

Še bolj neverjetno je, da ima model Helix tudi zmogljivosti za sodelovanje z več roboti. V testu sta oba robota lahko sodelovala pri dolgoročnih, zapletenih nalogah in sodelovala pri nikoli prej vidnih predmetih, kot je razvrščanje neznanih živil skupaj. Ta sposobnost odpira več možnosti za praktično uporabo robotov v domačem okolju.

 

Model Helix prikazuje tudi odlične razumevanja scene in semantične zmogljivosti razčlenjevanja. Ko je pozvan, da "pobere puščavski predmet", robot ne more samo prepoznati, da igrače kaktus ustreza temu abstraktnemu konceptu, ampak tudi izbere najbližjo roko in izvede natančno oprijemljivo dejanje. Ta univerzalna funkcija prijema, od jezika do gibanja, zagotavlja večjo udobje za uvajanje humanoidnih robotov v nestrukturiranem okolju.

 

Model Helix je lahko te preboje dosegel zahvaljujoč svoji prelomni arhitekturi dvojnega sistema. Arhitektura je sestavljena iz sistema 1 in sistema 2, ki sta odgovorna za natančen nadzor, razumevanje scene in semantično razčlenitev scene. Sistem 2 temelji na odprtokodnem VLM s 7B parametri, ki deluje s frekvenco 7-9 Hz, da se zagotovi posploševanje po predmetih in scenarijih. Sistem 1 je 80 m parametrski model vizualne motorične strategije, ki pretvori semantično predstavitev sistema 2 v navodila za neprekinjeno delovanje s frekvenco 200Hz za doseganje odziva v realnem času na milisekund. Ta ločena arhitektura omogoča obema sistemima opravljanje svojih funkcij in sodelujeta pri doseganju učinkovitega nadzora humanoidnih robotov.

 

Modeli Helix med usposabljanjem uporabljajo zelo malo virov. Z uporabo približno 500 ur kakovostnih nadzorovanih podatkov je ekipa uspela doseči močno posplošitev predmetov. Ti podatki predstavljajo manj kot 5% velikosti predhodno zbranih naborov podatkov VLA in se ne zanašajo na zbiranje entitet z več bot ali na večstopenjski trening. Ta dosežek ne samo kaže na učinkovitost modela Helix, ampak zagotavlja tudi več možnosti za razvoj humanoidnih robotov v prihodnosti.