Vědci opustili skvělé kariéry a plní si miliardový sen. Vyvinuli AI, která učí roboty koukáním na video

V Generalist AI přišli na to, že robot nepotřebuje návod ani týdny tréninku. Podívá se na člověka, zkusí pohyb po něm a při chybě hledá jinou cestu.

generalistai
Foto: Generalist AI
Zakladatelé startupu, zleva Pete Florence, Andy Zheng a Andrew Barry
0Zobrazit komentáře

Baví vás CzechCrunch?

Vídejte ho na Googlu častěji.

Letos v červnu byl americký startupu Generalist AI, který před dvěma lety založili tři elitní výzkumníci , oceněn na dvě miliardy dolarů. Uplynulo pár týdnů, je srpen a hodnota firmy při jednáních o dalších investicích skáče o polovinu výš, k hranici tří miliard. Jedním z důvodů je, že startup ukázal světu pokročilou umělou inteligenci GEN-1.5, která řeší jeden z největších problémů moderní robotiky. Stroji stačí ukázat krátké video, on jej okamžitě pochopí a pustí se do práce.

Až dosud přitom učení robotů představovalo pro inženýry mravenčí a zdlouhavou práci. I v éře AI bylo běžné, že když měl stroj v továrně, skladu nebo domácnosti zvládnout novou činnost, museli výzkumníci sbírat obrovské množství specializovaných dat a model týdny jemně dolaďovat. Jakákoliv drobné odchylka v prostředí navíc vyžadovala další ruční zásahy a přeprogramování.

Nová AI od Generalist na to jde jinak. Robotí pracovníci dostanou ukázku v podobě krátkého videozáznamu trvajícího tři až dvanáct sekund. Během okamžiku pochopí princip úkolu a pustí se do něj. V testech napříč desítkou fyzických úkolů dosáhla tato AI na první pokus téměř šedesátiprocentní úspěšnosti. Pokud dostala pět minut na lehké dolaďování, úspěšnost vyletěla přes osmdesát procent.

V praxi to vypadá skutečně působivě. V kancelářích startupu sledoval dvouramenný robot krátký klip, v němž člověk rozepíná kabelku a vytahuje z ní peníze. Když pak dostal za úkol udělat totéž a jeho pravé kleště sklouzly, stroj nezamrzl. Okamžitě změnil úhel a k vytažení bankovek použil levou ruku. Přítomný inženýr jen užasle koukal. Ostatně, ve videu výše je to vidět nejlépe.

Oříškem byl pro firmu dostatek tréninkových dat. Zatímco běžné jazykové modely typu ChatGPT se učí z textů z celého internetu, žádný internet robotických pohybů neexistuje. V Generalist AI proto vyvinuli speciální ovladače připomínající mechanické rukavice a poslali je tisícům lidí po celém světě. Ti v nich doma běžně fungují, skládají krabice nebo otevírají balíčky s chipsy. Firma tak získala přes půl milionu hodin reálných dat, což představuje náskok před konkurencí.

Nastartujte svou kariéru

Více na CzechCrunch Jobs

To, jak zásadní průlom GEN-1.5 představuje, vynikne v kontextu slov zakladatele čínského robotického gigantu Unitree Wanga Sing-singa. Ten na nedávné konferenci v Pekingu podle stanice CNBC upozornil, že humanoidní roboti mohou mít svůj „ChatGPT moment“, tedy chvíli, kdy v neznámém prostředí zvládnou většinu úkolů jen na základě jednoduchého pokynu, vzdálený tři až deset let.

Hlavní překážkou celého odvětví je podle něj právě neschopnost strojů přenášet dovednosti mezi různými úkoly a zvládat ty nejcitlivější části pohybu. A právě tento problém se Generalist AI daří lámat výrazně rychleji, než si mnozí mysleli.

Zajímavé také je, kdo za celým tímto úspěchem stojí. Je to trojice výzkumníků, která opustila své prestižní pozice v technologických firmách, aby se pustila do vlastního podnikání. Pete Florence působil ve výzkumné laboratoři Google DeepMind jako vedoucí pracovník a Andy Zeng tam vedl klíčové projekty na pomezí AI a robotiky. Andrew Barry zase v ikonické robotické dílně Boston Dynamics šéfoval vývoji autonomních systémů a stavěl známé stroje jako Atlas či Spot.

Společně tak spojili to nejlepší ze dvou světů: špičkové znalosti z vývoje umělé inteligence s praxí při stavbě inovativního hardwaru. Není proto divu, že do startupu napumpovala peníze nejen Nvidia, ale i zakladatel Amazonu Jeff Bezos skrze svůj fond Bezos Expeditions, spoluzakladatel Xiaomi Lin Bin nebo legendární profesorka ze Stanfordu a ikona v oboru AI Fei-Fei Li.