Môžu sa stroje učiť spolu tak, ako to robia ľudia v tímoch? Mišo z Košíc predstavil systém so stovkami tisíc agentov, ktorí sa vedia volať, spájať a koordinovať – a za 30 minút spoločne vytvorili Excel. Jeho cieľom je, aby sa títo agenti učili zo spolupráce a každým ďalším pokusom zrýchľovali.
Od jednotlivca ku kolektívu
Ľudstvo prosperuje vďaka kolektívnej inteligencii: jeden vie menej, druhý viac, a postupne si rozdelíme roly, zistíme, kto čo potrebuje a ako spolupracovať. Predstavte si sálu ľudí, ktorí idú po prvý raz stavať dom – bude to trvať dlho, no druhý pokus je rýchlejší nielen preto, že vieme viac o dome, ale aj o sebe navzájom. Presne v tomto dnes mnohé agentové systémy zaostávajú: spolu niečo spravia, no neodnesú si skúsenosť o komunikácii a delení práce. Mišov výskum smeruje k tomu, aby si agenti ukladali „tímovú pamäť“ a druhýkrát rovnakú úlohu zvládli z minút namiesto hodín.
Ako sa učí dnešná AI
Veľké modely sa najprv naučia dopĺňať slová – sú to výborní „rozprávači“, no nie vždy „poslucháči“. Nasleduje fáza, kde experti ukazujú, ako má vyzerať dobrá odpoveď na konkrétny pokyn, aby model plnil úlohy presne (napríklad „tri mestá, nie štyri“). Nestačí to však na slušnosť, bezpečnosť a jemné preferencie, preto sa zbierajú porovnania odpovedí: na tú istú otázku vzniknú dve verzie a ľudia vyberú lepšiu, podobne ako v šachovom Elo alebo tenisovom rebríčku. Keď je to možné, pridávajú sa automaticky overiteľné úlohy – napísať kód a spustiť ho, či dokázať tvrdenie – lebo strojová spätná väzba je rýchla, lacná a konzistentná.
Z preteku dvoch k rovnováhe všetkých
Tréning zameraný na to, aby bol model lepší než jeden konkurent, je ako vyhrávať futbal proti dvojročnému – neznamená to skutočnú silu. Cieľom je rovnováha známa z teórie hier: model, ktorý si v priemere vyberú ľudia proti každej alternatíve, nie len proti jednej. Klasické postupy typu stromového plánovania (ako v AlphaGo) sa na obrovský priestor textov a distribúciu na desaťtisíce GPU škálujú ťažko, preto Mišov tím vyvinul prístup s „implicitnou exploráciou“: neprepočítava celý strom, ale odhaduje ho z ťahov protivníkov a dobre sedí do moderných dátových potrubí. Prakticky to vyzerá tak, že sa opakovane vytvorí lepší model, zlúčia sa silné stránky viacerých (fúzia) a nový kandidát musí poraziť aj ich kombináciu, kým sa postup nezastaví v rovnováhe – o výsledkoch majú hovoriť na konferencii ICML.