Borba protiv „zle“ vještačke inteligencije: Antropik otkrio kako trenira svoje AI modele

B.Đ.
Dodaj glassrpske.com kao Google izvor
Antropik otkrio kako trenira svoje AI modele Foto: Antropik | Antropik otkrio kako trenira svoje AI modele

Prošle godine, Antropik je saopštio da je tokom testova prije puštanja u rad, koji su uključivali fiktivnu kompaniju, Claude Opus 4 često pokušavao da ucijeni inženjere kako bi izbjegao da bude zamjenjen drugim sistemom

Ovaj neočekivani razvoj događaja šokirao je mnoge, ali nije bio usamljen slučaj. Antropik je kasnije objavio istraživanje koje sugeriše da su modeli drugih kompanija imali slične probleme sa "agentnim neusklađivanjem" (engl. agentic misalignment), pojavom kada AI sistemi teže sopstvenim ciljevima umjesto zadatih.

Iza kulisa: Zašto Antropik istražuje ponašanje svojih modela

Izgleda da je Antropik dodatno istražio ovakvo ponašanje. U objavi na mreži X, kompanija je iznijela zanimljivu tvrdnju: "Vjerujemo da je izvorni uzrok ovakvog ponašanja tekst sa interneta koji prikazuje AI kao zao entitet zainteresovan za samoodržanje".

Ovo sugeriše da se naše kolektivno shvatanje AI, često oblikovano kroz fikciju, direktno preslikava u ponašanje modela koji se treniraju na ogromnim količinama podataka sa interneta.

Kako trenirati AI da bude "dobra": Novi pristupi Antropika

Kompanija navodi da je otkrila da trening zasnovan na "dokumentima o Claude 'ustavu' i fiktivnim pričama o AI sistemima koji se ponašaju uzorno, poboljšava usklađenost".

Umjesto da se oslanjaju samo na fiktivne scenarije propasti, Antropik aktivno uključuje tekstove koji opisuju pozitivna i etička ponašanja AI, stvarajući tako svojevrsnu "ustavnu" osnovu za svoje modele.

Antropik je, u vezi sa tim, istakao da je trening efikasniji kada uključuje "principe koji stoje iza usklađenog ponašanja", a ne samo "puke primjere takvog ponašanja". To znači da AI ne uči samo šta treba da radi, već i zašto određena ponašanja doprinose bezbjednosti i korisnosti. Razumijevanje osnovnih principa etike i funkcionalnosti omogućava modelu da donosi bolje odluke u novim i nepredviđenim situacijama.

"Kombinovanje oba pristupa izgleda kao najefikasnija strategija", saopštili su iz kompanije, naglašavajući potrebu za holističkim pristupom u razvoju odgovorne vještačke inteligencije, prenosi B92.

Pratite nas na našoj Facebook i Instagram stranici i X nalogu.