Фото: Антропик
| Антропик откриo како тренира своје АИ моделe
Прошле године, Антропик је саопштио да је током тестова прије пуштања у рад, који су укључивали фиктивну компанију, Claude Opus 4 често покушавао да уцијени инжењере како би избјегао да буде замјењен другим системом
Овај неочекивани развој догађаја шокирао је многе, али није био усамљен случај. Антропик је касније објавио истраживање које сугерише да су модели других компанија имали сличне проблеме са "агентним неусклађивањем" (енгл. agentic misalignment), појавом када АИ системи теже сопственим циљевима умјесто задатих.
Иза кулиса: Зашто Антропик истражује понашање својих модела
Изгледа да је Антропик додатно истражио овакво понашање. У објави на мрежи X, компанија је изнијела занимљиву тврдњу: "Вјерујемо да је изворни узрок оваквог понашања текст са интернета који приказује АИ као зао ентитет заинтересован за самоодржање".
Ово сугерише да се наше колективно схватање АИ, често обликовано кроз фикцију, директно пресликава у понашање модела који се тренирају на огромним количинама података са интернета.
Како тренирати АИ да буде "добра": Нови приступи Антропика
Компанија наводи да је открила да тренинг заснован на "документима о Claude 'уставу' и фиктивним причама о АИ системима који се понашају узорно, побољшава усклађеност".
Умјесто да се ослањају само на фиктивне сценарије пропасти, Антропик активно укључује текстове који описују позитивна и етичка понашања АИ, стварајући тако својеврсну "уставну" основу за своје моделе.
Антропик је, у вези са тим, истакао да је тренинг ефикаснији када укључује "принципе који стоје иза усклађеног понашања", а не само "пуке примјере таквог понашања". То значи да АИ не учи само шта треба да ради, већ и зашто одређена понашања доприносе безбједности и корисности. Разумијевање основних принципа етике и функционалности омогућава моделу да доноси боље одлуке у новим и непредвиђеним ситуацијама.
"Комбиновање оба приступа изгледа као најефикаснија стратегија", саопштили су из компаније, наглашавајући потребу за холистичким приступом у развоју одговорне вјештачке интелигенције, преноси Б92.
Пратите нас на нашој Фејсбук и Инстаграм страници и X налогу.