ChatGPT, superzvijezda umjetne inteligencije, suočen je s pitanjem dok nastavlja napredovati: Je li zadovoljio standard Turingovog testa za generiranje rezultata koji se ne razlikuju od ljudskih odgovora? Najnovije istraživanje sugerira da se čini da ChatGPT, unatoč svojim izvrsnim performansama, nije u potpunosti prešao taj prag.
Dvojica istraživača sa Kalifornijskog sveučilišta u San Diegu, Cameron Jones, stručnjak za jezik, semantiku i strojno učenje, i Benjamin Bergen, profesor kognitivne znanosti, postavili su ovo pitanje pozivajući se na Turingov rad prije 70 godina. Turing je predložio postupak za utvrđivanje može li stroj postići razinu inteligencije i sposobnosti razgovora dovoljnu da zavara druge da pomisle da je čovjek.
Njihovo je izvješće naslovljeno "Prolazi li GPT-4 Turingov test?" Može se pronaći na poslužitelju za preprint arXiv. Za studiju su okupili 650 sudionika koji su igrali 1400 "igara" u kojima su sudionici imali kratak razgovor s drugim čovjekom ili GPT modelom i od njih se tražilo da odrede s kim razgovaraju.
Ono što su istraživači otkrili bilo je izvanredno. Model GPT-4 prevario je sudionike 41 posto vremena, dok ih je GPT-3.5 prevario samo 5 do 14 posto vremena. Zanimljivo je da su ljudi samo u 63 posto ispitivanja uspjeli uvjeriti sudionike da nisu strojevi.
"Nismo pronašli dokaze da je GPT-4 prošao Turingov test", zaključili su istraživači. Međutim, primjećuju da Turingov test još uvijek ima vrijednost u procjeni učinaka strojnih razgovora, kao okvira za mjerenje glatkih društvenih interakcija i obmana, te u razumijevanju ljudskih strategija za prilagodbu ovim uređajima.
No, također upozoravaju da će u mnogim slučajevima chatbotovi i dalje moći komunicirati na uvjerljiv način. "Stopa uspješnosti od 41 posto sugerira da modeli umjetne inteligencije možda već imaju sposobnost varanja, posebno u situacijama u kojima su ljudi manje svjesni mogućnosti da možda ne razgovaraju s ljudima", ističu istraživači. Modeli umjetne inteligencije koji robusno oponašaju ljude mogli bi imati široke društvene i ekonomske implikacije."
Istraživači su primijetili da su se sudionici koji su ispravno identificirali AI s ljudima usredotočili na nekoliko čimbenika. Model koji je previše formalan ili previše neformalan izaziva sumnju. Ako je njihov izraz previše riječi ili previše koncizan, ako su njihova gramatika ili interpunkcija neuobičajeno dobri ili "neuvjerljivo" loši, to će također biti ključni faktor u određivanju komuniciraju li sudionici s ljudima ili strojevima. Osim toga, sudionici su bili osjetljivi na odgovore koji su zvučali previše općenito.
Istraživači sugeriraju da će praćenje modela umjetne inteligencije postati sve važnije kako budu postajali sve fluidniji i apsorbirali sve više ljudskih hirova. "Identificiranje čimbenika koji dovode do obmane i strategija za njeno ublažavanje postat će sve važnije", rekli su. Studija otkriva da se polje inteligentnog razgovora još uvijek suočava s izazovima, ali također pruža korisne uvide o tome kako se modeli umjetne inteligencije mogu poboljšati.
