ChatGPT, superstar umělé inteligence, byl postaven před otázku, jak pokračuje v pohybu: Splnil Turingův testovací standard pro generování výstupů nerozeznatelných od lidských reakcí? Nejnovější výzkum naznačuje, že ChatGPT, navzdory svému vynikajícímu výkonu, zřejmě tuto hranici zcela nepřekročil.
Dva vědci z Kalifornské univerzity v San Diegu, Cameron Jones, odborník na jazyk, sémantiku a strojové učení, a Benjamin Bergen, profesor kognitivních věd, si tuto otázku položili s odkazem na Turingovu práci před 70 lety. Turing navrhl postup pro určení, zda stroj může dosáhnout úrovně inteligence a konverzační schopnosti dostatečné k tomu, aby si ostatní mysleli, že je to člověk.
Jejich zpráva se jmenuje „Vyhovuje GPT-4 Turingovu testu?“ Lze jej nalézt na předtiskovém serveru arXiv. Pro studii shromáždili 650 účastníků, aby si zahráli 1400 „her“, ve kterých účastníci vedli krátký rozhovor s jiným člověkem nebo modelem GPT a byli požádáni, aby určili, s kým mluví.
To, co vědci zjistili, bylo pozoruhodné. Model GPT-4 oklamal účastníky ve 41 procentech případů, zatímco model GPT-3.5 je oklamal pouze v 5 až 14 procentech případů. Je zajímavé, že lidem se podařilo přesvědčit účastníky, že nejsou stroje, pouze v 63 procentech pokusů.
"Nenašli jsme žádné důkazy, že GPT-4 prošel Turingovým testem," uzavřeli vědci. Poznamenávají však, že Turingův test má stále hodnotu při hodnocení účinků strojových konverzací, jako rámec pro měření hladkých sociálních interakcí a podvodů a při pochopení lidských strategií pro přizpůsobení se těmto zařízením.
Zároveň však varují, že v mnoha případech budou chatboti stále schopni komunikovat přesvědčivým způsobem. "41procentní úspěšnost naznačuje, že modely umělé inteligence již mohou mít schopnost klamat, zejména v situacích, kdy jsou lidé méně ostražití vůči možnosti, že nemusí mluvit s člověkem," poznamenávají vědci. Modely umělé inteligence, které robustně napodobují lidi, by mohly mít široké sociální a ekonomické důsledky.“
Výzkumníci zjistili, že účastníci, kteří správně identifikovali AI s lidmi, se zaměřili na několik faktorů. Příliš formální nebo příliš neformální model vzbuzuje podezření. Pokud je jejich výraz příliš rozvláčný nebo příliš stručný, pokud je jejich gramatika nebo interpunkce neobvykle dobrá nebo „nepřesvědčivě“ špatná, bude to také klíčovým faktorem při určování, zda účastníci komunikují s lidmi nebo se stroji. Kromě toho byli účastníci citliví na odpovědi, které zněly příliš obecně.
Výzkumníci naznačují, že sledování modelů umělé inteligence bude stále důležitější, protože se stanou plynulejšími a absorbují více lidských vtipů. "Identifikace faktorů, které vedou ke klamání, a strategií k jeho zmírnění bude stále důležitější," uvedli. Studie odhaluje, že oblast inteligentní konverzace stále čelí výzvám, ale také poskytuje užitečné informace o tom, jak lze modely umělé inteligence vylepšit.
