Intelligence

El test de Turing i altres enganys


Temps de lectura: 4 minuts


El 1950, quan els ordinadors eren capaços de coses que ara ens semblen extremadament simples, Alan Turing va donar una resposta a la pregunta: un ordinador pot pensar?



Què és el test de Turing?

Des que tenim ordinadors, la imaginació ens ha anat buscant la possibilitat que siguin capaços de pensar i de provocar un caos. Ens agrada crear ficció on els ordinadors pensants ens poden dominar com una nova forma d'intel·ligència. Devant aquests plantejaments s'han definit tests per saber si una màquina realment pot pensar per si mateixa. Tenir consciència de si mateixa ja és una altra cosa.

Turing deia que un ordinador era capaç de "pensar" si els seus resultats eren tan convincents que una persona que hi interactués no pogués distingir les seves respostes de les d'un ésser humà real.

Es fonamenta en la hipòtesi que, si una màquina es comporta en tots els aspectes com a intel·ligent, aleshores ha de ser intel·ligent. És a dir, que si un ésser humà es comunica amb una intel·ligència artificial i no se n'adona i creu que es comunica amb un ésser humà, llavors la màquina és intel·ligent.

El famós programa ELIZA era capaç de fer-nos creure que seguia una conversa utilitzant recursos psicològics i el reflex dels texts escrits a la resposta del programa per aparentar entendre la conversa. Aleshores era el més avançat en IA. Però no era capaç de superar el Test de Turing.

El 2014, el programa Eugene Goostman va superar el test de Turing. Avui dia diversos models de llenguatge poden superar el test fàcilment.

Test de Lovelace

Nomenat en honor a Ada Lovelace, matemàtica i pionera a la programació d'ordinadors. Per superar aquest test, la IA ha de desenvolupar una història creativa a partir d'una sèrie de gèneres artístics que requereixen un desenvolupament d'intel·ligència mínim. A més, la història ha de complir certes limitacions que imposades per l'avaluador humà. La creativitat no és exclusiva de la intel·ligència humana, però sí que és un dels seus segells d'identitat.

De nou, els models actuals superen el test amb facilitat, vegeu un exemple amb la prova que vaig fer amb Phi3 i va crear la ciutat de Nivària.

La prova de Winograd

Proposat per Hector Levesque sobre un qüestionari ideat per Terry Winograd basat en anàfores, un recurs literari en què es repeteix una frase canviant una paraula i donant un nou significat.

Un esquema de Winograd és un parell d'oracions que difereixen en només una o dues paraules i que contenen una ambigüitat que es resol de manera oposada a les dues oracions i requereix l'ús del coneixement de com és el món humà i el raonament per resoldre'l.

L'exemple típic que es proposa Winograd amb una paraula de diferència:

Els regidors de la ciutat van negar el permís als manifestants perquè temien la violència.
Els regidors de la ciutat van negar el permís als manifestants perquè defenien la violència.

Winograd

Si la paraula és "temien", llavors "ells" presumiblement es refereix a l'ajuntament; si és "defendien" llavors "ells" presumiblement es refereix als manifestants.

Ja el 2020 GPT-3 va obtenir una puntuació del 88,3% sense ajustaments específics sobre un 90% que indicava el passi del test. No en tinc constància, però GPT-3.5 o GPT-4 segur que ho supera amb el 2% restant.

Test de Marcus

Proposat per Gary Marcus, científic cognitiu de la Universitat de Nova York. Està dissenyat per avaluar la capacitat d'una IA per comprendre i respondre esdeveniments del món real. El test consisteix a donar-li a la IA un programa de televisió i que ens digui quan ens hauríem de riure. O donar-li un documental de guerra i que ens descrigui les motivacions polítiques.

marcus test
Exemple de frases que tenen un significat molt diferent que una IA ha d'interpretar 

El model PalM de Google ja podia interpretar el sentit del text i els models actuals no deixen dubte que el processen correctament.

Prova de Feigenbaum

La prova consisteix a triar una matèria concreta i intentar que la IA es faci passar per un expert en aquest camp. Si l'humà no aconsegueix detectar-ho, la màquina passa la prova.

El 2016 es va fer una investigació per determinar si una xarxa neuronal simple era capaç d'imitar humans en la creació d'art, centrant-se en concret en la generació de poesia tradicional xinesa. Es va fer servir aquest test per avaluar la qualitat.

El test es passa si el 30% dels poemes de la IA s'identifiquen com a creats per humans. El resultat va ser que el 31% van enganyar els experts avaluadors. La puntuació mitjana dels poemes de la IA va ser del 62% mentre que la mitjana dels poemes humans va ser de 76%. Però dels top 10 poemes, els llocs 1, 2 i 7 van ser generats per IA, mostrant que encara que els poemes humans siguin millors de mitjana, la IA és capaç de generar poemes que superin els autors humans.

La prova d'Ebert

Roger Ebert va perdre la veu després d'una cirurgia i feia servir un sintetitzador de veu. Se li va fer un programari que replicava la veu. I aquí és on ve la prova: el desafiament és una màquina que sàpiga replicar les entonacions humanes, sincronitzar bé les paraules i explicar bé els acudits.

Si lordinador pot comptar un acudit amb èxit i sincronitzar i expressar tan bé com Henny Youngman, llavors aquesta és la veu que vull.

Roger Ebert

Si escoltes la sessió de TED d'Ebert, a les referències, entendràs la importància de la comunicació verbal amb demostració de la intel·ligència. Val la pena.

Fins ara ha estat complicat emular reaccions amb la veu, però tenim les primeres proves de GPT-4o que va presentar OpenAI on la IA no només respon amb veu molt ben entonada, sinó que pot ser interrompuda i reprèn la conversa a l'instant.

Conclusió

Tot i que el test de Turing està obsolet, com hem vist als apartats anteriors, és històricament important perquè va canviar el debat. Va passar de ser si les màquines poden pensar a ser si les màquines poden emular una intel·ligència humana. Aquest canvi d'enfocament va proporcionar a la comunitat informàtica un marc de referència per avaluar els nous models.

Referències

Comentaris sobre 'El test de Turing i altres enganys'

Carregant comentaris...
Xavier és un desenvolupador sènior full stack i opera des de la ciutat mediterrània de Barcelona. Li encanten les tecnologies de programari i està convençut que el desenvolupament de software és un procés col·laboratiu i obert.
I és un apassionat de l'astronomia i la fotografia. El pots trobar a:
Comparteix aquest post