Intelligence

Sora


Temps de lectura: 3 minuts


Sora és un model d'IA que pot crear escenes realistes i imaginatives a partir de les instruccions de text.



Imatges

Actualment el desenvolupament de les IAs generatives per a imatge està assolint un bon nivell en què les imatges es creen a lliga resolució i amb gran quantitat de detalls. Tot i això, les imatges fallen a l'hora de reproduir detalls que coneixem molt bé com les mans de les persones, cares en plànols de fons o de multituds, etc.

Tots aquests punts van avançant de manera molt ràpida i podem comparar amb els primers models l'avenç assolit. El més extraordinari és que els primers models són de només uns mesos abans.

Un dels punts més destacats és l'autocompletat d'imatges o la generació de context addicional, paisatges, cels i altres elements que ja es fan servir de manera regular als programes de retoc.

Vídeos

Sembla que el vídeo era l'assignatura pendent, però OpenAI acaba de presentar Sora, una IA generativa que crea vídeo a partir d'instruccions de text.

Sora és un model de difusió que genera un vídeo començant amb un que sembla soroll estàtic i el transforma gradualment eliminant el soroll a molts passos.

OpenAI
Codificador 

Està en primera versió, però els vídeos que podem veure, publicats per OpenAI, són espectaculars. Sí, es poden trobar errors en el moviment, com al vídeo de Tòquio, on podem veure el canvi de peu a la model, o el salt a caminar, però el reflex a les ulleres de la model indica que el context darrere de la càmera també està recreat.

OpenAI
Clip generat 

Aquest vídeo s'ha generat directament a partir d'un text:

A stylish woman walks down a Tòquio street filled with warm glowing neon and animated city signage. She wears a black leather jacket, a long red dress, and black boots, and carries a black purse. She wears sunglasses and red lipstick. She walks confidently and casually. El street és damp and reflective, creating a mirror effect of the colorful lights. Many pedestrians walk about.

Diu OpenAI que "Sora és capaç de generar escenes complexes amb múltiples personatges, tipus específics de moviment i detalls precisos del subjecte i el fons. El model comprèn no només el que l'usuari ha demanat al missatge, sinó també com existeixen aquestes coses a el món físic."

D'imatge a vídeo

Recordem que aquesta és la primera versió del generat de vídeo, però les capacitats de Sora seran generar clips a partir d'una imatge, recreant el context. Això ens podria donar la capacitat de fer pel·lícules a partir de dibuixos que un autor faci d'una història que tingui al cap i de la qual es pugui derivar una pel·lícula.

Però, de moment, aquesta capacitat no està disponible. Encara que no sembla que trigui a arribar.

Això no vol dir que no es produeixi continuïtat a nivell de fotogrames. Als vídeos que es mostren, els detalls d'un rostre, per exemple, es mantenen al llarg de la reproducció, és a dir, d'un fotograma a un altre. Fins ara això era un problema i les imatges s'anaven desintegrant. En canvi, s?han generat vídeos d?un minut de durada mantenint la integritat dels personatges. Tot un èxit.

Perills

Podríem pensar que tot això posa en perill la realització de pel·lícules, els actors i la indústria del cinema en general, però no ens hem d'alarmar perquè encara no és possible crear una pel·lícula a partir de la generació de diversos clips.

La continuïtat, o la relació entre les diferents plans d'una filmació, és una cosa que la IA no sap manejar i sembla que és un problema realment seriós per solucionar perquè cal saber la continuïtat mental que espera l'espectador perquè hi hagi una lògica a la història.

Conclusió

Els resultats de Sora, a hores d'ara, són espectaculars. Les possibilitats que s'obren amb aquesta tecnologia sembla que no tindran límits, però un dels punts que més s'han d'estudiar són les repercussions que pot tenir si se'n fa un mal ús. I sabem que, per moltes limitacions que s'incloguin a la IA, els humans tenim més creativitat a l'hora d'enganyar.

Referències

Comentaris sobre 'Sora'

Carregant comentaris...
Xavier és un desenvolupador sènior full stack i opera des de la ciutat mediterrània de Barcelona. Li encanten les tecnologies de programari i està convençut que el desenvolupament de software és un procés col·laboratiu i obert.
I és un apassionat de l'astronomia i la fotografia. El pots trobar a:
Comparteix aquest post