vidas

DeepSeek, el model xinès


Temps de lectura: 4 minuts


Luo Fuli, amb només 29 anys, ha aconseguit desenvolupar un model d'IA que no només és més eficient que les millors creacions de OpenAI, sinó que a més ho ha fet amb una fracció dels recursos.



DeepSeek

DeepSeek és el nom d'una empresa xinesa que ha desenvolupat un model de llenguatge anomenat DeepSeek, com l'empresa. DeepSeek és un model de codi obert, cosa que no és estranya ja que LlaMa 2, de Meta, també ho és i va ser llançat el 2023.

DeepSeek no és nou dins del mercat d'IAs, ja que des del 2024 van sortir les primeres versions, com DeepSeek V3, un model de llarga escala LLM que supera la majoria d'IA. En proves com la de programació, aquest model va aconseguir superar LlaMa 3.1 405B, GPT-4o ia Qwen 2.5 72B, encara que tots tenen molts menys paràmetres i això pot influir en el rendiment i les comparacions. Un altre model és DeepSeek R1, raonador, que competeix amb ChatGPT o1.

DeepSeek va necessitar 2,788 milions d'hores d'entrenament amb un cost de 5,5 milions de dòlars, encara que les xifres es poden veure en el document tècnic.

Codi obert

Que un model de llenguatge sigui de codi obert, significa que es pot veure quin ha estat el procés d'entrenament, no que es pugui modificar directament el codi per alterar els comportaments de la IA, encara que es poden fer post-entrenaments. A més, tots els models open source tenen alguna part oculta que no es desvetlla. I també és el cas de DeepSeek.

Que un model sigui de codi obert permet, entre altres coses, que es pugui descarregar complet i executar de forma independent en un ordinador local, sense necessitat d'API o connexions als servidors de l'empresa que l'ha creat, assegurant que no recullen dades de lús privat del model.

Ara bé, això no vol dir que no es necessiti una potència de càlcul enorme perquè el model funcioni de forma acceptable. És a dir, no n'hi ha prou amb descarregar-lo en un portàtil i començar a utilitzar-lo com si fos ChatGPT d'OpenAI. Encara que funcioni, serà tremendament lent. Per això es disposa de diferents models especialitzats o de versions destil·lades.

¿Què el fa diferente?

Entre les característiques de DeepSeek hi ha l'ús de 8 bits en comptes de 32 bits, cosa que en redueix el volum i equival als destil·lats que es pot obtenir de models com LlaMa i que, en certa manera, disminueixen la precisió de resposta. .

D'altra banda, sembla que en comptes de paraules, llegeixen frases com tokens, cosa que agilitza el procés d'aprenentatge. I finalment utilitza mòduls especialitzats, cosa que significa que no tots els seus components funcionen de forma continuada, sinó que només s'activen aquells que tenen una funció en cada moment, cosa que genera un menor consum de computació i, per tant, energètic.

Pel que fa al maquinari, DeekSeek ha utilitzat unes 2.000 GPUs Nvidia H800, enfront de les 16.000 GPUs H100 que utilitza OpenAI.

A més, el model ve força censurat per la ideologia de la Xina i no permet referències polítiques o temes que són sensibles.

La caiguda de la bossa

A la vista d'un model de baix cost d'entrenament, un cost molt baix comparat amb les xifres que manegen les grans companyies del sector, del seu ús públic a gran escala, ja que és open source i gratuït, sembla que els inversors no ho veuen clar. La idea aparent és que els inversors qüestionen la necessitat de tanta inversió en infraestructura.

Tot apunta, avui dia, que es redimensionaran les inversions en infraestructura per al desenvolupament d'IAs. De tota manera, segons l'informe tècnic, va costar 5,576 milions de dòlars; molt menys del que s'inverteix als EUA.

Però això és realment així?

research@deepseek.com
Cost segons l
Cost segons l'informe tècnic 

La realitat

El primer de tot és que no tenim garanties que ho hagin aconseguit realment amb una tecnologia nova. La Xina ja té un historial de fal·làcies. DeepSeek, és realment una humiliació als Estats Units? i, els enginyers de Silicon Valley no s'han adonat que es pot desenvolupar una tecnologia com la de DeepSeek?

D'altra banda, és tan bona DeepSeek com a IA de llenguatge? Recordem que aquest model es caracteritza per haver estat entrenat a un cost molt barat, cosa que implica que els preus de disponibilitat al gran públic són molt baixos, però això no vol dir que realment tingui les capacitats dels grans models, com els d'OpenAI.

Si revisem els models LlaMa de meta, open source, veurem que no estan a l'alçada dels models tipus ChatGPT, tret que utilitzem els models com el LlaMa de 70 mil milions de paràmetres, amb el cost que representa.

La paradoxa de Jevons

Tot això ens porta a que la realitat sigui tenir una empenta al camp de la IA, proporcionant que la tecnologia millori l'eficiència en la producció de models, que seran més eficients i augmentaran l'ús de les IA, és a dir més demanda, per això necessitarem entrenar més models, més intel·ligents.

La potència de càlcul

Però la qüestió que realment mana és la potència de càlcul. Aquells que tinguin la capacitat més gran de disposar de potència de càlcul seran els que realment tinguin el poder dins del sector.

Si DeepSeek realment ha desenvolupat un entrenament barat amb la qualitat dels models dels Estats Units, el que han aconseguit és elevar el llistó. Recordem que els objectius de les grans companyies d'IA són arribar a l'AGI. I per això s'estan preparant amb enormes instal·lacions per processar els futurs models.

La gran inversió anunciada pel president Trump pretén arribar a una AGI en un temps raonable. Però si amb la tecnologia d'entrenament de DeepSeek i el codi obert, s'aplica a les grans inversions previstes, els Estats Units poden arribar a l'AGI en un temps menor. I no només això, també pot sobrepassar els límits que s'han establert actualment i arribar on ningú no pensava que s'hi podia arribar.

Referències

Comentaris sobre 'DeepSeek, el model xinès'

Carregant comentaris...
Xavier és un desenvolupador sènior full stack i opera des de la ciutat mediterrània de Barcelona. Li encanten les tecnologies de programari i està convençut que el desenvolupament de software és un procés col·laboratiu i obert.
I és un apassionat de l'astronomia i la fotografia. El pots trobar a:
Comparteix aquest post