Models d'IA espanyols
Temps de lectura: 4 minuts
Després de l'anunci del president del govern, al Mobile WWC 2024, del desenvolupament d'uns models de llenguatge, ja tenim el model fundacional ALIA, que servirà de base per a models d'ús específic.
Estratègia espanyola
L'estratègia del Govern d'Espanya (ENIA) en matèria d'Intel·ligència Artificial (IA) cerca abordar tres punts principals: la ciberseguretat, la regulació i supervisió de la IA, i la planificació i distribució de centres de processament de dades.
A més, es crea un model de llenguatge fundacional, no instruït ni alineat, per generar models més petits i especialitzats en espanyol i llengües cooficials, català, basc i gallec, fins i tot valencià.
MarIA
El 2020 es crea el projecte MarIA, el sistema de models de llengua creat al Barcelona Supercomputing Center, a partir dels arxius web de la Biblioteca Nacional d'Espanya. MarIA va ser desenvolupada amb GPT-2, una tecnologia que permet crear models generatius.
Model ALIA
Amb motiu del Mobile WWC 2024 s'anuncia el desenvolupament d'un gran model de llenguatge. A diferència de la majoria de models, que només tenen un 5% de dades en castellà, ALIA incorpora més d'un 20%, la resta són dades en les llengües oficials d'Europa. Això suposa un salt qualitatiu en fiabilitat i reducció de biaixos.
El model en espanyol i llengües cooficials compta amb una inversió de 10 milions d'euros i es preveu una partida de 150 milions per a la implantació a les empreses.
Una de les barreres que cal superar és aconseguir tenir accés a un corpus de coneixement prou ampli per entrenar el model. En aquest sentit, la directora de la Unitat de Tecnologies del Llenguatge del CNS-BSC, Marta Villegas, va explicar que havien fet un esforç per anar més enllà de les dades disponibles a internet, com les de Common Crawl, i estaven entrenant aquest model amb dades públiques sobre legislació europea en els 23 idiomes oficials, dades de patents mèdiques, la Constitució Espanyola, intervencions a les corts espanyoles i els parlaments europeu i autonòmics, consultes tributàries, codis universitaris públics, documents jurídics oficials, i totes les publicacions del BOE, entre moltes altres fonts.
Proves pilot
Les proves pilot per a ALIA són un chatbot intern per a l'Agència Tributària que contribueixi a agilitzar les gestions i una aplicació per millorar el diagnòstic precoç de les insuficiències cardíaques a l'Atenció Primària.
Model obert
En línia amb els principis de la legislació europea en matèria d'intel·ligència artificial, el projecte presenta un model totalment obert. A ALIA Kit, els interessats poden accedir a tota la informació, com ara la metodologia, la documentació i els conjunts de dades d'entrenament i avaluació, cosa que en reforça la transparència.
La família de models, derivats d'ALIA, suporta totes les llengües d'Espanya, amb la col·laboració de la Reial Acadèmia Espanyola (RAE) i l'Associació d'Acadèmies de la Llengua Espanyola.
El model ja està disponible per a tots els usuaris, entenent com a usuaris empreses, desenvolupadors independents, institucions, universitats i investigadors perquè implementin les seves pròpies eines de IA basades en aquesta família de models de llenguatge.
Desenvolupament del model
Marta Villegas, va aclarir que el model està basat en l'arquitectura de LLaMa, de Meta a>, però en aquest cas ha estat entrenat des de zero i amb pesos inicials a zero.
El vocabulari, o conjunt de tokens, és completament diferent. En altres models el corpus, o conjunt de dades d'entrenament, poden estar majoritàriament en anglès, fet que fa que el conjunt de tokens admissibles es calculi a través de l'anglès. Amb ALIA, en canvi, es pretén reduir la rellevància de l'anglès per incrementar la de 35 idiomes de la Unió Europea i, especialment, l'espanyol, el català, el basc i el gallec.
Concretament, es redueixen a la meitat les dades i el codi en anglès, es dupliquen les dels idiomes usats a Espanya i es van mantenir igual la resta d'idiomes tractats. Així, l'anglès representa el 39,31% d'aquestes dades, el 16,12% l'espanyol, l'1,97% el català, el 0,31% el gallec i el 0,24% el basc.
Per a l'entrenament, de la capacitat de còmput de MareNostrum 5, el supercomputador del CNS-BSC, durant un breu espai de temps van tenir accés a 512 dels 1.120 nodes especialitzats del supercomputador.
El març del 2025 s'espera que aparegui la versió instruïda d'ALIA-40b, amb un primer conjunt d'instruccions obertes. Dins la família ALIA tenim els models Salamandra (2b i 7b), més petits i modestos però que ja compten amb primeres versions instruïdes.
ALIA-40b, també pot ser usat com una mena de "jutge" (LLM as a judge ) que permet avaluar i jutjar la qualitat i precisió de les respostes generats per altres models d'IA, d'aquesta manera es poden alinear models menors.
El MareNostrum 5
El 2023 va arrencar el MareNostrum 5 amb una inversió de 202 milions d'euros, 151,4 milions dels quals corresponen a l'adquisició del maquinari. Una de les màquines més completes i versàtils del món al servei de la comunitat científica i l'única amb dos sistemes a la llista dels 20 supercomputadors més potents del planeta.
El superordinador MareNostrum 5 ACC consta de 1.120 nodes, cadascun dels que disposa de quatre targetes NVIDIA Hopper amb 64 GB de memòria HBM2, dos processadors Intel 8460Y Sapphire Rapids, 512 GB de memòria principal (DDR) i 460 GB d'emmagatzematge. La màquina proporciona un rendiment màxim de 260 PFlops.
- La Moncloa
https://www.lamoncloa.gob.es - MarIA
https://portal.mineco.gob.es - ALIA Kit
https://langtech-bsc.gitbook.io - ALIA
https://alia.gob.es - CATalog
https://huggingface.co
