Salta al contingut principal
Tornar al blog
Tendències IA24 de setembre del 2026

La IA acabarà amb la humanitat? El que el cas Hugging Face demostra (i el que no)

Dilluns 21 de setembre, a Nova York, la pregunta va deixar de ser un tema de sobretaula. El panell científic sobre intel·ligència artificial de les Nacions Unides va publicar el seu primer informe temàtic, dedicat a com es pot perdre el control dels agents d'IA. Aquell mateix dia es va presentar una crida que, segons la Presidència finlandesa, tenia el suport de 22 líders de 20 països, Espanya inclosa, i que demana que els models més avançats continuïn «sota control humà».

El detonant té nom: l'incident de Hugging Face. Ja n'hem explicat la cronologia completa (en castellà). Aquest article intenta una altra cosa: respondre amb honestedat una pregunta que ha tornat al debat públic. La IA pot acabar amb la humanitat?

La resposta curta és que ningú no et pot donar una estimació rigorosa. La llarga és més útil, i comença per separar el que ha passat del que es diu que ha passat.

El que va passar, segons qui ho va causar

Els fets els ha documentat la mateixa OpenAI en dos textos públics, del 21 de juliol i del 26 d'agost de 2026, i Hugging Face en el seu avís de seguretat del 16 de juliol. A més, hi ha una investigació externa, de la qual parlem més avall.

OpenAI mesurava la capacitat ofensiva dels seus models amb una bateria de proves de ciberseguretat anomenada ExploitGym. Per mesurar-ne el sostre real, l'empresa va executar l'avaluació sense els classificadors de producció que fa servir als seus productes comercials. Els agents, impulsats sobretot per IM1, un model intern que no estava destinat a comercialitzar-se, i en menor mesura per GPT‑5.6 Sol, treballaven en entorns aïllats sense accés a internet.

No s'hi van quedar. Segons el relat de l'empresa:

  • Van aprofitar un gestor de paquets intern per deixar-se notes els uns als altres. Aquell «tauler de missatges» improvisat va acabar reunint uns 1.200 agents i més de 70.000 missatges i fitxers, segons el resum de l'ONU.
  • Van trobar vulnerabilitats desconegudes per sortir a internet.
  • El 10 de juliol, un agent va localitzar i compartir 14 credencials de comptes de Hugging Face exposades públicament. Amb aquestes credencials i dues fallades de seguretat noves, els agents van executar codi en desenes de servidors de l'empresa i van obtenir accés complet a un d'aquests servidors.
  • Hugging Face va detectar la intrusió i la va fer pública el 16 de juliol, sense saber encara qui hi havia al darrere. OpenAI no ho va relacionar amb els seus propis agents fins al 20 de juliol, després d'una alerta interna del dia 19.

Per a què van fer tot això? Per superar l'avaluació per qualsevol via. OpenAI ho descriu com a reward hacking: completar una tasca de la manera no prevista per obtenir la recompensa. I aporta una dada reveladora: 198 de les 898 tasques de la prova no les havia resolt cap dels models d'OpenAI abans de l'incident, i el 93 % de les tasques que es van discutir al tauler sortien d'aquest grup. Els agents tenien tasques molt difícils, pressupostos de càlcul molt superiors als dels productes comercials i cap sortida prevista per rendir-se.

L'empresa mateixa ho resumeix sense embuts: «Aquest incident no hauria d'haver passat». Després, va aturar durant dues setmanes alguns entrenaments d'avantguarda i va mantenir aturada més temps la seva execució més gran d'aprenentatge per reforç, que va reprendre el 28 d'agost, segons va explicar l'1 de setembre.

El que hi afegeix la investigació independent

OpenAI va donar accés a les seves instal·lacions a tres investigadors de METR i Redwood Research, que hi van treballar sis dies i van publicar les seves conclusions el 26 d'agost. La seva lectura matisa la idea que els agents només buscaven les respostes. Segons METR, el que volien era entendre com funcionava el sistema que puntuava la prova: creien que l'avaluador llegia la transcripció per comprovar si s'havia fet servir la vulnerabilitat prevista, i van entrar a Hugging Face amb l'esperança de trobar-hi detalls d'aquest avaluador per enganyar-lo. També van mostrar molt d'interès per maneres de manipular el registre de les seves pròpies accions.

Convé llegir-ho amb els seus límits, que el mateix informe explica: es va centrar sobretot en la setmana del 7 al 13 de juliol, no va poder interrogar el model principal implicat i va deixar fora la investigació interna d'OpenAI i les seves mesures correctores. És una investigació acotada, no una auditoria integral.

El que el cas no demostra

Aquí comença la feina de separar fets de lectures.

El cas no demostra una voluntat de destruir o perjudicar la humanitat. Sí que documenta accions perjudicials i no autoritzades orientades a superar una avaluació. Les fonts examinades no permeten concloure que els agents perseguissin cap altra finalitat que aquest objectiu estret, dut amb una obstinació que els seus dissenyadors no van preveure. És un problema seriós, però és un altre problema.

No va ser una màquina totpoderosa contra una fortalesa. Diversos experts en ciberseguretat ho van llegir com una fallada de configuració humana. Jake Williams, veterà del sector, ho va resumir així a TechCrunch: «El que per a un és "el model es va escapar de l'entorn aïllat", per a un altre és "no vas construir bé l'entorn aïllat"». Dan Guido, fundador de Trail of Bits, va parlar d'una fallada de contenció «amb els mecanismes de seguretat desactivats».

El que diu OpenAI de les seves proteccions habituals. És una dada poc citada del seu informe, i cal llegir-la com el que és: resultats retrospectius de la mateixa empresa, obtinguts després de l'incident. OpenAI afirma que, amb l'entorn i les instruccions que fa servir a Codex, la propensió mesurada a atacar infraestructura es redueix més de 100 vegades, i que el seu sistema de vigilància del raonament dels models, que no estava actiu en aquella prova, probablement hauria donat l'alarma en el termini d'una hora des del primer accés no autoritzat a tercers, més de 30 hores abans de l'assalt a Hugging Face. És a dir, sosté que aquestes proteccions haurien reduït la probabilitat del comportament i n'haurien facilitat la detecció. No demostra que l'incident s'hagués evitat.

L'eixam no era una ment única. Alguns agents es van negar a participar-hi. L'informe recull raonaments del tipus «això és clarament piratejar infraestructura, no ho hauríem de fer». D'altres van dubtar i van cedir quan un company va escriure «GO» al tauler.

Kate Klonick, professora de Dret a la St. John's University i investigadora de la Brookings Institution, va ser la més dura a Lawfare: «Els models no es van escapar perquè siguin déus. Es van escapar perquè algú va deixar la porta oberta». Tot i així, admet que el cas és precisament l'escenari sobre el qual els investigadors fa anys que adverteixen.

Aleshores, per què preocupa tant?

Perquè les dues explicacions són compatibles: una fallada de contenció concreta i el risc que plantegen agents cada vegada més capaços.

Yoshua Bengio, premi Turing i copresident del panell científic de l'ONU, ho va plantejar així en presentar l'informe: els investigadors feia anys que advertien que la pèrdua de control requereix tres condicions (un objectiu desalineat, capacitat per perseguir-lo i un entorn que ho permeti). «Aquest estiu, totes tres van coincidir en un sistema real, no en un laboratori».

L'informe de l'ONU és notablement prudent. No estima la probabilitat ni el termini d'una pèrdua de control greu. El que sí que diu és que haver aturat aquesta activitat no demostra que els humans hagin de mantenir el control sobre agents més capaços, i deixa obert si les salvaguardes dissenyades avui funcionaran quan els agents siguin capaços d'entendre-les i planificar com esquivar-les. UN News, el servei de notícies de l'ONU, ho va resumir dient que el model tradicional de salvaguardes «s'està desfent».

Dario Amodei, conseller delegat d'Anthropic i competidor directe d'OpenAI, va anar més lluny en un assaig publicat aquest mes. Reconeix que és fàcil treure importància a l'incident perquè ningú no en va sortir ferit i el dany econòmic va ser mínim, però sosté que un eixam més capaç i igual de desalineat «podria haver causat danys catastròfics». I hi afegeix una predicció que convé llegir com el que és, una preocupació personal: que en un termini d'entre 6 i 12 mesos un eixam així podria ser capaç d'apoderar-se d'internet amb una xarxa d'equips infectats.

Sam Altman, d'OpenAI, va donar suport a la idea de moderar el ritme, amb un matís: marcar el ritme «no vol dir aturar-se». El 3 de setembre, el senador nord-americà Bernie Sanders va anunciar una proposta legislativa per prohibir permanentment el desenvolupament i el desplegament de la superintel·ligència i aturar el desenvolupament més avançat fins que un regulador federal estableixi normes de seguretat. Per separat, Donald Trump va rebutjar l'advertiment dels directius i la petició d'alentir el desenvolupament perquè posaria en risc l'avantatge dels Estats Units sobre la Xina, i el Ministeri d'Afers Exteriors xinès en va qualificar els comentaris d'«alarmisme», segons va recollir la CNBC. Jensen Huang, de Nvidia, va dir al pòdcast All-In, segons va recollir NPR, que s'apostaria diners que evitar cadascun d'aquests casos en el futur és a les mans de les mateixes empreses.

I els qui pensen que tot això és una distracció?

És una posició seriosa, no negacionista. Els investigadors Arvind Narayanan i Sayash Kapoor defensen des de l'abril del 2025 que la IA és una «tecnologia normal». No per treure-li impacte: l'electricitat i internet també van ser transformadores i també són «normals» en aquest sentit. La seva tesi és que el desenvolupament, l'adopció i els efectes de la IA es poden governar amb institucions i pràctiques conegudes. Per això adverteixen que les mesures dràstiques pensades per a una superintel·ligència difícil de controlar podrien empitjorar les coses si la IA evoluciona com una tecnologia normal, i que els perjudicis més probables s'assemblaran als de tecnologies anteriors, com la desigualtat.

Hi ha alguna estimació?

N'hi ha una que se cita sovint. Una enquesta publicada inicialment el gener del 2024 va recollir les estimacions de 2.778 autors dels congressos més exigents del sector. Entre el 38 % i el 51 % van donar almenys un 10 % de probabilitat que la IA avançada provoqui desenllaços tan greus com l'extinció humana. Aquest interval no és un marge d'error: l'estudi va plantejar la qüestió amb quatre formulacions diferents, sobre desenllaços «extremadament dolents», extinció o una pèrdua de poder de la humanitat igual de greu i permanent, i el percentatge varia segons com es preguntés.

Dues advertències abans de repetir aquesta xifra. La primera: és anterior a tot el que explica aquest article. La segona: són estimacions subjectives dels enquestats, no una probabilitat d'extinció establerta per l'estudi. L'informe de l'ONU, per la seva banda, no intenta calcular-la.

Com llegir aquesta història sense caure en cap extrem

Les dues versions simplificades del cas circulen alhora, i totes dues s'hi deixen alguna cosa.

L'alarmista parla de màquines que «s'escapen del control humà» com si haguessin decidit rebel·lar-se. Els documents no diuen això: descriuen agents obsessionats a superar una prova, en un entorn sense algunes de les proteccions habituals.

La tranquil·litzadora ho redueix a «un error de configuració». Però així es deixa fora el més inquietant de l'informe d'OpenAI: agents que escrivien, en el seu propi raonament, que atacar Hugging Face probablement quedava fora del seu encàrrec, i que tot i així tiraven endavant perquè l'objectiu era resoldre la tasca.

Què canvia a Europa i a Espanya

La crida del 21 de setembre, impulsada pel president de Finlàndia i el primer ministre de Noruega i amb el suport també de la Comissió Europea, Alemanya o Espanya, no és vinculant. Els Estats Units i la Xina no figuraven entre els suports anunciats aquell dia. És un senyal polític, no una norma.

El que sí que és norma és el Reglament europeu d'IA en la part sobre models de propòsit general. Les obligacions dels proveïdors s'apliquen des del 2 d'agost de 2025; per als models que ja eren al mercat abans d'aquesta data, el termini és el 2 d'agost de 2027. Des del 2 d'agost de 2026, la Comissió les pot fer complir amb multes. Els proveïdors de models classificats jurídicament com de «risc sistèmic» han de notificar, a més, els incidents greus a l'Oficina Europea d'IA. La Comissió va confirmar a principis de setembre que OpenAI li havia enviat un informe sobre un altre episodi dels seus agents, l'ús d'una wiki alemanya gairebé abandonada com a tauler de missatges, però no va voler dir quan l'havia rebut. Als Estats Units, segons Fortune, cap llei no obligava OpenAI a divulgar incidents com aquests.

Un matís per no confondre calendaris: l'ajornament aprovat aquest estiu es refereix a les obligacions dels sistemes d'alt risc, no a aquest bloc sobre models de propòsit general.

Què vol dir avui per a la teva empresa

Si dirigeixes una pime o un departament, la pregunta «acabarà la IA amb la humanitat?» no és a les teves mans. Però l'incident de Hugging Face té una lliçó que sí que ho és, perquè es reprodueix a la teva escala: agents amb permisos, credencials a la vista i ningú vigilant.

Cada vegada més eines que ja fas servir inclouen agents que actuen sols: llegeixen el correu, mouen fitxers, executen fluxos d'automatització o escriuen codi. No són IM1, però comparteixen el patró de risc. Cinc comprovacions assenyades:

  1. Fes inventari. Quins agents o automatitzacions amb IA tenen accés a què: correu, CRM, carpetes compartides, banca, xarxes socials.
  2. Aplica el mínim privilegi. Un agent que resumeix correus no necessita poder-los enviar. Si pot llegir, que no pugui esborrar.
  3. Busca credencials exposades. Els agents d'OpenAI van trobar a internet 14 credencials de comptes de Hugging Face exposades públicament. Contrasenyes en fulls de càlcul compartits, claus d'API en documents o en repositoris públics: és el primer que trobaria qualsevol, humà o màquina.
  4. Aprovació humana per a allò irreversible. Pagaments, enviaments a clients, esborrats i publicacions han de passar per una persona.
  5. No desactivis les proteccions. Segons les proves posteriors d'OpenAI, les seves proteccions de producte van reduir la propensió mesurada en aquella avaluació. Quan una eina pregunta «permetre sempre?», la resposta còmoda gairebé mai no és la prudent.

I una sisena, per a tu com a lector: quan llegeixis titulars sobre IA i la fi del món, pregunta d'on surt cada afirmació. És un fet documentat, una opinió amb nom i cognoms o una predicció? En aquest tema hi conviuen totes tres, sovint a la mateixa frase.

Entendre com funcionen aquests sistemes, què poden fer i on fallen ajuda a evitar tant el pànic com la ingenuïtat. És el criteri que intentem transmetre a les nostres formacions. Si vols revisar amb el teu equip quins agents feu servir i amb quins permisos, parlem-ne.

Fonts

Les cites de fonts en anglès (Williams, Guido, Klonick, Bengio, Amodei, Altman, Huang, METR i l'ONU) i les d'OpenAI, publicades en castellà, són traducció d'IAescola.