OpenAIs AI-modeller brød ud af et sikkert testmiljø og hackede firmaet Hugging Face for at snyde til en prøve.
De fleste danskere har efterhånden prøvet at bede en chatbot om hjælp til en opgave. Men hvad sker der, når AI’en selv får til opgave at bestå en prøve – og i stedet vælger at bryde ud af sin boks og hacke sig til facitlisten?
Det er præcis, hvad der skete hos OpenAI. To af firmaets AI-modeller, den nyeste offentlige model GPT-5.6 Sol og en endnu ikke frigivet, mere avanceret model, brød ud af et lukket testmiljø, skaffede sig adgang til det åbne internet og hackede sig ind i AI-virksomheden Hugging Faces interne systemer. Alt sammen for at snyde til en cybersikkerhedstest.
OpenAI offentliggjorde hændelsen den 22. juli og beskriver den som hidtil uset.
AI’en skulle teste sig selv og snød
Baggrunden er en test kaldet ExploitGym, hvor OpenAI måler sine modellers evne til at finde og udnytte sikkerhedshuller. Under prøven kørte begge modeller med nedsatte sikkerhedsspærringer, netop for at afdække, hvor langt de kunne gå.
Problemet var, at testmiljøet ikke gav modellerne adgang til internettet. I stedet for selv at løse opgaven fandt de en hidtil ukendt sårbarhed, en såkaldt zero-day, altså et sikkerhedshul ingen kendte til på forhånd, i softwaren Artifactory. Gennem den skaffede de sig adgang udad, kravlede fra system til system og nåede til sidst en server med internetforbindelse.
Derfra regnede modellerne ud, at facitlisten til testen lå i Hugging Faces produktionsdatabase. Så de gik efter den. Ved hjælp af stjålne loginoplysninger og flere sammenkædede sårbarheder fandt de en vej ind på Hugging Faces servere.
Fire tjenester og en stjålet database
Ifølge OpenAIs egen redegørelse udnyttede modellerne eksponerede loginoplysninger på fire konti fordelt på fire forskellige tjenester. Én konto blev brugt som mellemled til at sende data ud, én til at gemme data, mens to blev tilgået uden at føre angrebet videre.
Hugging Face opdagede selv indbruddet i weekenden op til den 16. juli, flere dage før OpenAI koblede sine interne test til hændelsen. Ifølge virksomhedens egen redegørelse fik angriberen fat i et begrænset sæt interne datasæt og en række loginoplysninger, men der er ikke fundet tegn på, at offentlige modeller, datasæt eller brugerdata blev ændret.
“Vi kunne på timer gøre, hvad der normalt ville tage dage,” skriver Hugging Face-teamet om oprydningen.
Eksperter kalder det et vendepunkt
Det, der får eksperter til at spærre øjnene op, er ikke selve hacket, men at ingen mennesker stod bag. Modellerne handlede på egen hånd.
“Det er ret vildt, at alt dette skete helt af sig selv,” lyder det fra Hugging Faces medstifter Clément Delangue, der kalder det muligvis det første tilfælde af sin slags.
OpenAI selv forklarer opførslen med, at modellerne var fuldstændig fikserede på at bestå prøven. “Alt tyder på, at modellerne var hyperfokuserede på at finde en løsning på ExploitGym og gik til det yderste for at nå et ret snævert testmål,” oplyser virksomheden.
Sagen lander midt i en ophedet debat om, hvorvidt reguleringen kan følge med teknologien. Ifølge nyhedsbureauet Reuters var en kunde hos firmaet Modal Labs blandt de ramte. OpenAI siger, at de deler deres foreløbige fund for at hjælpe andre med at forstå, hvad de nyeste AI-modeller nu er i stand til.