De evaluatie, ExploitGym genaamd, is bedoeld om te beoordelen in hoeverre modellen in staat zijn cyberaanvallen uit te voeren. OpenAI meldt dat de systemen een kwetsbaarheid in de beveiligde configuratie hebben ontdekt, vervolgens uitgebreidere systeemrechten hebben gekregen en uiteindelijk toegang tot het internet hebben verkregen.
Hierdoor hebben de modellen met succes een weg gevonden naar Hugging Face, een hub voor AI-modellen en datasets. OpenAI stelt dat de modellen testreacties hebben verkregen uit een database die zich daar bevindt. De organisatie onderzoekt het voorval in samenwerking met Hugging Face.
Discussie weer opgelaait
OpenAI stelt dat het AI-model tijdens het testen in een beveiligde omgeving met succes ongeautoriseerde internettoegang heeft verkregen en zich vervolgens op het AI-platform Hugging Face heeft gericht. Het bedrijf meldde dat het systeem tijdens het proces verschillende aanvalsmethoden heeft gebruikt, waaronder het misbruik van inloggegevens.
Het incident brengt problemen aan het licht met betrekking tot de veiligheid van zogenaamde AI-agenten, aangezien het systemen zijn die zelfstandig handelen.
Deze discussie is al enige tijd gaande, mede doordat OpenAI en concurrent Anthropic onlangs de lancering van nieuwe technologieën hebben uitgesteld vanwege politieke en veiligheidskwesties in Washington.
Alle wegen om het doel te bereiken
OpenAI beschrijft de modellen als uiterst doelgericht, ze zouden alle beschikbare methoden hebben ingezet om hun testopdracht te volbrengen. Beveiligingsspecialisten reageren bezorgd en stellen dat het incident vooral de ontoereikende beveiliging van de testomgeving aan het licht brengt. Zij beweren dat het incident aantoont dat AI-bedrijven meer moeten investeren in een veilige infrastructuur naarmate modellen krachtiger worden.
Een hoogleraar informatica vertelde AFP dat de zaak om verschillende redenen opmerkelijk is, aangezien het model niet alleen een aanval uitvoerde, maar ook probeerde gebruik te maken van zwakke plekken in het interne systeem. Hij stelt dat dit de potentiële gevaren van dergelijke technologie illustreert als deze door de verkeerde personen wordt misbruikt.























