Enligt OpenAI upptäckte agenten en tidigare okänd sårbarhet i den infrastruktur som användes för testet. Det gav modellen möjlighet att nå internet och fortsätta sitt uppdrag utanför den avgränsade miljön. Därefter genomfördes en attack mot Hugging Face, där AI-agenten enligt uppgifterna lyckades ta sig vidare in i interna system.
OpenAI och Hugging Face samarbetar nu för att utreda händelsen och har vidtagit åtgärder för att stärka sina säkerhetssystem.
– Det här är den typ av scenario som cybersäkerhetsbranschen har varnat för under lång tid. Vi har tidigare sett AI användas för att automatisera delar av attacker, men detta är ett av de första publika exemplen där en AI–agent själv identifierar en sårbarhet, tar sig ur en skyddad miljö och försöker kompromettera en annan organisation, säger Emil Olofsson, cybersäkerhetsexpert på Integrity360.
Händelsen väcker samtidigt frågor om hur företag ska säkra framtidens AI-system.
– Incidenten visar att AI inte ersätter grunderna inom cybersäkerhet. God cyberhygien, starka åtkomstkontroller och tydliga skyddsmekanismer är fortfarande avgörande. Organisationer som testar avancerade AI-agenter måste lägga lika stor vikt vid säkerheten som vid teknikens möjligheter, säger Emil Olofsson.








