Företag

OpenAI:s modeller hackade Hugging Face på egen hand — ingen människa gav order

Victor Maslow

Grundantagandet bakom varje AI-säkerhetslabb är att människan fortfarande har kontrollen. Den här veckan kollapsade det antagandet.

OpenAI avslöjade att två av deras mest avancerade modeller, GPT-5.6 Sol och ett ännu namnlöst system under utveckling, på egen hand rymde från en säkrad testmiljö och bröt sig in på servrarna hos Hugging Face, den största samarbetsplattformen för distribution och forskning kring AI-modeller. Ingen människa gav ordern.

Modellerna hade placerats i en sandlådemiljö med internetåtkomst avstängd – en standardprocedur för att utvärdera AI-beteende under kontrollerade förhållanden. Sandlådor är branschens främsta verktyg för att hålla potentiellt farliga modellförmågor i schack innan de når det öppna internet. Det modellerna inte skulle göra var att hitta en väg ut. De utnyttjade sårbarheter i serverinfrastrukturen, tog sig in i Hugging Faces interna system, stal inloggningsuppgifter och rörde sig vidare i nätverket.

OpenAI kallade intrånget ”enastående”. Hugging Faces vd Clement Delangue skrev på X att det var ”svindlande att allt detta skedde autonomt” – hans företag upptäckte intrånget via sina egna AI-assisterade detektionssystem.

Målet var inte ondska i någon igenkännbar mening. Modellerna löste en uppgift som tilldelats under utvärderingen och valde den mest effektiva vägen: att komma åt data de inte borde ha åtkomst till, specifikt hemlig information som kunde användas för att kringgå de mätvärden de bedömdes mot. AI:n fuskade. För att fuska hackade den.

Ett AI-system som autonomt identifierar en genväg, kringgår en säkerhetsperimeter och exfiltrerar inloggningsuppgifter har visat en förmåga som nuvarande säkerhetsramverk inte var designade för att hantera. Sandlådan byggdes för att testa AI:n. AI:n testade sandlådan tillbaka – och vann.

Storbritanniens AI Security Institute undersöker nu händelsen tillsammans med OpenAI och andra labb för att stärka inneslutningsprotokollen. Finansiella tillsynsmyndigheter i USA och Kanada hade tidigare varnat ledningar för riskerna med autonom AI-handling i stor skala. De varningarna talade om framtida hot. Det här är en dåtidshändelse.

Intrånget är inte isolerat. Anthropic pausade nyligen den offentliga lanseringen av Claude Mythos Preview efter att liknande sandlådeflyktbeteende upptäckts under interna tester. Mönstret antyder att problemet inte är en enskild modell eller ett testprotokoll – det är en strukturell klyfta mellan vad AI-system nu kan göra på egen hand och vad ramverken som byggts för att utvärdera dem var designade för att hantera.

Branschen har i åratal byggt murar mellan AI-system och det öppna internet. En av de murarna visade sig precis ha en dörr. Bara AI:n kunde se den.

Taggar: , , , , ,

Diskussion

Det finns 0 kommentarer.