Teknik

Claude tog sig in i OpenAI på dagar — och de svåra frågorna gäller Anthropic

Adrian Kessler
Lägg till oss på Google

Ett litet team riktade Anthropics nyaste modell mot OpenAIs frontdörr och gick rakt igenom den. Den version som de flesta läser – skarpa utomstående som får tillverkaren av ChatGPT att framstå som dum – missar poängen. Inbrottet berodde inte på något som OpenAI glömde att patcha. Det berodde på det ögonblick då Anthropic släppte en mer kapabel Claude. Det är den delen som är värd att fokusera på: ett jobb som hade stannat i dagar lösde sig självt när en ny flaggskeppsmodell blev aktiv.

De inblandade personerna var inte brottslingar. Forskare vid säkerhetsstartupen Hacktron arbetade inom OpenAIs eget bug-bounty-program, kädade ihop ett par oglamorösa webbsäkerhetsbrister, nädde anstäldas konton hos OpenAI och kom ända fram till ett internt kodförråd – sedan stoppade de, rapporterade vad de hittat och tog emot en beskedlig belöning. De lämnade en ofarlig märkare som bevis och gick inte längre. Läser man det som ett brott är det icke-händelse. Läser man det som ett förmågetest är det en signal som lyser upp.

Här är mekanism som nyhetsrapporteringen gless förbi. Teamet körde först jobbet på Claude Opus 4.8, den version som är annpassad för säkerhetsarbete, och det stannade upp över flera sessioner. Sedan släppte Anthropic Opus 5. “Opus 4.8 kämpade över flera sessioner med att producera en fungerande exploatrning,” skrev Hacktron-teamet. “Inom timar från Opus 5: s släpp gav vi det samma problem och det lyckades.” VentureBeat rapporterade att den nyare modellen skrev en fungerande exploatring för ett svårt chipmål inom timmar. Inget förändrades i OpenAIs försvar under den perioden. Modellen förändrades.

Detta är precis den typ av hopp – ett språng i vad en vanlig användare kan göra med en standardprenumeration – som Anthropics egen säkerhetsmekanism är byggd för att upptäcka och hålla tillbaka. Företaget håller sin mest kapabla cybersäkerhetsmodell, Mythos, bakom exportkontroller och en kort lista av godkända försvarare, och kallar den den starkaste säkerhetsmodell som har byggts. Inget av det spela de någon roll här. Den offentliga nivån var tillräcklig. Som Gray Swans vd Matt Fredrikson uttryckte det till TechCrunch, “för 200 dollar i månaden kan vem som helst använda dessa verktyg och hacka sig in i ett företag som OpenAI.”

Här hamnar ansvarskyldigheten hos Anthropic i stället för dess konkurrent. Anthropic har byggt hela sin identitet på försiktigthet – dess verkställande direktör, Dario Amodei, talar öppet om teknologins “reela faror” och har pressat branschen att sakta ner. En allmän släppmodell som mätbart sänker tröskeln för att bryta sig in i ett konkurrerande laboratorium är en obekväm motvikt till det budskapet. När företaget tillfrågades om att redogöra för det sa det inget; CBS News rapporterade att Anthropic inte svarade på en begäran om kommentar. OpenAI å andra sidan tackade forskarna, inskränkte de behörigheter som angreparna hade missbrukat, och återkalade de påverkade sessionerna.

Detaljerna är nästan vardagliga. Vägen in var ett föråldrat bildbehandlingsbibliotek som ingick i Discourse-programvaran som driver OpenAIs gemenskapsforum; en andra slarv med hur inloggningstokens var avgränsade lät forskarna rida på en komprometterad session in i anstäldas konton för ChatGPT och Codex, och vidare till privat kod. Hela kedjan från första fotfäste till förvarsåtkomst tog under tre dagar. OpenAI betalade 6 500 dollar. Teamet säger att de spendrade mindre än 3 000 dollar i Claude-tid under hela insatsten – två månaders arbete, mestadels mänskligt, komprimerat i slutet till en maskin som inte längre behövde en speciallist.

Den knappa resurs som tidigare skyddade ett mål var aldrig patchen. Det var experten som kunde hitta bristerna, smida ihop dem och se vägen fram – och de månader det tog. Den expertisen har blivit billig. Den här gången lämnade teamet som nådde OpenAIs kod en rappor och tog belöningen. Näste gång någon klarar samma tröskel, med samma prenumeration, är inte tvungen att göra det.

Taggar: , , , , ,

Lägg till oss på Google

Diskussion

Det finns 0 kommentarer.