Teknik

OpenAI kallar Astra sin säkraste AI — men modellen döljer sitt resonemang

Adrian Kessler

Astra arbetar över kod, säkerhetsanalys, datoranvändning och flerstegs professionella uppgifter med en hastighet och noggrannhet som överträffar OpenAIs tidigare modell Sol och Anthropics Fable vid standardiserade programvarutekniska riktmärken. Företaget beskriver den som den första modell som byggts och som passerar den ”kritiska” nivån av cybersäkerhetskapacitet: den kan identifiera och utveckla exploateringar för tidigare okända säkerhetsbrister, i en omfattning och hastighet som inget mänskligt team kan matcha.

Mekanismen bakom detta är en teknik som kallas opak rekursion. Standardspråkmodeller producerar sitt resonemang som läsbar text – den tankekedja som forskare använder för att granska beslut, fånga upp fel och verifiera att en modell beter sig som avsett. Astra arbetar utan att producera den texten. Den kan lösa svåra problem utan att lämna något läsbart spår av processen. OpenAIs chefsforskare, Jakub Pachocki, erkände skiftet: mer kapabla modeller, sade han, kan ”utföra svårare uppgifter med färre språktokens.” Övervakningen blir svårare i proportion till detta.

Det skapar ett strukturellt problem som OpenAIs egna påståenden gör synligt. Företaget beskriver Astra som sin ”mest anpassade modell” hittills. Anpassning – den ingenjörsdisciplin som handlar om att få AI-system att bete sig som deras skapare avsett – har historiskt förlitat sig på att läsa vad modellen gör steg för steg. En modell som resonerar osynligt gör sin egen anpassning overifierbar med den metoden. OpenAI har inte offentligt beskrivit vilken alternativ metod man använder för att verifiera Astras beteende före driftsättning.

Greg Brockman, OpenAIs ordförande, beskrev Astra som ett ”generationssprång” och fick frågan direkt om den representerar artificiell generell intelligens. Hans svar: den avtalsenliga AGI-definition som styrde OpenAIs partnerskap med Microsoft gäller inte längre. AGI är numera, sade han, ett ”andligt koncept.” Den inramningen spelar roll. OpenAIs Microsoft-avtal innehöll klausuler knutna till AGI – villkor under vilka villkoren för relationen skulle förändras. Att beskriva AGI som odefinierat håller dessa klausuler vilande, oavsett vad Astra faktiskt är kapabel till.

Åtkomst lanserades först till Daybreak, OpenAIs granskade cybersäkerhetsprogram – en struktur som företaget beskriver som försvarsförst-deployment. Resonemanget är att organisationer som letar efter sårbarheter i sina egna system får kapaciteten före dem som letar efter sårbarheter i andras. Den logiken håller bara så länge som åtkomstkontrollerna håller. Astras förmåga att identifiera nolldagars-sårbarheter är, avsiktligt, precis vad en välnutrustad angripare skulle vilja ha. En modell som resonerar utan en läsbar tankekedja är också svårare att begränsa eller granska i efterhand om något går fel.

Bredare åtkomst rullas ut till betalnivåerna – Pro, Plus, Enterprise, Business – och via API under den kommande veckan.

Taggar: , , , , ,

Diskussion

Det finns 0 kommentarer.