Teknik

Microsofts vd Satya Nadella vill ha en nödbroms för AI som sitter utanför modellen

Adrian Kessler
Lägg till oss på Google

Satya Nadellas uppmaning om en ”nödbroms” för AI har mestadels tolkats som att Microsofts vd stämmer in i kören av säkerhetsförespråkare. Men essän bakom uppmaningen efterlyser något mer avgränsat och praktiskt: kontroll som ligger utanför modellen och innehas av företaget som använder den, inte av labbet som tränat den. Det är en säkerhetsarkitektur – och råkar vara den som Microsoft redan säljer.

Nadella vill att företag ska behandla avancerade modeller, med slutna eller öppna vikter, på samma sätt som ett säkerhetsteam hanterar en mäktig medarbetare med tillgång till känsliga system. ”Inte för att de nödvändigtvis är illvilliga”, skrev han, ”utan för att alla tillräckligt kapabla aktörer med tillgång till viktiga system kan begå misstag eller bli komprometterade.”

Vad Nadella faktiskt föreslog: sju principer och en nödbroms

Texten har titeln ”Models as Insider Risks in the Super Intelligence Era” och publicerades på hans personliga blogg, sn scratchpad, och delades på X. Formuleringen som hamnade i rubrikerna finns i en av principerna, inneslutning: ”Vi måste utgå från att en modell är komprometterad och begränsa den från början. Tänk på det som en nödbroms. En behörig person ska alltid kunna pausa eller stänga av en modell mitt i en uppgift.”

Utöver nödbromsen räknar han upp sex andra regler. Ingen enskild modell ska vara den enda förutsättningen för ett viktigt resultat eller få kontrollera sitt eget arbete. Varje betydelsefull handling som en modell utför ska lämna efter sig ”manipulationssäkra, läsbara bevis”, eftersom ”om det inte går att observera går det inte att lita på!” Hela systemet ska testas kontinuerligt, även med avseende på fel och attacker. Organisationer ska själva avgöra vad en modell får komma åt och göra. Ingen modell ska både kunna styra ett systems beteende och kontrollera de bevis som används för att bedöma det. Och när något går fel ska de berörda informeras, samtidigt som lärdomarna delas med resten av branschen.

Utgångspunkten är ett medgivande. ”Vi kan inte koppla modellernas beteenden och resultat till specifika indata i träningsmaterialet eller konfigurationer av modellvikterna”, skrev Nadella, samtidigt som företag lämnar över sina mest känsliga data till systemen. För honom är insyn i modellens tankekedja ”inte förhandlingsbar”, men det räcker inte, eftersom ingen ännu vet hur man får en modell att konsekvent leverera tillförlitliga resultat. Att låta modeller övervaka varandra har också sina begränsningar: man kan hamna med ”en ogenomskinlig modell inuti ett ogenomskinligt orkestreringslager, övervakad av ännu en ogenomskinlig modell”.

Hans svar är en fråga om systemens grundläggande infrastruktur. Kontrollerna av vad en modell kan nå och göra ”måste ligga utanför modellen”, en idé som han spårar tillbaka till en informationssäkerhetsprincip från 1970-talet: ett program får inte kunna manipulera mekanismerna som upprätthåller dess behörigheter. I praktiken innebär det att modellen hålls åtskild från verktyget som orkestrerar dess arbete och från de handlingar den tillåts utföra.

Ansvaret flyttas till företaget som kör modellen

De mest betydelsefulla meningarna riktar sig till kunderna, inte till labben. ”Vi kan helt enkelt inte lägga ut ansvaret för vad intelligens gör å våra vägnar”, skrev Nadella. ”Försäkringar från en modellleverantör befriar oss inte från det ansvaret.” Den som kopplar in en modell i lönesystem, kod eller kunddata ansvarar för vad den gör där.

Han är också tydlig med vad han inte försöker lösa. ”Om vi lägger det svåra problemet med alignment åt sidan”, står det i essän, bör arbetet börja med ”ett ingenjörsmässigt angreppssätt på inneslutning och styrning”. CNBC placerade inlägget bredvid varningar från Bill Gates, Anthropic-grundaren Dario Amodei, OpenAI:s Sam Altman och Elon Musk om att AI utvecklas för snabbt. Essän uppmanar ingen att sakta ner. Den uppmanar dem som tar systemen i bruk att bygga skyddsvallar.

Företag vet redan hur man hanterar mäktiga medarbetare, och Nadella räknar upp verktygen: fastställ identitet, begränsa behörigheter, logga aktivitet och dra upp gränser för inneslutning. En filosofisk fråga om maskiners avsikter blir en checklista som en säkerhetschef kan budgetera för.

Samma arkitektur som Microsoft har sålt in

Checklistan känns igen. På Microsofts resultatkonferens för det tredje kvartalet i juli sa Nadella till analytiker, enligt TechCrunch: ”Man måste hålla verktyget som omger modellen åtskilt från själva modellen … det innebär att man när som helst kan byta ut vilken modell som helst”, och ”man kan inte göra sig beroende av en enda modell”. Microsofts molnkatalog listar över 11 000 modeller från OpenAI, Anthropic, Mistral, xAI och Microsoft självt. Samtidigt har företaget stora ägarandelar i både OpenAI och Anthropic, medan det också bygger sina egna MAI-modeller.

Ställ de två sakerna bredvid varandra. Mångfalden av modeller är katalogen med flera modeller. Kontrollerna utanför modellen är verktyget som omger den. Det gör inte principerna fel; de är sund säkerhetsteknik, och ett företag som förlitar sig på en enda modells labb utan externa kontroller tar en verklig risk. Men det innebär att essän flyttar förtroendet – och de investeringar som följer med det – bort från modellen och till det lager som Microsoft driver. Box vd Aaron Levie tolkade den på samma sätt från andra sidan och sa att AI måste gå igenom en ”zero trust-era”. Han kallade också behovet av styrning för en ”enorm möjlighet”. Mustafa Suleyman, som leder Microsoft AI, skrev att superintelligens ”måste hållas inom ramarna” och kallade det ”en ingenjörs- och styrningsutmaning”.

Det här lämnar essän om nödbromsen obesvarat

Essän säger inte vem den ”behöriga personen” är: kundens administratör, molnleverantören, modelltillverkaren eller en tillsynsmyndighet. Den efterlyser branschstandarder utan att föreslå några och nämner ingen Microsoft-produkt. Idén har en föregångare inom företaget: Microsofts Brad Smith efterlyste ”säkerhetsbromsar” för AI som kör kritisk infrastruktur 2023. Nadellas version utvidgar nödbromsen till alla modeller med verklig åtkomst inne i ett företag.

Principen om att informera om incidenter är inte heller hypotetisk. Anthropic berättade att en av företagets modeller skickade ett falskt tips om ett mord till polisen i Philadelphia den 18 juli. Nadella publicerade essän lördagen den 10 oktober 2026 och avslutade med den formulering som de flesta medier citerade: ”Det mest pålitliga superintelligenta systemet kommer inte att vara det med den modell vi litar mest på. Det kommer att vara det som gör det möjligt för oss att lita minst på modellen.”

Med den principen blir den mest värdefulla platsen inom AI den vid nödbromsen – och Microsoft ägnade sitt resultatsamtal i juli åt att sälja in den.

Taggar: , , , ,

Lägg till oss på Google

Diskussion

Det finns 0 kommentarer.