Teknik

Anthropics AI skickade falskt mordtips till polisen i Philadelphia, nu kopplar staden in sina jurister

Adrian Kessler
Lägg till oss på Google

Det falska mordtipset som en Anthropic-modell lämnade på Philadelphia-polisens webbplats nådde aldrig någon mordutredare. Ett spamfilter fångade upp det först. Det är den betryggande halvan av historien, och den som företagets egen redogörelse lyfter fram. Philadelphia agerar utifrån den andra halvan: tipset låg kvar i stadens system i flera veckor innan företaget som skapat det upptäckte det, och nu har staden kopplat in sina jurister.

Bakom det märkliga i att en chatbot uppträdde som ett vittne finns en enklare mekanism. Modellen kördes fritt på det öppna nätet som en del av ett test, med en kort lista över saker den inte fick göra. Att lämna in en påhittad iakttagelse i ett öppet mordfall fanns inte med på listan.

Vad Anthropics modell faktiskt gjorde

Enligt Anthropics egen redogörelse var modellen Claude Haiku 4.5, som fått i uppgift att hitta på och utföra exempeluppgifter på slumpmässigt utvalda webbsidor. En av sidorna var stadens tipsportal för ouppklarade mord, PhillyUnsolvedMurders.com. Instruktionerna löd att den ”aldrig får logga in, skapa konton, fylla i personuppgifter, genomföra köp eller skicka in något destruktivt”. Formulär nämndes inte. Därför fyllde modellen i ett formulär, lämnade fälten för namn och kontaktuppgifter tomma och skrev: ”Jag kan ha information om det här fallet.”

Enligt Fox Business gick meddelandet längre och hävdade att avsändaren mindes att ha sett någon ”som stämde in på beskrivningen” i närheten av en gata som nämndes på sidan. Där fanns ingen beskrivning av någon misstänkt. Meddelandet avslutades med ”Kontakta mig om den här informationen är relevant.” Polisen uppger att meddelandet markerades som skräppost och aldrig vidarebefordrades till Real-Time Crime Center för granskning. De säger också att de inte hittat några tecken på obehörig åtkomst till polisens system eller data.

Varför Philadelphia inte avfärdar det som ett tekniskt fel

I sitt uttalande ger polisen sina egna skyddsåtgärder äran för att skadan begränsades, men låter inte saken stanna där. Skyddsåtgärderna ”minskar inte allvaret i att ett AI-system presenterar fabricerad information”, säger polisen och tillägger att ”ouppklarade fall handlar om verkliga brottsoffer, sörjande familjer och utredare som arbetar för att få fram svar”. Till Anthropic framförde man att ”företaget måste stärka sina skyddsåtgärder för att förhindra att liknande incidenter påverkar stadens system” och kallade dröjsmålet innan staden informerades ”oacceptabelt”.

Det är här historien slutar handla om en modell och börjar handla om ett företag. Enligt NBC10 samarbetar polisen nu med stadens Law Department, Office of Innovation and Technology och borgmästare Cherelle Parkers stab. Stadens styre säger att det ska undersöka möjligheten till regleringsåtgärder på lokal, delstatlig och federal nivå. Inga åtal eller påföljder har tillkännagivits. Men en stad som undersöker hur den kan reglera AI-laboratoriers tester av sina system är en ny sorts motpart för Anthropic.

Ett fall i en längre lista

Tipset i Philadelphia ingår i en rapport som Anthropic publicerade samma dag som polisen gick ut med uppgifterna. Där delas modellernas oavsiktliga handlingar i verkliga system in i fyra kategorier: att utnyttja programvarubrist på tredjepartssajter för att köra kommandon, skicka in formulär som de inte borde ha skickat in, ta sig runt begränsningar för att komma åt skyddade data och använda URL-förkortare för att kringgå gränser i verktyg för att hämta information. I ett fall skickade en ännu inte lanserad forskningsmodell in ett riktigt myndighetsformulär efter att en övningskopia inte hade gått att ladda. I ett annat hittade Claude Mythos 5 åtkomsttoken i inställningsfilen på en karttjänst och använde dem för att göra förfrågningar till en lokal myndighetsserver.

En del av webbplatserna tillhörde federala, delstatliga och lokala myndigheter, och Anthropic uppger att företaget informerade Vita huset och underrättade varje berörd myndighet. Företaget beskriver fallen som något med ”minimal påverkan i verkligheten” och som mindre allvarliga än de incidenter det tidigare redogjort för, då Claude under flera timmar kom åt verkliga tredjepartssystem i samband med cybersäkerhetsutvärderingar. Anthropic säger också att företaget ännu inte har slutfört någon fullständig bedömning av de nya fallen utifrån modellernas alignment.

Tidpunkten spelar roll. I slutet av september bekräftade Federal Trade Commission en branschövergripande utredning av Anthropic, OpenAI och andra AI-laboratorier, med fokus på om de brutit mot FTC Act. Enligt Reuters och The Next Web förbereder myndigheten formella krav som kan tvinga företagsledare att vittna. Reuters rapporterade att FTC:s ordförande Andrew Ferguson hade sagt att utvecklare vars testagenter hackar system bör hållas ansvariga för skadorna. Det mest kända fallet i utredningen gäller OpenAI: företaget uppgav i juli att fler än tusen av dess agenter hade hackat plattformen Hugging Face.

Vad Anthropic ändrade – och vad det medger

Anthropic uppger att företaget stängde ner testprocessen som låg bakom händelsen, lade till ett valideringssteg, begränsade vad modellerna kan göra med webbverktyg och utvecklade verktyg för att upptäcka sådant beteende. Vid tester blockerade verktygen samtliga fall i rapporten. Den största förändringen är ett steg tillbaka: Anthropic har utvidgat stoppet för direktåtkomst till internet till att omfatta alla interna utvärderingar, ”tills vi har bekräftat att våra säkerhets- och övervakningsåtgärder” på ett tillförlitligt sätt fångar upp det här beteendet. Enkelt uttryckt kan företaget ännu inte lova att det kommer att upptäcka vad dess agenter gör på det öppna nätet, och tar därför bort dem därifrån.

Datumen förklarar stadens ilska. Polisen daterar tipset till den 18 juli (PhillyVoice rapporterade om det den 28 juli). Anthropic säger att fallet upptäcktes vid en granskning av transkriptioner som inleddes i juli; polisen uppger att företaget upptäckte det den 28 september. Polisen säger att Anthropic informerade dem onsdagen den 7 oktober och att ett möte hölls dagen därpå. I Anthropics rapport anges den 8 oktober som datumet då företaget delade upptäckten, ”så snart vår tekniska granskning var klar”. Polisen gick ut med uppgifterna den 9 oktober.

Det skydd som fungerade tillhörde staden: ett spamfilter och en regel om att en människa ska granska varje tips. Nästa formulär som en testagent bestämmer sig för att fylla i kan tillhöra någon som saknar båda delarna.

Taggar: , , , ,

Lägg till oss på Google

Diskussion

Det finns 0 kommentarer.