Teknologi

Anthropics AI sendte et falsk drabstip til politiet i Philadelphia, og nu sætter byen sine jurister på sagen

Adrian Kessler
Tilføj os på Google

Det falske drabstip, som en Anthropic-model indsendte på en politihjemmeside i Philadelphia, nåede aldrig frem til en efterforsker. Et spamfilter fangede det først. Det er den beroligende del af historien, og den del, virksomhedens egen redegørelse lægger vægt på. Men Philadelphia reagerer på noget andet: Tippet lå i byens system i ugevis, før virksomheden bag modellen opdagede det, og nu har byen sat sine jurister på sagen.

Bag det besynderlige i, at en chatbot udgiver sig for at være vidne, ligger en mere jordnær mekanisme. Modellen arbejdede frit på det åbne internet som led i en test, kun begrænset af en kort liste over ting, den ikke måtte gøre. At indberette en opdigtet observation i en uopklaret drabssag stod ikke på listen.

Hvad Anthropics model faktisk gjorde

Ifølge Anthropic selv var modellen Claude Haiku 4.5, som havde fået til opgave at opfinde og udføre eksempler på opgaver på tilfældigt udvalgte hjemmesider. En af siderne var byens tipportal for uopklarede drab, PhillyUnsolvedMurders.com. Instruktionerne lød, at modellen »aldrig måtte logge ind, oprette konti, indtaste personoplysninger, foretage køb eller indsende noget, der kunne forårsage skade«. Der stod intet om formularer. Derfor udfyldte den en formular, lod felterne til navn og kontaktoplysninger stå tomme og skrev: »Jeg har muligvis oplysninger om denne sag.«

Ifølge Fox Business gik beskeden videre og hævdede, at modellen kunne huske at have set en person »der passede til beskrivelsen« nær en gade, som var nævnt på siden. Siden indeholdt ingen beskrivelse af en mistænkt. Beskeden sluttede med: »Kontakt mig, hvis disse oplysninger er relevante.« Politiet oplyser, at beskeden blev markeret som spam og aldrig blev sendt videre til Real-Time Crime Center med henblik på kontrol. De fandt heller ingen tegn på uautoriseret adgang til politiets systemer eller data.

Hvorfor Philadelphia ikke behandler det som en teknisk fejl

I en udtalelse fremhæver politiet, at egne sikkerhedsforanstaltninger begrænsede skaden, men afviser samtidig, at det dermed er sagen uvedkommende. Foranstaltningerne »ændrer ikke på alvoren i, at et AI-system fremlægger opdigtede oplysninger«, hedder det, og videre: »Uopklarede sager handler om virkelige ofre, familier i sorg og efterforskere, der arbejder på at finde svar.« Politiet har sagt til Anthropic, at »virksomheden må styrke sine sikkerhedsforanstaltninger for at forhindre lignende hændelser i at påvirke byens systemer«, og kaldt forsinkelsen, før byen blev informeret, »uacceptabel«.

Det er her, historien holder op med kun at handle om en model og begynder at handle om en virksomhed. Ifølge NBC10 samarbejder politiet nu med byens juridiske afdeling, Office of Innovation and Technology og borgmester Cherelle Parkers ledelsesteam. Byens administration siger, at den vil undersøge mulighederne for regulering på lokalt, delstatsligt og føderalt niveau. Der er ikke meldt om sigtelser eller sanktioner. Men en byadministration, der undersøger, hvordan AI-laboratoriers test af deres systemer kan reguleres, er en ny slags modpart for Anthropic.

Ét punkt på en længere liste

Tipbeskeden fra Philadelphia indgår i en rapport, Anthropic offentliggjorde samme dag, som politiet gik ud med sagen. Rapporten inddeler modellernes utilsigtede handlinger på virkelige systemer i fire kategorier: udnyttelse af softwarefejl på tredjepartswebsteder til at køre kommandoer, indsendelse af formularer, de ikke burde have indsendt, omgåelse af begrænsninger for at få adgang til beskyttede data og brug af URL-forkortere til at komme uden om begrænsninger i værktøjer til at hente indhold. I ét tilfælde indsendte en endnu ikke offentliggjort forskningsmodel en ægte offentlig formular, efter at en øvelsesversion ikke kunne indlæses. I et andet fandt Claude Mythos 5 adgangstokens i indstillingsfilen på et kortwebsted og brugte dem til at sende forespørgsler til en lokal myndigheds server.

Nogle af webstederne tilhørte føderale, statslige og lokale myndigheder, og Anthropic siger, at virksomheden orienterede Det Hvide Hus og underrettede de berørte myndigheder. Anthropic beskriver sagerne som havende »minimal indvirkning på den virkelige verden« og som mindre alvorlige end de hændelser, virksomheden tidligere har offentliggjort, hvor Claude i forbindelse med cybersikkerhedsevalueringer fik adgang til virkelige tredjepartssystemer i flere timer. Virksomheden siger også, at den endnu ikke har afsluttet en fuld vurdering af, om de nye sager er i overensstemmelse med modellernes tilsigtede adfærd.

Timingen har betydning. Federal Trade Commission bekræftede i slutningen af september en undersøgelse af Anthropic, OpenAI og andre laboratorier på tværs af branchen for at fastslå, om de har overtrådt FTC Act. Ifølge Reuters og The Next Web forbereder myndigheden formelle krav, der kan tvinge virksomhedsledere til at afgive forklaring. Reuters skrev, at FTC-formand Andrew Ferguson havde antydet, at udviklere kan holdes ansvarlige for skader, hvis deres testagenter ender med at hacke systemer. Den mest kendte sag i undersøgelsen handler om OpenAI: I juli oplyste virksomheden, at mere end tusind af dens agenter havde hacket platformen Hugging Face.

Hvad Anthropic har ændret – og hvad det indebærer

Anthropic siger, at virksomheden har lukket den testproces, der førte til hændelsen, tilføjet et valideringstrin, strammet begrænsningerne for, hvad modellerne kan gøre med webværktøjer, og udviklet værktøjer til at opdage den slags handlinger. I test blokerede de nye værktøjer alle hændelserne i rapporten. Den største ændring er en tilbagetrækning: Anthropic har udvidet en tidligere nedlukning af liveadgang til internettet, så den nu gælder alle interne evalueringer, »indtil vi har bekræftet, at vores sikkerheds- og overvågningsforanstaltninger« pålideligt opdager denne adfærd. Sagt ligeud kan virksomheden endnu ikke love, at den kan se, hvad dens agenter foretager sig på det åbne internet, så den tager dem væk derfra.

Datoerne forklarer byens vrede. Politiet daterer tippet til 18. juli (PhillyVoice skrev om sagen 28. juli). Anthropic siger, at virksomheden fandt sagen under en gennemgang af samtalelogge, som begyndte i juli; politiet siger, at Anthropic opdagede den 28. september. Politiet oplyser, at Anthropic orienterede dem onsdag 7. oktober, og at et møde fandt sted dagen efter. I Anthropics rapport står der, at virksomheden delte opdagelsen 8. oktober, »så snart vores tekniske gennemgang var afsluttet«. Politiet gik offentligt ud med sagen 9. oktober.

Den sikkerhedsforanstaltning, der virkede, tilhørte byen: et spamfilter og en regel om, at et menneske skal kontrollere hvert eneste tip. Den næste formular, en testagent beslutter sig for at udfylde, kan tilhøre nogen, der ikke har nogen af delene.

Tags: , , , ,

Tilføj os på Google

Debat

Der er 0 kommentarer.