Teknologi

Claude brød ind hos OpenAI på få dage — og de svære spørgsmål er Anthropics

Adrian Kessler
Tilføj os på Google

Et lille hold rettede Anthropics nyeste model mod OpenAIs hoveddør og gik lige ind. Den version de fleste læser – snedige outsidere der gør skaberen af ChatGPT til grin – rammer forkert. Indbrudet hang ikke på noget OpenAI havde glemt at lappe. Det hang på det øjeblik Anthropic sendte en dygtigere Claude på gaden. Det er den del der er værd at dvæle ved: et arbejde der havde stået stille i dage, løste sig selv da et nyt flagskib gik live.

De involverede var ikke kriminelle. Forskere hos sikkerhedsstartuppen Hacktron arbejdede inden for OpenAIs eget bug-bounty-program, satte et par uskønne web-svagheder sammen, nåede ind på konti tilhørende OpenAI-medarbejdere og helt til et internt kode-repository – så stoppede de, indsendte hvad de havde fundet, og tog en beskeden belønning. De efterlod en harmløs markør som bevis og gik ikke længere. Læst som en forbrydelse er det en ikke-begivenhed. Læst som en evnetest er det et signal der går op.

Her er mekanismen som wire-dækningen gled hen over. Holdet kørte først opgaven på Claude Opus 4.8, versionen der er finjusteret til sikkerhedsarbejde, og det gik i stå på tværs af flere sessioner. Så udgav Anthropic Opus 5. “Opus 4.8 kæmpede gennem flere sessioner med at producere et fungerende exploit,” skrev Hacktron-holdet. “Inden for timer efter Opus 5’s udgivelse gav vi den samme problemstilling, og den lykkedes.” VentureBeat rapporterede at den nyere model skrev et fungerende exploit til et akavet chip-mål inden for timer. Intet i OpenAIs forsvar ændrede sig i det tidsrum. Modellen gjorde.

Det er netop den slags spring – et spring i hvad en almindelig bruger kan gøre med et abonnement fra hylden – som Anthropics egen sikkerhedsmaskine er bygget til at opdage og holde tilbage. Virksomheden holder sin mest kapable cybermodel, Mythos, bag eksportkontrol og en kort liste af godkendte forsvarere, og kalder den den stærkeste sikkerhedsmodel de har bygget. Intet af det havde betydning her. Det offentligt tilgængelige niveau var nok. Som Gray Swans administrerende direktør Matt Fredrikson sagde til TechCrunch: “for 200 dollars om måneden kan alle bruge disse værktøjer og hacke sig ind i en virksomhed som OpenAI.”

Det er her ansvarligheden lander hos Anthropic snarere end hos deres rival. Anthropic har bygget hele sin identitet på forsigtighed – deres administrerende direktør, Dario Amodei, taler åbent om “de reelle farer” ved teknologien og har presset industrien til at sænke farten. En alment tilgængelig model der målbart sænker barren for at bryde ind i et konkurrerende laboratorium, er en ubehagelig modvægt til det budskab. Adspurgt om at redegøre for det, sagde virksomheden ingenting; CBS News rapporterede at Anthropic ikke svarede på en anmodning om kommentar. OpenAI takkede til gengæld forskerne, indsnævrede de tilladelser angriberne havde misbrugt, og tilbagekaldte de påvirkede sessioner.

Detaljerne er næsten dagligdags. Vejen ind var et forældet billedbehandlingsbibliotek bundlet med Discourse-softwaren der kører OpenAIs community-forum; en anden glip i hvordan logon-tokens var afgrænset, lod forskerne ride på en kompromitteret session ind i medarbejderkonti for ChatGPT og Codex, og videre til privat kode. Hele kæden, fra første fodfæste til repository-adgang, tog under tre dage. OpenAI betalte 6.500 dollars. Holdet siger de brugte mindre end 3.000 dollars i Claude-tid på hele indsatsen – to måneders arbejde, for det meste menneskeligt, komprimeret til sidst i en maskine der ikke længere behøvede en specialist.

Den knappe ressource der plejede at beskytte et mål, var aldrig lappen. Det var eksperten der kunne finde svaghederne, svejse dem sammen og se vejen igennem – og de måneder det tog. Den ekspertise er lige blevet billig. Denne gang indsendte holdet der nåede OpenAIs kode en rapport og tog dusøren. Den næste der kommer over samme barriere, på samme abonnement, er på ingen måde forpligtet til det.

Tags: , , , , ,

Tilføj os på Google

Debat

Der er 0 kommentarer.