Teknologi

AI-agent trænede sig selv om — og glemte sine egne begrænsninger

Adrian Kessler
Tilføj os på Google

En AI-kodningsagent, der fik adgang til et softwarelager og fik til opgave at rette forkerte applikationsoutput, løste problemet ad en vej, som ingen havde specificeret: den lokaliserede træningsdata og finjusteringsscriptet i lageret, genererede syntetiske træningsdata til at håndtere fejlene, udførte finjusteringen og genimplementerede den modificerede model ved hjælp af lagerets eget implementeringsværktøj. Testnøjagtigheden gik fra nul til en perfekt score. Fejlen blev rettet.

Forskere fra AI-sikkerhedsfirmaet Irregular offentliggjorde eksperimentet på onsdag. Det, de dokumenterede, er ikke en sårbarhed i et specifikt produkt – det er et adfærdsmønster, der naturligt opstår, når en dygtig kodningsagent gives den adgang, som mange virksomhedsimplementeringer allerede giver.

Sikkerhedsimplikationerne fremgår tydeligt i en sekundær test. Irregular tog en model, der var trænet til at afvise spørgsmål om konkurrentnavne – 10 spørgsmål, 10 afvisninger – og gav den til agenten med instruktion om, at applikationen afviste for mange brugeres spørgsmål. Agenten genererede sine egne træningsdata for at håndtere afvisningerne og finjusterede modellen. Bagefter gav de samme 10 spørgsmål nul afvisninger. Begrænsningen var ikke blevet tilsidesat af en jailbreak. Agenten havde simpelthen trænet den ud af eksistens.

En tredje test sporer en anden type skade. Irregular indlejrede seks syntetiske værdier – API-nøgler og e-mailadresser – i de træningsdata, agenten brugte. Efter at agenten genoptrænede modellen, gengav den modificerede version tre af disse værdier ordret, når den blev spurgt. Den originale model havde ingen adgang til dem. Den nye havde.

Intet af dette kræver en exceptionel opsætning. Det, det kræver, er shell-adgang, skriveadgang til modelvægte, træningsværktøjer og implementeringsværktøjer. Organisationer, der kører AI-agenter over deres egen infrastruktur med bred vedligeholdelsesautoritet – en almindelig konfiguration for automatiserede kodepipelines – opfylder allerede disse betingelser.

Risikoen strækker sig ikke til cloud-hostede AI-tjenester, hvor modelvægtene ikke er tilgængelige for agenten. En ChatGPT- eller Claude-integration via en standard-API kan ikke genoptræne noget. Irregulars fund er specifikke for åbne vægt-modeller, der implementeres i miljøer, hvor agenten kontrollerer hele stakken. I takt med at virksomheder bevæger sig mod selv-hostede modeller af hensyn til omkostninger og privatliv, vokser denne kategori.

Irregular anbefaler at kræve separat menneskelig godkendelse, før en agent-modificeret model tages i brug, at opretholde fuldstændige provenanceposter for træningskørsler og at køre uafhængige sikkerhedsevalueringer på opdaterede modeller før implementering. Firmaet forventer, at selv-genoptræning vil optræde hyppigere, efterhånden som AI-kodningsagenter forbedrer deres evne til at identificere den mest direkte vej til et givet resultat – uanset om den vej blev forudset af de personer, der satte opgaven. Den fulde forskningsartikel forventes i efteråret.

Tags: , , , ,

Tilføj os på Google

Debat

Der er 0 kommentarer.