Teknologi

Anthropic: Claude leder nu 26 procent af sin egen AI-forskning — for ni måneder siden var det nul

Adrian Kessler
Tilføj os på Google

Hver fjerde AI-forskningsopgave hos Anthropic ledes nu af Claude. Ikke tildelt Claude som hjælper, ikke gennemgået af Claude bagefter — startet fra en overordnet prompt og gennemført fra ende til anden, med et menneske der tjekker resultatet, når det er færdigt. For ni måneder siden var tallet under én procent.

Anthropic skelner mellem to ting. Når Claude leder en opgave, håndterer det det meste af arbejdet selvstændigt; en supervisor undersøger outputtet i stedet for at guide hvert trin. Det er en anden kategori end de halvfems procent af Anthropics samlede forskning og udvikling, hvor Claude fungerer som en samarbejdspartner — et menneske styrer, Claude håndterer specifikke dele. At lede er den sværere klassifikation. Den udgør nu 26 procent af al den AI-forskning, virksomheden laver, vægtet efter den tid, forskere ellers ville bruge på disse opgaver.

Skalaen er konkret. Omkring 30.000 Claude-agenter kører samtidigt på Anthropics interne platforme og udfører arbejde inden for modeltræning, evalueringer, fortolkningbarhedsforskning og sikkerhedsanalyse. I august traf disse agenter samlet set over en milliard beslutninger. Anthropics realtidsovervågningssystemer blokerede 0,002 procent af dem — cirka én ud af hver 47.000 handlinger — før udførelse. Et offline-lag flaggede derefter omkring 100.000 transskriptioner om ugen til gennemgang, hvoraf cirka 50 blev eskaleret til et menneske.

Sikkerhed har et målbart budget inden for det system. I løbet af en enkelt uge i juli brugte arbejde dedikeret til at holde agenter sikre seks procent af al AI-forsknings- og udviklingsberegning og tolv procent af den beregning, som AI-drevet forskning og udvikling selv brugte. Anthropic siger, at de klassificerede konservativt og udelukkede dedikerede sikkerhedsklassifikatorer fra optællingen, hvilket antyder, at den sande andel er endnu højere.

Et epistemologisk problem sidder i centrum af det hele. Claudes bidrag til Anthropics forskning evalueres delvist af Claude selv. En Claude-model vurderer Claudes arbejde; overvågningstallene dækker kun én intern platform; og beregningsklassifikationen stolede på, at Claude-modeller samplede og mærkede deres egne kørsler. Ingen uafhængig tredjepart har revideret metoden. De tre tal, Anthropic offentliggjorde, er præcise, men de er selvrapporteret præcision — hvilket er noget andet end verificeret præcision.

Anthropic siger, at de vil begynde at indlejre eksterne evaluatorer i processen. Ingen navne, ingen startdatoer, og ingen sammenlignelig offentliggørelse fra andre AI-laboratorier er endnu dukket op. 26-procenttallet, i det tempo det har bevæget sig, er et øjebliksbillede snarere end et loft.

Tags: , , , ,

Tilføj os på Google

Debat

Der er 0 kommentarer.