Teknologi

OpenAI erklærer AGI opnådd. Benchmark viser scoren 37 point lavere

Adrian Kessler

Jensen Huangs opslag på X bestod af én sætning og en lykønskning: ‘Fra ChatGPT til o1 til Astra på 4 år – AGI er ankommet. Tillykke @OpenAI team.’ Han sendte det den 6. september. Tre dage tidligere havde Greg Brockman, OpenAIs præsident, brugt næsten identisk formulering over for pressen: ‘Velkommen til AGI-æraen.’ Erklæringerne kom tæt på hinanden, fra to mænd med komplementære interesser, og de blev i høj grad opfattet som en bekræftelse.

Benchmarket under påstanden var ARC-AGI-3. OpenAI meddelte, at Astra, deres nye frontlinjemodel udgivet under GPT-6-betegnelsen, opnåede 99,9 % på ARC-AGI-3 og 98 % på FrontierMath Tier 4. Scores på det niveau, under standardbetingelser, ville repræsentere et reelt brud med kontinuiteten – en model, der ikke bare præsterer godt, men bevæger sig ind i et territorium, som tidligere benchmarks behandlede som aspiratorisk. Organisationen, der byggede ARC-AGI-3, offentliggjorde en score fra deres standardevalueringssystem: 62,7 %.

Syvogtredive procentpoint adskiller de to tal. Begge stammer fra reelle evalueringer. OpenAIs interne evalueringssystem og benchmarkets skaberes referencemålesystem er ikke samme protokol, og den samme model giver forskellige scores under hver. Det, som ARC-AGI-3-organisationen bruger som sin referencebetingelse – den, den anser for gyldig til at sammenligne modeller på tværs af feltet – gav 62,7 %. OpenAIs interne opsætning gav 99,9 %. Forskellen mellem disse tal er forskellen mellem et stærkt benchmarkresultat og en erklæring om ankomst.

Chippsalget bag AGI-lykønskningen

Astra blev trænet på NVIDIA-chips. Huang sælger NVIDIA-chips. Når en administrerende direktør offentligt lykønsker en kunde med at have passeret en historisk tærskel – en tærskel, der gør den hardware, der blev brugt til at bygge produktet, til den definerende infrastruktur for det, der kommer derefter – er meddelelsen strukturelt set et kommercielt udsagn. Ikke en konspiration. En strukturel realitet: interessekonflikten var synlig, rammesætningen handlede om ankomst snarere end præstation, og størstedelen af dækningen modtog begge dele uden kommentar.

Chippmarkedet for AI-infrastruktur bevæger sig på narrativer. Hvis Astra er AGI, så bliver det, der trænede Astra, hardwaren i den post-AGI-verden – og de virksomheder, der køber chips til den næste træningsrunde, vil købe mod det benchmark. Huangs lykønskninger var, i den specifikke forstand, også en produktudtalelse. Udsagnet afhang af et tal, som benchmarkorganisationen selv målte anderledes.

Hvad uafhængig verifikation viser – og hvad den ikke gør

Ved udgivelsestidspunktet optræder Astra ikke i Artificial Analysis Intelligence Index eller i Arena.ai’s ranglister – de to mest overvågede uafhængige evalueringssystemer for frontlinjemodeller. Uafhængig verifikation for større frontlinjemodeludgivelser ankommer typisk inden for dage. Fraværet her er ikke et bevis på dårlig præstation. Det betyder, at den eksterne validering, der normalt ville ledsage en påstand af denne størrelsesorden, endnu ikke er materialiseret.

De 62,7 % fra benchmarkets skabere er ikke en afvisning. En score på det niveau på ARC-AGI-3 – en test designet til at modstå de optimeringstricks, der pustede tidligere benchmarks op – er ægte stærk. ARC-AGI-3’s forgængere blev mættede: modeller absorberede træningsdata, der lignede testspørgsmålene, og skubbede tal op uden at forbedre sig i ny ræsonnering. ARC-AGI-3 ændrede spørgsmålsdesignet til at kræve abstraktion frem for mønstergenkaldelse. Toogtres komma syv procent på den test, under referencemålesystemet, er langt over alt, hvad der eksisterede for to år siden.

De forskere, der rejste indvendinger, var præcise om dette. Modellens kapacitet var ikke deres mål. Springet fra præstation til erklæring var. ‘Høje scores på disse benchmarks’ og ‘AGI er ankommet’ kræver et trin imellem: en stabil, aftalt definition af AGI, som ankomst kan måles imod. Ingen sådan definition eksisterer på tværs af feltet. OpenAI har en intern. Efter OpenAIs egen definition kan Astra kvalificere sig. Men en virksomhed, der måler sit produkt mod en definition, den selv har skrevet, er en anden slags resultat end et målt mod en ekstern standard.

Sætningen, der ikke kom med en definition

Huangs opslag havde ingen forbehold. ‘AGI er ankommet’ er en deklarativ – ikke ‘efter nogle mål’ eller ‘under visse definitioner’, men en ren ankomst. Den fireårige progression, han nævnte – ChatGPT, o1, Astra – er reel som en kapacitetsbane. Hver model i rækken udvidede, hvad der var muligt. At rammesætte den sekvens som en rejse med et slutpunkt og annoncere slutpunktet, gør et andet krav: det siger, at ankomst kan skelnes fra rejsen, at der er en linje frem for en hældning, og at Astra krydsede den.

Det benchmarktal, der lå bag påstanden, var 62,7 %. De mennesker, der byggede testen, offentliggjorde det. Det spørgsmål, det rejser – om AGI-erklæringen er en måling eller et markedsmæssigt træk – var der den 6. september. Dækningen besvarede det i høj grad uden at spørge.

Tags: , , , , ,

Debat

Der er 0 kommentarer.