Teknologi

OpenAIs Jalapeño-chip korer inferens med 1,9 gange hojere effektivitet end Nvidia Blackwell pr. watt

Adrian Kessler

OpenAI har bygget sin egen chip. Virksomheden præsenterede Jalapeño på Hot Chips-konferencen, en siliciumdesign udviklet i samarbejde med Broadcom, der behandler inferensforespørgsler med 85.448 tokens per sekund per kilowatt. Nvidias Blackwell-arkitektur, den nuværende markedsstandard, når 44.960 på samme metrik. Forholdet er 1,9 gange.

Metrikken er vigtig, fordi inferens er den måde, AI-systemer kører i produktion. Træning sker én gang; inferens sker hver gang nogen sender en forespørgsel til ChatGPT, bruger et API eller interagerer med en applikation, der kører en sprogmodel. Omkostningerne ved inferens i stor skala er den primære drivkraft for AI-services økonomi. En chip, der halverer inferensenergiforbruget, hvis den udrulles bredt, ændrer omkostningen per forespørgsel ved at køre modeller.

Ved interaktive arbejdsbyrder, hvor responstid er den begrænsende faktor, rækker Jalapeños fordel endnu længere. SemiAnalysis-rapporten om Hot Chips-præsentationen angav intervallet til 2,1 til 4,1 gange bedre end Blackwell på disse benchmarks. Spredningen afspejler variation på tværs af specifikke opgavetyper; den nedre grænse er den mere konservative sammenligning.

Chipen håndterer kun inferens. Den kører ikke træningsarbejdsbyrderne, der producerede de modeller, Jalapeño er designet til at køre. Disse kræver stadig Nvidia-hardware. Broadcom fremstillede chipen under en specialdesignaftale med OpenAI frem for at sælge den som et kommercielt produkt. Ordningen giver OpenAI et formålsbygget inferenslag uden at kræve, at det konkurrerer på det kommercielle chipmarked.

OpenAIs implementeringstidslinje er begrænset. En lille udrulning er planlagt før udgangen af 2026; bredere implementering er et 2027-mål. Chipen er stadig i ingeniørprøvefasen, hvilket betyder, at produktionsversionen endnu ikke er sendt i stor skala. Benchmarksene ved Hot Chips repræsenterer det designede mål, ikke en verificeret produktionskørsel. Afstanden mellem konferenceannoncering og operationel implementering for specialfremstillet silicium måles typisk i år.

Annonceringen passer ind i en bredere skift blandt store AI-virksomheder mod specialfremstillet silicium. Google har drevet sine egne Tensor Processing Units i produktion i et årti. Amazon kører Trainium og Inferentia i AWS. Meta opererer sine egne inferenschips internt. OpenAIs indtræden bekræfter, at i skalaen af hundredvis af millioner aktive brugere bliver økonomien ved at stole udelukkende på eksterne GPU-leverandører svær nok til at retfærdiggøre omkostningerne ved et specialdesignprogram.

Tags: , , , , ,

Debat

Der er 0 kommentarer.