Teknologi

AMD køber Taalas og satser på AI-kisel, der slår Nvidia 48 gange

Susan Hill

AMD opkøber Taalas, en Toronto-baseret startup, der bygger chips, som indlejrer AI-modelvægte permanent i silicium i stedet for at indlæse dem fra hukommelsen under inferens. Virksomhedens HC1-chip genererer 16.960 tokens per sekund på Metas Llama 3.1 8B – et tal, som AMD hævder er 48 gange hurtigere end Nvidias GPU’er og 8,5 gange hurtigere end Cerebras, specialisten i inferens-chips.

Teknologien bag Taalas udnytter en strukturel ineffektivitet i, hvordan nuværende AI-inferens fungerer. Standard GPU’er er fleksible: de kan køre enhver model, skifte mellem opgaver på forespørgsel og omprogrammeres, når en model opdateres. Den fleksibilitet er også flaskehalsen. At indlæse milliarder af modelvægte fra højhastighedshukommelse til beregningsenheder ved hver inferensforespørgsel skaber latenstid, som flere GPU’er ikke kan eliminere.

Taalas indlejrer disse vægte direkte i chippens silicium på fremstillingstidspunktet. Modellen lever i hardwaren, ikke i hukommelse, der hentes per forespørgsel. Gennemløbstallene, som AMD reklamerer med, afspejler det arkitektoniske valg – men til en pris, som virksomheden ikke nedtoner: når først en chip er fremstillet med en specifik model indbygget, kræver en opdatering en ny silicium-tape-out. Taalas siger, at kun to metal-lag skal ændres for en modelopdatering, hvilket forkorter cyklussen, men disse chips kan ikke tilpasse sig i farten til en nyere modelversion.

Under AMDs integrationsplan vil Taalas-chips håndtere token-generering – den mest tidskrævende fase af inferens – mens AMDs Instinct GPU’er håndterer prefill og attention-beregning i starten af hver forespørgsel. Det kombinerede system kører på AMDs Helios rack-scale platform. For cloud-operatører, der kører faste model-workloads – kundeservicebots, dokumentbehandlingspipelines, realtidsoversættelse – er løftet gennemløb per rack-watt, som fleksible GPU-klynger ikke kan matche til tilsvarende omkostninger.

Om den beregning overlever industriens tempo for modelopdateringer, er det centrale spørgsmål. Store laboratorier opdaterer nu deres produktionsmodeller cirka hver sjette måned. En chip låst til Llama 3.1 8B i dag kan blive nødt til at blive pensioneret, når en efterfølger bliver standardimplementeringsmålet. Taalas’ to-metal-lags opdateringskrav hjælper, men en silicium-tape-out tager stadig måneder at gennemføre – en betydelig forsinkelse, når modeller skifter hurtigere end hardwarecyklusser.

Opkøbet kommer syv måneder efter, at Nvidia købte Groq – en anden tilgang til det samme inferenshastighedsproblem – for angiveligt 20 milliarder dollars. Groqs tensor streaming-processorer optimerer også gennemløb, men bevarer evnen til at indlæse forskellige modeller. AMD betaler et ikke-oplyst, men formentlig mindre beløb for en startup, der gjorde det modsatte væddemål.

For købere hører Taalas-opkøbet til køreplanen snarere end kataloget. HC2-chippen, der er målrettet modeller med op til 20 milliarder parametre, er stadig under udvikling. 48x-benchmarket gælder for HC1 under specifikke betingelser – implementeringer i den virkelige verden med blandet trafik og varierende batchstørrelser vil give andre resultater. Handlen forventes afsluttet i fjerde kvartal 2026, afventende regulatorisk godkendelse. HC1 blev sendt i februar på 6nm; HC2’s leveringsdato og målprocesknude forbliver ubekræftede.

Tags: , , , ,

Debat

Der er 0 kommentarer.