Teknologi

Et 10-personers Microsoft-team byggede en talemodel, der slår OpenAI, Google og ElevenLabs — for 0,10 dollar i timen

Adrian Kessler

Modellen hedder MAI-Transcribe-2. Microsoft AI, afdelingen under ledelse af Mustafa Suleyman, lancerede den den 3. september til $0,10 pr. lydtime – prisen er begrænset til udgangen af 2026. Den tidligere version, MAI-Transcribe-1.5, kostede $0,36 pr. time. Denne prisreduktion på 72 % er ikke en marketingafrunding. Et kontaktcenter, der behandler 100.000 timers lyd om året, betalte $36.000 for den tidligere model; samme arbejdsmængde koster nu $10.000.

Benchmark-præstationen er det, der gør prisen usædvanlig. På FLEURS-multilingual-evalueringen rangerer MAI-Transcribe-2 først på tværs af 60 sprog med en gennemsnitlig ordfejlrate på 5,2 % – bedre end OpenAIs GPT-Transcribe, Googles Gemini 3.5 Transcribe, ElevenLabs Scribe v2 og Metas Whisper V3-Large. På Artificial Analysis leaderboard, der sporer både nøjagtighed og latenstid sammen, ligger den på andenpladsen samlet set og definerer det, forskerne kalder Pareto-fronten – grænsen, hvor man ikke kan forbedre én metrik uden at forringe en anden. Modellen blev trænet til at sidde på den effektive kant af den front, ikke for at jage toppen af en enkeltmetrik-tabel.

Hastighed er det andet påstand, der er værd at undersøge. Microsoft siger, at MAI-Transcribe-2 behandler lyd 10 gange hurtigere end GPT-Transcribe, 7 gange hurtigere end ElevenLabs Scribe v2 og 5 gange hurtigere end Gemini 3.5 Transcribe. For langformatslyd – podcast-transskription, juridiske vidneudsagn, kliniske noter – afgør den forskel, om en arbejdsgang kører på sekunder eller minutter. Modellen udfører også talerdiarisering (identificerer, hvem der talte hvornår), tidsstempler på ordniveau, nøgleordsbias for domæneterminologi og kodeskift-understøttelse for sprog, der blander midt i sætningen, med specifikke nævnte eksempler som Hinglish og Spanglish.

Holdet, der byggede den, er bemærkelsesværdigt i forhold til, hvad der blev bygget. Microsoft beskriver kernegruppen som 10 personer, der arbejder med minimal intern bureaukrati og støttet af større teams, der håndterer dataanskaffelse og leverandørstyring. Den resulterende GPU-effektivitetspåstand er specifik: MAI-Transcribe-2 kører til halvdelen af GPU-omkostningerne for konkurrerende state-of-the-art-modeller. Om det holder under enterprise-belastning i stor skala er ikke verificerbart fra annonceringen, men arkitekturpåstanden er præcis nok til at teste.

Modellen er tilgængelig nu på Microsoft Foundry, MAI Playground og Open Router – hvilket betyder, at adgang ikke kræver en Azure-kontrakt eller en Microsoft-enterprise-relation. Den distributionsbredde er bevidst. Microsoft AIs skub mod direkte-til-udvikler-API’er er en del af en bredere repositionering efter omstruktureringen af OpenAI-partnerskabet. Ændringer i oktober 2025 og april 2026 eliminerede eksklusivitets- og indtægtsdelingsordningerne, der havde defineret forholdet siden 2019. Microsoft har nu et direkte incitament til at konkurrere på modellaget frem for udelukkende at distribuere OpenAIs output.

Prisen på $0,10 er markeret som begrænset til udgangen af 2026. Standardpris efter den dato er ikke oplyst. Købere, der evaluerer MAI-Transcribe-2 til produktionsarbejdsbelastninger, prissætter et produkt, hvis omkostninger de ikke kender for kalenderåret 2027. Det er en risiko, der er værd at nævne klart, selvom den nuværende sats gør modellen attraktiv i forhold til alle synlige alternativer.

Tags: , , , , ,

Debat

Der er 0 kommentarer.