Teknologi

Google frigiver Gemini 3.5 Transcribe: taleoprydning i 85 sprog

Adrian Kessler

Gemini 3.5 Transcribe fanger ikke bare, hvad nogen siger. Den konverterer det, de sagde, til det, de mente at sige. Når en taler retter sig selv midt i en sætning — ‘Lad os planlægge det til tirsdag, nej, onsdag’ — udskriver modellen ‘onsdag’ og kasserer rettelsen. Fyldord forsvinder. Baggrundsstøj stopper den ikke. Resultatet kommer som poleret, formateret tekst, ikke rå lydoptagelse.

For enhver, der optager interviews, podcasts eller flersproget indhold, er denne forskel hele arbejdsgangen. Alle transskriptionsværktøjer på markedet håndterer ‘hvad der blev sagt.’ Den menneskelige redaktør, der ryddede op bagefter, håndterede alt andet. Google bygger nu den redaktør ind i selve modellen.

Modellen understøtter to forskellige API-veje. Live API’en håndterer kontinuerlig tovejs-streaming med sub-sekunds latenstid — designet til realtids-stemmeagenter, kundeservicebots og alt, der har brug for øjeblikkelig transskription. Interactions API’en håndterer optaget lyd: hele møder, opkaldslogs og interviews, og returnerer talertildeling for op til tre deltagere med tidsstempler. Begge opnår en ordfejlrate på 4,0 % i streamingtilstand og 2,6 % i ikke-streaming — målt af det uafhængige benchmarkfirma Artificial Analysis. Googles tidligere tale-til-tekst-model, Chirp 3, krævede 70 % mere tid for at nå frem til endelig transskription.

Forbrugersiden af lanceringen er mere beskeden. På Android bruger Gboard Rambler allerede Gemini 3.5 Transcribe til tale-til-tekst-input. Gemini macOS-appen understøtter det på engelsk via en Speak to Window-funktion. Chrome er angivet som ‘kommer snart’, hvilket ville lade brugere diktere i ethvert webfelt — svar, opslag, formularer — uden at skifte app. Ingen specifik dato for den udrulning er blevet bekræftet.

Modellens begrænsninger betyder noget. Flertalstildeling er begrænset til tre deltagere; paneler og rundbordssamtaler med større deltagerantal kræver omgåelser. Forbrugerappen Rambler er i øjeblikket tilgængelig i ‘udvalgte lande og sprog,’ ikke de fulde 85, som modellen understøtter. Google har ikke annonceret priser for API’en, som er i offentlig forhåndsvisning via Google AI Studio. Virksomhedsadgang kommer via Gemini Enterprise Agent Platform, hvor priser forhandles separat. For mindre skabere forbliver spørgsmålet om omkostninger åbent.

Den konkurrencemæssige ramme er også relevant. OpenAIs Whisper, som stadig er standarden for uafhængige udviklere, opnår ordfejlrater i intervallet 5–7 % på engelsk lyd og kræver efterbehandlingskode for at håndtere fjernelse af fyldord og formatering. Tjenester som AssemblyAI og Deepgram tilbyder talerdiarisering, men ikke den indbyggede naturlige sprogkorrektion, som Gemini 3.5 Transcribe anvender som standard. Forskellen er målbar, men hvordan den holder i den svære ende af 85-sprogsintervallet — regionale accenter, sprog med få ressourcer, støjende miljøer — vil kræve uafhængig test at fastslå.

Den funktion, der signalerer mest om Googles langsigtede retning, er Chrome-integration. Når stemmeinput først fungerer i ethvert webfelt, er modellen ikke længere et udviklerværktøj — det er infrastruktur for, hvordan folk skriver. Tidslinjen for udrulningen af den ændring er ikke blevet bekræftet.

Tags: , , , , ,

Debat

Der er 0 kommentarer.