Teknologi

Gemini 3.8 Live erstatter det tomme ansigt i AI-kundeservice

Adrian Kessler
Tilføj os på Google

Systemet hedder Gemini 3.8 Live med Live Avatar. Det kombinerer Googles tale-til-tale-model med et videolag i realtid, der genererer mundbevægelser og ansigtsudtryk, samtidig med at det håndterer værktøjskald i baggrunden uden at sætte samtalen på pause. Sproget registreres automatisk — avataren skifter mellem talte sprog midt i et opkald uden overdragelse, genindlæsning af systemet eller mærkbar pause.

Det, der adskiller løsningen fra teknikker med video lagt oven på lyden, er, at lyd- og videogenereringen foregår i det samme inferensforløb i realtid i stedet for som sekventielle trin. Koblingen holder forsinkelsen så lav, at samtalen kan forløbe naturligt. Google indlejrer umærkelig SynthID-vandmærkning i både lyd- og videoudgangen — hvert sekund indeholder et maskinlæsbart mærke, der identificerer indholdet som AI-genereret, også hvis streamen optages og afspilles senere. Vandmærket overlever omkodning, så det fortsat er muligt at verificere klippenes oprindelse, når de eksporteres.

Equal AI, der står for virksomhedsimplementeringer i Indien, giver det tydeligste billede af, hvad løsningen gør muligt i stor skala: ni indiske sprog er aktive samtidig, med over en million liveopkald om dagen og en samlet understøttelse af 97 sprog. En sådan kapacitet ville være økonomisk urealistisk med menneskelige medarbejdere, hvis de skulle tilbyde tilsvarende tilgængelighed og dækning på tværs af vagtplaner. Implementeringen bygger ikke på en antagelse om et proof of concept — den er designet til stor gennemstrømning.

Det, Google ikke oplyser ved lanceringen, er prisen. Virksomheden har ikke offentliggjort priser, men henviser interesserede til sit salgsteam for erhvervskunder. Oprettelse af brugerdefinerede avatarer — hvor organisationer skaber et ansigt ud fra deres egne referencebilleder — kræver adgang via en særlig godkendelsesproces for erhvervskunder og kan ikke klares som selvbetjening. Udvidede Thinking-funktioner til Live-modellen er fortsat i en privat forhåndsvisning, hvilket begrænser modellens ræsonnement sammenlignet med Googles øvrige Gemini-produkter. Grænserne for samtidige sessioner er ikke blevet offentliggjort. Den begrænsede lancering følger Googles velkendte mønster for trinvise erhvervslanceringer, hvor priser og kapacitet forhandles frem for at blive offentliggjort.

Gemini 3.8 Live med Live Avatar er nu tilgængelig i Gemini Enterprise-konsollen og via Live API med adgangspunkter i USA og EU. Google har ikke offentliggjort nogen tidsplan for, hvornår Extended Thinking til Live-modellen bliver bredere tilgængelig ud over den nuværende gruppe med adgang til den private forhåndsvisning.

De virksomheder, der tager teknologien i brug, vil besvare et spørgsmål, som teknologien ikke selv kan afgøre: Forbedrer det brugeroplevelsen at fjerne det visuelle signal, der afslører en automatiseret interaktion — eller fjerner det den sidste ærlige indikator på, at det er dét, der foregår?

Tags: , , , , ,

Tilføj os på Google

Debat

Der er 0 kommentarer.