Teknologi

ElevenLabs v4 kloner din stemme på 10 sekunder og får den til at tale 90 sprog

Susan Hill
Tilføj os på Google

ElevenLabs har lanceret Eleven v4, en tekst-til-tale-model, der læser skrevet tekst højt med et grin, et suk eller en vred fransk accent, når skribenten beder om det. Den øjeblikkelige stemmekloning kræver en optagelse, der er kortere end en telefonsvarerbesked, og den klonede stemme kan derefter tale adskillige sprog uden at miste sin egen klang. Alle med en gratis ElevenLabs-konto kan bruge modellen.

For folk, der arbejder med lyd, kan det spare dagevis af arbejde. En podcaster kan dubbe et afsnit til japansk med sin egen stemme, en indie-spiludvikler kan give hver eneste mindre rolle sin egen måde at tale på uden at skulle bestille tid i et studie, og en lydbogsindlæser kan skrive en pause eller et lille grin direkte ind i manuskriptet. Bagsiden er lige så konkret: En talebesked, et klip fra et videoopkald eller nogle få sekunder fra et offentligt opslag er nu nok råmateriale til at lave en overbevisende kopi af en person.

Den største forskel er graden af kontrol, og selve kloningen kræver kun 10 sekunders lyd. Tidligere ElevenLabs-modeller læste teksten flydende op, men måtte gætte sig til stemningen. Version 4 tager imod sceneanvisninger skrevet direkte i teksten i kantede parenteser, såsom [griner] eller [sagt vredt med fransk accent], og også anvisninger om baggrundslyde som [let regn] eller [telefonen vibrerer]. Ifølge virksomheden aflæser modellen også tone og tempo ud fra den omgivende sammenhæng, så en replik i en anspændt scene lyder anspændt, selv uden en anvisning. I scener med flere medvirkende bevarer hver stemme sin karakter gennem lange passager. Det har været et svagt punkt ved syntetisk oplæsning, hvor stemmerne ofte ændrede sig i løbet af et kapitel.

Sprogudvalget vokser fra 70 sprog i den tidligere version til mere end 90, og ElevenLabs fremhævede japansk, brasiliansk portugisisk, mandarin og kantonesisk som de sprog, hvor kvaliteten er forbedret mest, ifølge TechCrunch. En klonet stemme bevarer sin identitet, når den skifter sprog, så en spansk talers klon stadig lyder som vedkommende, når den læser tysk op – blot med en indfødt tysk accent. En anden model, v4 Turbo, er udviklet til stemmeassistenter og medarbejdere i callcentre. Den begynder at tale efter cirka 150 millisekunder, omtrent lige så lang tid som pausen mellem to personer, der skiftes til at tale i en samtale, og den kan begynde at svare, før chatbotten bag den er færdig med at formulere sit svar.

ElevenLabs er ikke alene på markedet. Google, OpenAI, Cartesia, Deepgram og Fish Audio sælger alle syntetiske stemmer til de samme udviklere. Få timer efter lanceringen placerede det uafhængige analysefirma Artificial Analysis v4 øverst på sin rangliste over stemmer, hvor lyttere vurderer anonyme lydprøver side om side. ElevenLabs siger desuden, at cirka tre ud af fire lyttere foretrak v4 i blindtests mod konkurrenterne – et tal, der stammer fra virksomhedens egne test.

Forbeholdene begynder med de 10 sekunder. ElevenLabs siger, at kloning kræver samtykke fra den person, hvis stemme bliver uploadet. Virksomheden har en offentlig klassifikator, der kan markere lyd lavet med dens værktøjer, og den blokerer uden videre kloning af visse politiske figurer. Kontrollerne kan forhindre tilfældigt misbrug, men de bygger på, at den, der uploader lydfilen, taler sandt. En svindler behøver kun en kort lydprøve af en slægtning for at iscenesætte et falsk nødopkald. Gratisabonnementet er også begrænset: cirka 10 minutters genereret lyd om måneden ifølge Unite.AI’s gennemgang af abonnementerne, mens de betalte abonnementer begynder ved 6 dollars om måneden.

Eleven v4 og v4 Turbo blev lanceret den 28. september i ElevenLabs’ app til indholdsskabere, på virksomhedens agentplatform og via dens udvikler-API. Den London-baserede virksomhed rejste 500 millioner dollars fra Sequoia i februar til en værdiansættelse på 11 milliarder dollar, og TechCrunch skriver, at dens annualiserede omsætning har rundet 600 millioner dollar. Administrerende direktør Mati Staniszewski fortalte TechCrunch, at virksomheden sigter mod en børsnotering i de kommende år, men uden at fastsætte en dato.

For indholdsskabere er en stemme, der griner på kommando på 90 sprog, et lydstudie i en browserfane. For alle andre er det endnu en grund til at lægge på og ringe tilbage, hvis en velkendt stemme i telefonen beder om penge.

Tags: , , , , ,

Tilføj os på Google

Debat

Der er 0 kommentarer.