Teknologi

OpenAIs tale-AI venter ikke længere på din tur — $0,05 per minut

Susan Hill

Alle stemme-AI’er på markedet i dag beder dig om at vente, før du taler. OpenAIs GPT-Live-1 gør ikke. Modellen, der er tilgængelig via OpenAIs API, lytter og taler samtidigt – og håndterer afbrydelser, pauser og overlappende tale, præcis som et menneske gør i en telefonsamtale.

Prisen er 0,05 dollars per minut for stemmelaget – 1,50 dollars for en 30 minutters samtale, eller 50 dollars per 1.000 samtale-minutter. Udviklere betaler separat for en reasoning-backend: OpenAIs egen GPT-6 Astra eller en hvilken som helst kompatibel model, der håndterer værktøjskald og forretningslogik. Stemmelaget styrer samtalens mekanik; reasoning-laget bestemmer, hvad AI’en rent faktisk siger og gør.

Hvad den adskillelse betyder i praksis: En kundeservicebot kan høre ‘vent, jeg vil faktisk have den anden mulighed’ midt i en sætning og svare på det, i stedet for at tromle igennem et forberedt svar. En sprogtutor kan fange en elev, der snubler over et ord, uden at vente på, at de bliver færdige. Et bookingsystem kan håndtere den slags virkelige opkald, hvor folk gentager sig selv, skifter mening og taler hen over hinanden.

På Full Duplex Bench – evalueringen designet specifikt til at teste samtidig retningsbestemt stemmehåndtering – scorer GPT-Live-1 30 procentpoint højere end sin forgænger, GPT-Realtime-2.1. Når den parres med GPT-6 Astra som reasoning-backend, topper den Tau3, kundeservice-benchmarket, der tester komplekse, flertrinsforespørgsler uden samtaleafbrydelser.

To-lagsarkitekturen afspejler et bevidst designvalg. Taletiming og reasoning faktureres separat, fordi de skalerer forskelligt: En startup, der bygger en letvægts-tutor-app, betaler mindre på begge lag end en virksomhed, der kører tusindvis af samtidige kundeserviceopkald på GPT-6 Astra. Gulvet er 0,05 dollars i minuttet for stemme, uanset hvad der kører bagved.

Hvad GPT-Live-1 ikke ændrer, er kvaliteten af svarene. Stemmelaget styrer, hvornår og hvordan AI’en taler – ikke hvad den ved. Et veltimet dårligt svar er stadig et dårligt svar. Udviklere, der bygger kundeserviceapplikationer, bliver nødt til at evaluere begge lag separat, og reasoning-backenden kan tilføje mere til regningen end selve stemmelaget. OpenAI har heller ikke offentliggjort data om, hvordan full-duplex-arkitekturen præsterer i lavbåndbredde-miljøer eller på støjende telefonlinjer, hvor kontinuerlig lydinput er sværere at opretholde.

GPT-Live-1 er nu tilgængelig i OpenAIs API. Virksomheden har ikke annonceret et forbrugerrettet produkt bygget på modellen, men har indikeret, at fremtidige versioner af ChatGPTs stemmetilstand kan trække på den samme underliggende arkitektur. Satsen på 0,05 dollars i minuttet gælder ved lanceringen; OpenAI har ikke offentliggjort en tidslinje for prisændringer eller en liste over tredjeparts reasoning-modeller, der er godkendt til brug med stemmelaget.

Tags: , , , , ,

Debat

Der er 0 kommentarer.