Teknik

OpenAIs röst-AI väntar inte längre på din tur — $0,05 per minut

Susan Hill

Alla röst-AI på marknaden idag säger åt dig att vänta innan du talar. OpenAIs GPT-Live-1 gör inte det. Modellen, tillgänglig via OpenAIs API, lyssnar och talar samtidigt – hanterar avbrott, pauser och överlappande tal precis som en person gör i ett samtal.

Priset är 0,05 dollar per minut för röstlagret – 1,50 dollar för en 30-minuters konversation, eller 50 dollar per 1 000 konversationsminuter. Utvecklare betalar separat för en reasoning backend: OpenAIs egen GPT-6 Astra eller någon kompatibel modell som hanterar verktygsanrop och affärslogik. Röstlagret sköter konversationsmekaniken; reasoning-lagret avgör vad AI:n faktiskt säger och gör.

Vad den separationen innebär i praktiken: en kundtjänstbot kan höra ”vänta, jag vill faktiskt ha det andra alternativet” mitt i en mening och svara på det, istället för att mala igenom ett förberett svar. En språktutor kan fånga upp en elev som snubblar över ett ord utan att vänta på att hen ska bli klar. Ett bokningssystem kan hantera den typen av verkliga samtal där människor upprepar sig, ändrar sig och talar i mun på varandra.

På Full Duplex Bench – utvärderingen som är specifikt utformad för att testa samtidig riktningsrösthantering – presterar GPT-Live-1 30 procentenheter bättre än sin föregångare, GPT-Realtime-2.1. När den paras ihop med GPT-6 Astra som reasoning backend, toppar den Tau3, kundtjänstriktmärket som testar komplexa flerstegsfrågor utan konversationspauser.

Tvålagerarkitekturen återspeglar ett medvetet designval. Tal timing och reasoning debiteras separat eftersom de skalas olika: en startup som bygger en lättvikts handledningsapp betalar mindre på båda lagren än ett företag som kör tusentals samtidiga kundtjänstsamtal på GPT-6 Astra. Golvet är 0,05 dollar per minut för röst, oavsett vad som körs bakom.

Vad GPT-Live-1 inte förändrar är kvaliteten på svaren. Röstlagret hanterar när och hur AI:n talar – inte vad den vet. Ett väl tajmat dåligt svar är fortfarande ett dåligt svar. Utvecklare som bygger kundtjänstapplikationer kommer att behöva utvärdera båda lagren separat, och reasoning backend kan lägga till mer på räkningen än själva röstlagret. OpenAI har inte heller publicerat data om hur full-duplex-arkitekturen presterar i lågbandbreddsmiljöer eller på brusiga telefonlinjer, där kontinuerligt ljudinflöde är svårare att upprätthålla.

GPT-Live-1 är nu tillgänglig i OpenAIs API. Företaget har inte annonserat en konsumentinriktad produkt byggd på modellen, även om det har indikerat att framtida versioner av ChatGPTs röstläge kan dra nytta av samma underliggande arkitektur. Priset på 0,05 dollar per minut gäller vid lanseringen; OpenAI har inte publicerat en tidslinje för prisförändringar eller en lista över tredjeparts reasoning-modeller som är godkända för användning med röstlagret.

Taggar: , , , , ,

Diskussion

Det finns 0 kommentarer.