Teknik

Gemini 3.8 Live ersätter det tomma ansiktet i AI-kundtjänst

Adrian Kessler
Lägg till oss på Google

Systemet heter Gemini 3.8 Live with Live Avatar. Det kombinerar Googles tal-till-tal-modell med ett videolager i realtid som skapar läpprörelser och ansiktsuttryck, samtidigt som det hanterar verktygsanrop i bakgrunden utan att avbryta samtalet. Språket identifieras automatiskt — avataren växlar mellan talade språk mitt i samtalet, utan överlämning, omladdning av systemet eller märkbar paus.

Det som skiljer lösningen från tekniker med videopålägg är att ljud- och videogenereringen sker i samma inferensflöde i realtid, i stället för i sekventiella steg. Den kopplingen håller fördröjningen så låg att samtalet får en naturlig rytm. Google bäddar in SynthID-vattenstämplar omärkligt i både ljud- och videoutdata — varje sekund innehåller en maskinläsbar tagg som identifierar materialet som AI-genererat, även om strömmen spelas in och spelas upp senare. Vattenstämpeln överlever omkodning, så det går fortfarande att verifiera materialets ursprung i exporterade klipp.

Equal AI, som sköter företagsimplementeringar i Indien, visar tydligast vad lösningen kan åstadkomma i operativ skala: nio indiska språk används samtidigt, med över en miljon samtal i realtid per dag och stöd för sammanlagt 97 språk. En sådan kapacitet vore ekonomiskt opraktisk med mänskliga agenter om de skulle ha motsvarande tillgänglighet och schemaläggningstäckning. Grundantagandet bakom driftsättningen är inte att bevisa konceptet — det handlar om kapacitet.

Det Google inte avslöjar i samband med lanseringen är priset. Företaget har inte publicerat några kostnader, utan hänvisar frågor till sitt företagsförsäljningsteam. För att skapa anpassade avatarer — där organisationer bygger ett ansikte utifrån egna referensbilder — krävs godkännande för företagsanvändning genom en separat verifieringsprocess; det går inte att göra på egen hand. Extended Thinking-funktionerna för Live-modellen är fortfarande i en sluten förhandsversion, vilket begränsar resonemangsdjupet jämfört med Googles övriga Gemini-erbjudanden. Någon gräns för antalet samtidiga sessioner har inte offentliggjorts. Den begränsade lanseringen följer Googles mönster för stegvisa företagssläpp, där pris och kapacitet förhandlas fram i stället för att publiceras.

Gemini 3.8 Live with Live Avatar finns nu i Gemini Enterprise-konsolen och via Live API, med slutpunkter i USA och EU. Google har inte angett någon tidsplan för när Extended Thinking i Live-modellen blir tillgängligt för fler än den nuvarande, begränsade förhandsgranskningsgruppen.

Företagen som tar lösningen i bruk kommer att besvara en fråga som tekniken inte kan ge svar på: Förbättras användarupplevelsen när den visuella signalen som avslöjar en automatiserad interaktion tas bort, eller försvinner därmed den sista ärliga markören för att en sådan pågår?

Taggar: , , , , ,

Lägg till oss på Google

Diskussion

Det finns 0 kommentarer.