Teknik

Google lanserar Gemini 3.5 Transcribe för renare röstinspelning i 85 språk

Adrian Kessler

Gemini 3.5 Transcribe fångar inte bara vad någon säger. Den omvandlar det som sades till det som personen menade att säga. När en talare rättar sig själv mitt i en mening – ’Låt oss boka in det på tisdag, nej, onsdag’ – levererar modellen ’onsdag’ och kastar bort rättelsen. Fyllnadsord försvinner. Bakgrundsljud stoppar den inte. Resultatet kommer som polerad, formaterad text, inte rå ljudupptagning.

För den som spelar in intervjuer, poddar eller flerspråkigt innehåll är denna skillnad hela arbetsflödet. Varje transkriberingsverktyg på marknaden hanterar ’vad som sades.’ Den mänskliga redaktör som sedan rensade upp hanterade allt annat. Google bygger nu in den redaktören i själva modellen.

Modellen stöder två separata API-vägar. Live API hanterar kontinuerlig tvåvägsströmning med subsekundslatens – designat för realtidsröstagenter, kundtjänstrobotar och allt som kräver omedelbar transkribering. Interactions API hanterar inspelat ljud: hela möten, samtalsloggar och intervjuer, med talartilldelning för upp till tre deltagare och tidsstämplar. Båda uppnår en ordtelfrekvens på 4,0 % i strömningsläge och 2,6 % i icke-strömningsläge – mätt av det oberoende benchmarkföretaget Artificial Analysis. Googles tidigare tal-till-text-modell, Chirp 3, krävde 70 % mer tid för att nå slutgiltig transkribering.

Konsumentsidan av lanseringen är mer blygsam. På Android använder Gboard Rambler redan Gemini 3.5 Transcribe för röst-till-text-inmatning. Gemini macOS-appen stöder det på engelska via en Speak to Window-funktion. Chrome listas som ’kommer snart’, vilket skulle låta användare diktera i valfritt webbfält – svar, inlägg, formulär – utan att byta app. Inget specifikt datum för den utrullningen har bekräftats.

Modellens begränsningar spelar roll. Talartilldelning är begränsad till tre deltagare; paneldiskussioner och runda bord med större sällskap kräver omvägar. Konsumentappen Rambler är för närvarande tillgänglig i ’utvalda länder och språk’, inte de 85 som modellen stöder. Google har inte meddelat prissättning för API:t, som är i offentlig förhandsvisning via Google AI Studio. Företagsåtkomst kommer via Gemini Enterprise Agent Platform, där prissättning förhandlas separat. För mindre kreatörer förblir kostnadsfrågan öppen.

Den konkurrensmässiga ramen är också relevant. OpenAIs Whisper, fortfarande standard för oberoende utvecklare, uppnår ordtelfrekvenser i intervallet 5–7 % på engelskt ljud och kräver efterbearbetningskod för att hantera borttagning av fyllnadsord och formatering. Tjänster som AssemblyAI och Deepgram erbjuder talardiarisering men inte den inbyggda naturliga språkkorrigering som Gemini 3.5 Transcribe tillämpar som standard. Skillnaden är mätbar, men hur den håller över den svårare delen av 85-språksintervallet – regionala accenter, språk med låga resurser, bullriga miljöer – kommer att kräva oberoende tester för att fastställa.

Funktionen som signalerar mest om Googles långsiktiga riktning är Chrome-integrationen. När röstinmatning väl fungerar i valfritt webbfält är modellen inte längre ett utvecklarverktyg – den är infrastruktur för hur människor skriver. Tidsplanen för den förändringen har inte bekräftats.

Taggar: , , , , ,

Diskussion

Det finns 0 kommentarer.