Hoppa till innehåll
VibekollenBETAVibekollen
BloggGoogle DeepMind

Intelligent transcription with Gemini 3.5 Transcribe

Bild från deepmind.google

Google DeepMind presenterar Gemini 3.5 Transcribe, en ny tal-till-text-modell som omvandlar röst direkt till formaterad och korrigerad text.

Modellen klarar bakgrundsbrus, komplext fackspråk och tar bort ifyllnadsord som "ums" och "ahs". Den finns i två versioner: en för direktströmmande tal med under en sekunds fördröjning, och en för inspelat material där den kan identifiera och särskilja upp till tre talare. Utvecklare kan använda den via Gemini API och Google AI Studio för att bygga röstapplikationer, realtidstextning eller samtalanalys. Modellen stöder över 85 språk och kan anpassas till eget fackspråk och stavningar.

Unlike conventional speech recognition models that struggle with background noise, complex jargon, and disfluency cleanup, Gemini 3.5 Transcribe converts raw audio directly into accurate, polished, formatted text.
Ordagrant ur artikeln hos Google DeepMind
Läs hela hos Google DeepMind →

Sammanfattningen är skriven av Vibekollen utifrån källans egen publicering. Innehållet tillhör Google DeepMind.

Mer att läsa