BloggGoogle DeepMind
Intelligent transcription with Gemini 3.5 Transcribe
Google DeepMind presenterar Gemini 3.5 Transcribe, en ny tal-till-text-modell som omvandlar röst direkt till formaterad och korrigerad text. Modellen klarar bakgrundsbrus, komplext fackspråk och tar bort ifyllnadsord som "ums" och "ahs". Den finns i två versioner: en för direktströmmande tal med under en sekunds fördröjning, och en för inspelat material där den kan identifiera och särskilja upp till tre talare. Utvecklare kan använda den via Gemini API och Google AI Studio för att bygga röstapplikationer, realtidstextning eller samtalanalys. Modellen stöder över 85 språk och kan anpassas till eget fackspråk och stavningar.
26 aug. deepmind.google