Gemini 3.5 Transcribe Adds Realtime Streaming and Function Calling
August 26, 2026
Gemini 3.5 Transcribe is a speech-to-text model featuring lower word error rates (WER), multi-speaker identification, and support for 85+ languages. The model adds support for function calling, custom vocabulary, and realtime streaming.
HOW THIS AFFECTS YOU
●
builderYou can build more interactive voice interfaces using realtime streaming and integrated function calling.
●
designerThe improved transcription accuracy and multi-speaker ID enable more seamless conversational UX patterns.