Gemini 3.5 Transcribe Live
Потоковая модель Google для преобразования речи в текст во время разговора через Live API и WebSocket.
Gemini 3.5 Transcribe Live — потоковая модель Google для распознавания речи с низкой задержкой. Она стала доступна 26 августа 2026 года и передаёт промежуточную и итоговую расшифровку по мере поступления аудио через Live API и WebSocket.
Потоковая расшифровка
В отличие от голосового помощника, который слушает, рассуждает и отвечает голосом, Transcribe Live превращает непрерывный аудиопоток в текст. В документации указаны автоматическое определение языка более чем в 85 языках, интеллектуальное форматирование, подсказки пользовательского словаря и несколько режимов определения пауз.
Пределы и функции
Одна потоковая сессия может длиться до десяти минут. Модель не поддерживает разметку времени на уровне слов и разделение текста по говорящим. Для этих задач и расшифровки файла длительностью до часа используйте Gemini 3.5 Transcribe.
Применение
Модель подходит для стенограмм встреч и потоковой обработки речи в приложении. Встраивание требует управления соединением и обработки промежуточных событий; для чувствительных переговоров также проверьте правила согласия, хранения аудио и передачи данных.
Разработчик и первичный источник
Страница разработчика: Google DeepMind в Вики Futuretools.ru.
Официальный источник: материал разработчика.