Gemini 3.5 Transcribe

Модель Google для расшифровки аудиофайлов с определением языка, разделением по говорящим и временными метками слов.

Gemini 3.5 Transcribe — модель Google для преобразования аудиофайлов в текст, выпущенная 26 августа 2026 года. Она предназначена для пакетной расшифровки записей, а не для диалога с пользователем или генерации речи.

Что умеет расшифровка

Модель автоматически определяет язык более чем в 85 языках, умеет отмечать отдельных говорящих, расставлять временные метки на уровне слов и применять пользовательский словарь терминов. Режим интеллектуальной расшифровки может убирать слова-паразиты и оформлять результат с учётом смысла фразы. Эти параметры доступны в API и могут влиять на точность.

Ограничения аудиофайлов

Обычный запрос может содержать аудио длительностью до одного часа. Если включить разделение по говорящим или временные метки, ограничение составляет 30 минут. Google отмечает, что временные метки могут снижать точность и несовместимы с пользовательским словарём; диаризация для трёх и более участников обозначена как экспериментальная.

Отличие от потоковой версии

Для транскрибации речи во время разговора предназначена Gemini 3.5 Transcribe Live. Её сессия ограничена десятью минутами; в потоковой версии нет временных меток слов и диаризации. Для обработки готовых записей используется текущая страница.

Разработчик и первичный источник

Страница разработчика: Google DeepMind в Вики Futuretools.ru.

Официальный источник: материал разработчика.