Gemini 3.1 Flash TTS

Gemini 3.1 Flash TTS — предварительная модель Google для управляемого синтеза речи; для новых задач рекомендованы версии Gemini 3.8 TTS.

Gemini 3.1 Flash TTS преобразует текст в речь и позволяет задавать подачу голосового результата с помощью инструкций и выразительных аудиометок. Официальный каталог моделей указывает для API-версии Preview дату выпуска 26 февраля 2026 года; отдельный публичный материал Google о выразительной генерации речи вышел 15 апреля. Сейчас API описывает её как прежний вариант и рекомендует для новых сценариев Gemini 3.8 Flash TTS или Gemini 3.8 Flash-Lite TTS.

Синтез речи из текста

Голос задаётся вместе с содержанием

Модель принимает текст и возвращает аудио. В анонсе Google отдельно отмечены управляемая подача и выразительные метки: они помогают обозначить нужный характер произнесения в совместимых сценариях. Это специализированная генерация речи, а не универсальный аудиомодельный интерфейс для распознавания входящего разговора.

Модельный идентификатор и доступ

Текущая версия Gemini API остаётся Preview

Идентификатор модели — gemini-3.1-flash-tts-preview. Официальная таблица датирует выпуск этой версии 26 февраля; Google опубликовала отдельный материал о её выразительных аудиометках 15 апреля. Страница Gemini API называет её прежней предварительной моделью и предлагает использовать Gemini 3.8 Flash TTS либо Gemini 3.8 Flash-Lite TTS для новых и производственных нагрузок. Даты относятся к разным событиям, а не к двум версиям модели.

Что учитывать при выборе

Быстрое создание аудио не заменяет проверку результата

Для коротких озвучек, голосовых ответов и прототипов важны управляемость произношения, естественность, языки, задержка и ограничения на длину входного текста. Требуемые язык и голос следует проверить на контрольном наборе собственных фраз: качество имён, аббревиатур и специальной лексики может зависеть от языка и формулировок.

Связанные модели Gemini Audio

Синтез речи и голосовой диалог — разные задачи

Gemini 3.1 Flash TTS создаёт речь из текста. Gemini 3.1 Flash Live предназначена для интерактивного голосового диалога, а модели семейства Transcribe переводят входящую речь в текст. Для актуального синтеза Google указывает модели Gemini 3.8 TTS.

Связанные модели и разработчик

Страницы каталога и Вики

Gemini 3 8 Flash Tts · Gemini 3 8 Flash Lite Tts · Gemini 3.1 Flash Live · Google DeepMind в Вики Futuretools

Первичные источники

Документация, карточка модели и анонс

В каталог внесена дата официального выпуска или объявления. Если дата анонса отличается от даты выхода в модельном справочнике, различие указано в тексте. Страница модели Gemini API · Руководство Gemini API по синтезу речи · Анонс Google от 15 апреля 2026 года · Даты выпуска и поддержки моделей Gemini API · Каталог моделей Google DeepMind