Gemini 3.1 Flash TTS
Gemini 3.1 Flash TTS — предварительная модель Google для управляемого синтеза речи; для новых задач рекомендованы версии Gemini 3.8 TTS.
Gemini 3.1 Flash TTS преобразует текст в речь и позволяет задавать подачу голосового результата с помощью инструкций и выразительных аудиометок. Официальный каталог моделей указывает для API-версии Preview дату выпуска 26 февраля 2026 года; отдельный публичный материал Google о выразительной генерации речи вышел 15 апреля. Сейчас API описывает её как прежний вариант и рекомендует для новых сценариев Gemini 3.8 Flash TTS или Gemini 3.8 Flash-Lite TTS.
- Синтез речи из текста
- Голос задаётся вместе с содержанием
- Модельный идентификатор и доступ
- Текущая версия Gemini API остаётся Preview
- Что учитывать при выборе
- Быстрое создание аудио не заменяет проверку результата
- Связанные модели Gemini Audio
- Синтез речи и голосовой диалог — разные задачи
- Связанные модели и разработчик
- Страницы каталога и Вики
- Первичные источники
- Документация, карточка модели и анонс
Синтез речи из текста
Голос задаётся вместе с содержанием
Модель принимает текст и возвращает аудио. В анонсе Google отдельно отмечены управляемая подача и выразительные метки: они помогают обозначить нужный характер произнесения в совместимых сценариях. Это специализированная генерация речи, а не универсальный аудиомодельный интерфейс для распознавания входящего разговора.
Модельный идентификатор и доступ
Текущая версия Gemini API остаётся Preview
Идентификатор модели — gemini-3.1-flash-tts-preview. Официальная таблица датирует выпуск этой версии 26 февраля; Google опубликовала отдельный материал о её выразительных аудиометках 15 апреля. Страница Gemini API называет её прежней предварительной моделью и предлагает использовать Gemini 3.8 Flash TTS либо Gemini 3.8 Flash-Lite TTS для новых и производственных нагрузок. Даты относятся к разным событиям, а не к двум версиям модели.
Что учитывать при выборе
Быстрое создание аудио не заменяет проверку результата
Для коротких озвучек, голосовых ответов и прототипов важны управляемость произношения, естественность, языки, задержка и ограничения на длину входного текста. Требуемые язык и голос следует проверить на контрольном наборе собственных фраз: качество имён, аббревиатур и специальной лексики может зависеть от языка и формулировок.
Связанные модели Gemini Audio
Синтез речи и голосовой диалог — разные задачи
Gemini 3.1 Flash TTS создаёт речь из текста. Gemini 3.1 Flash Live предназначена для интерактивного голосового диалога, а модели семейства Transcribe переводят входящую речь в текст. Для актуального синтеза Google указывает модели Gemini 3.8 TTS.
Связанные модели и разработчик
Страницы каталога и Вики
Gemini 3 8 Flash Tts · Gemini 3 8 Flash Lite Tts · Gemini 3.1 Flash Live · Google DeepMind в Вики Futuretools
Первичные источники
Документация, карточка модели и анонс
В каталог внесена дата официального выпуска или объявления. Если дата анонса отличается от даты выхода в модельном справочнике, различие указано в тексте. Страница модели Gemini API · Руководство Gemini API по синтезу речи · Анонс Google от 15 апреля 2026 года · Даты выпуска и поддержки моделей Gemini API · Каталог моделей Google DeepMind