Gemini 2.5 Pro TTS

Gemini 2.5 Pro TTS — предварительная модель Google для синтеза выразительной речи в подкастах, аудиокнигах и структурированных сценариях.

Gemini 2.5 Pro TTS — голосовая модель Google для синтеза речи из текста. В официальном каталоге она выделена как вариант, ориентированный на высокое качество в структурированных сценариях — например, при подготовке подкастов и аудиокниг. Модель выпущена 20 мая 2025 года; отключение API не объявлено, но актуальные рекомендации Google ведут к поколению Gemini 3.8 TTS.

Синтез для длинных и структурированных текстов

Качество речи важнее минимальной задержки

Pro TTS можно рассматривать для материалов, где интонация и стабильность озвучивания важнее самой высокой скорости: диалогов, повествования, обучающих аудиоматериалов и подкастов. В отличие от универсальной модели, этот endpoint предназначен именно для аудиовыхода. Сценарий, где нужно анализировать входящую речь или отвечать в интерактивном разговоре, относится к другим моделям Gemini Audio.

Идентификатор и история версии

API-релиз от 20 мая 2025 года

Идентификатор Gemini API — gemini-2.5-pro-preview-tts; дата выпуска в таблице Google — 20 мая 2025 года. Для этого preview endpoint пока не указана дата отключения. Документация рекомендует для новых задач Gemini 3.8 Flash TTS либо Flash-Lite TTS. Предварительный статус и рекомендации по миграции следует сверять перед подключением, особенно если приложение зависит от сохранения прежних голосовых настроек.

Сравнение с Flash TTS

Сначала определите требования к озвучке

Gemini 2.5 Flash TTS предназначена для более быстрых и экономичных сценариев. Версию Pro выбирают, когда нужно проверить более высокое качество звучания в структурированном материале. Для новых интеграций доступны Gemini 3.8 Flash TTS и Flash-Lite TTS. Обе пары стоит сравнивать на идентичных входных текстах, голосах и языках.

Критерии оценки

Оцените всю запись и отдельные проблемные фразы

При тестировании проверяйте устойчивость тембра, естественные паузы, ударение в именах, числа, профессиональные термины и переходы между ролями. Для длинной озвучки прослушайте начало и конец, а не только демонстрационный фрагмент. Рассчитайте стоимость готовой минуты аудио с учётом повторной генерации и человеческой вычитки: это практичнее, чем сравнивать только номинальную стоимость вызова модели.

Связанные модели и разработчик

Каталог Futuretools и страница Google DeepMind

Gemini 2.5 Flash TTS · Gemini 3 8 Flash Tts · Gemini 3 8 Flash Lite Tts · Google DeepMind в Вики Futuretools

Первичные источники

Официальная документация и жизненный цикл

Даты выпуска и отключения сверены с документацией Google. Статус API со временем меняется; проверьте актуальный каталог перед интеграцией. Карточка Gemini 2.5 Pro TTS · Руководство по генерации речи · Официальные даты выпуска и поддержки