Gemini 2.5 Pro TTS
Gemini 2.5 Pro TTS — предварительная модель Google для синтеза выразительной речи в подкастах, аудиокнигах и структурированных сценариях.
Gemini 2.5 Pro TTS — голосовая модель Google для синтеза речи из текста. В официальном каталоге она выделена как вариант, ориентированный на высокое качество в структурированных сценариях — например, при подготовке подкастов и аудиокниг. Модель выпущена 20 мая 2025 года; отключение API не объявлено, но актуальные рекомендации Google ведут к поколению Gemini 3.8 TTS.
- Синтез для длинных и структурированных текстов
- Качество речи важнее минимальной задержки
- Идентификатор и история версии
- API-релиз от 20 мая 2025 года
- Сравнение с Flash TTS
- Сначала определите требования к озвучке
- Критерии оценки
- Оцените всю запись и отдельные проблемные фразы
- Связанные модели и разработчик
- Каталог Futuretools и страница Google DeepMind
- Первичные источники
- Официальная документация и жизненный цикл
Синтез для длинных и структурированных текстов
Качество речи важнее минимальной задержки
Pro TTS можно рассматривать для материалов, где интонация и стабильность озвучивания важнее самой высокой скорости: диалогов, повествования, обучающих аудиоматериалов и подкастов. В отличие от универсальной модели, этот endpoint предназначен именно для аудиовыхода. Сценарий, где нужно анализировать входящую речь или отвечать в интерактивном разговоре, относится к другим моделям Gemini Audio.
Идентификатор и история версии
API-релиз от 20 мая 2025 года
Идентификатор Gemini API — gemini-2.5-pro-preview-tts; дата выпуска в таблице Google — 20 мая 2025 года. Для этого preview endpoint пока не указана дата отключения. Документация рекомендует для новых задач Gemini 3.8 Flash TTS либо Flash-Lite TTS. Предварительный статус и рекомендации по миграции следует сверять перед подключением, особенно если приложение зависит от сохранения прежних голосовых настроек.
Сравнение с Flash TTS
Сначала определите требования к озвучке
Gemini 2.5 Flash TTS предназначена для более быстрых и экономичных сценариев. Версию Pro выбирают, когда нужно проверить более высокое качество звучания в структурированном материале. Для новых интеграций доступны Gemini 3.8 Flash TTS и Flash-Lite TTS. Обе пары стоит сравнивать на идентичных входных текстах, голосах и языках.
Критерии оценки
Оцените всю запись и отдельные проблемные фразы
При тестировании проверяйте устойчивость тембра, естественные паузы, ударение в именах, числа, профессиональные термины и переходы между ролями. Для длинной озвучки прослушайте начало и конец, а не только демонстрационный фрагмент. Рассчитайте стоимость готовой минуты аудио с учётом повторной генерации и человеческой вычитки: это практичнее, чем сравнивать только номинальную стоимость вызова модели.
Связанные модели и разработчик
Каталог Futuretools и страница Google DeepMind
Gemini 2.5 Flash TTS · Gemini 3 8 Flash Tts · Gemini 3 8 Flash Lite Tts · Google DeepMind в Вики Futuretools
Первичные источники
Официальная документация и жизненный цикл
Даты выпуска и отключения сверены с документацией Google. Статус API со временем меняется; проверьте актуальный каталог перед интеграцией. Карточка Gemini 2.5 Pro TTS · Руководство по генерации речи · Официальные даты выпуска и поддержки