
Google тихо, но уверенно совершил революцию в области синтеза речи. Компания представила Gemini 3.8 Flash TTS — нейросетевую модель, которая, по заявлению разработчиков, способна генерировать голос на уровне, неотличимом от человеческого. И это не просто очередное обновление — это качественный скачок, который меняет правила игры для разработчиков, создателей контента и всех, кто работает со звуком.
Главная особенность новинки — генерация голоса по текстовому описанию. Вы просто пишете, каким должен быть голос: «тёплый женский с лёгкой хрипотцой» или «строгий диктор с британским акцентом», — и модель создаёт его с нуля. Более того, Gemini 3.8 Flash TTS владеет сотней языков и диалектов, а библиотека готовых голосов насчитывает более 2000 вариантов с региональными особенностями. Это значит, что вы сможете подобрать идеальный голос для любого проекта — от рекламного ролика до аудиокниги.
Но самое впечатляющее — клонирование голоса. Достаточно 30-секундной записи, чтобы модель воспроизвела ваш тембр с поразительной точностью. При этом ИИ не просто копирует звук, он умеет отыгрывать роли: пишете сценарий — и модель читает его с выражением, смеётся, вздыхает и даже перебивает собеседника, как это делают живые люди. Голос остаётся стабильным на протяжении часов, что критически важно для длинных подкастов или озвучки видео.
Разработчики уже могут протестировать Gemini 3.8 Flash TTS через API Gemini и в Google AI Studio. В ближайшее время обещают добавить функцию ремиксов голоса — изменение тембра, высоты, темпа и акцента. Это откроет ещё больше возможностей для кастомизации.
Похоже, эпоха роботизированных голосов осталась в прошлом. Gemini 3.8 Flash TTS — это инструмент, который стирает грань между синтезом и живой речью. И он доступен уже сегодня.




