谷歌在9月23日直接放出两招,推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款全新文本转语音模型。这两款AI模型定位明确,分别杀向个性化角色配音和大规模音频生成场景,目前已经面向开发者开放体验。语音合成技术算是正式跨入精细化控制的新阶段。
Flash TTS 主打声音和角色设计,开发者只需用自然语言描述,就能凭空创建定制化声音。它还支持30秒极短音频复刻,连每一行台词的语气和情绪都能实现精确控制。Flash-Lite 则更注重效率,专门用来搞定大批量音频生成的任务。这基本把语音生成的颗粒度拉到了极致。
语音模型刷屏的同时,谷歌DeepMind负责人科拉伊·卡武克奥卢在AI Agenda Live峰会上爆了个大料。新一代旗舰AI模型 Gemini 4 已经在路上了,目前刚进入开发流程的后训练初期阶段。按他的说法,大家不用等到年底就能看到它登场。
谷歌这波节奏踩得相当紧,一边用3.8 Flash TTS把语音生成的体验拉满,另一边直接预告下一代旗舰大模型。从精细化AI语音到下一代通用旗舰,底层模型和应用工具的迭代速度都在加快。留给其他AI厂商追赶的时间,真的不多了。