ProjectsNewsTranslation pending
报道称谷歌开放 Gemini 3.8 Flash TTS 与 Flash-Lite TTS
BIBIBI AT A GLANCE谷歌发布两款支持声音复刻与细致语音控制的文本转语音模型。
Article
谷歌Gemini 3.8 TTS:30秒样本就能复刻声音
动察 Beating AI 快讯,谷歌发布 Gemini 3.8 Flash TTS 和 Flash-Lite TTS,两款文本转语音模型已在 Gemini API 和 Google AI Studio 开放。Flash 主打音质、角色表演和长文本稳定性,Lite 偏向高吞吐、低延迟和低成本。
两款模型都能直接用文字设计新声线,也能用约 30 秒参考音频复刻本人或已获授权的声音。用户可以逐句控制情绪、节奏和口音,还能插入笑声、叹气、咳嗽等声音。双人对话也可以直接用一份剧本生成。Flash 支持 130 种语言,Lite 支持 101 种。
价格也比上一代低。到 2026 年 12 月 31 日,Flash 音频输出每百万 tokens 为 9 美元,Lite 为 6 美元;上一代 Gemini 3.1 Flash TTS Preview 为 20 美元。2027 年 1 月 1 日起,两款标准价会升至 18 美元和 12 美元。
Source: https://m.theblockbeats.info/flash/368721
AI-assisted interpretation
The following is analysis, separate from reported facts. Verify important claims independently.
文本转语音模型能把文字生成语音;这里还支持设计新声线、参考约 30 秒音频复刻声音,并控制情绪、节奏、口音及笑声等声音。
Why it matters to readers
它把声音设计、声音复刻和双人剧本生成整合到文本转语音工具中,并提供了明确的语言支持范围和价格。
新手可以理解为:输入文字和语音要求,就能生成带情绪、口音或声音效果的语音;复刻声音需要约 30 秒参考音频。
Risks and unknowns
- 文中未说明如何验证参考声音是否确实获得授权。
- 文中信息来自快讯,未提供谷歌官方公告作为补充来源。