EarlyTerms

Gemini 3.1 Flash TTS

上升 · 出现于 · 118 天前 · 最近核对
关键词难度(KD)
阶段
上升
数据更新于 2026-08-01 来源 · 7

Gemini 3.1 Flash TTS 是 Google DeepMind 的文本转语音大模型,支持 70+ 种语言,可以用 200+ 条音频标签加上自由格式的导演式提示词来控制口音、语速、情绪和场景风格,输出内容带 SynthID 水印。

2026 年 4 月 15 日,Google 在 Gemini API、AI Studio、Vertex AI 和 Google Vids 上同步开放了 preview。在 Artificial Analysis TTS 排行榜上拿到 1,211 分 Elo,定价文字输入 $1/M tokens、音频输出 $20/M tokens,落在 Artificial Analysis 评出的「质价比最优」区间,比 ElevenLabs Flash/Turbo 档便宜不少。

💡

Simon Willison 写了一篇实测文章,用角色背景来控制口音:提示词写「Jaz is from Brixton, London」,输出的就是伦敦腔;改成「Newcastle」,音色立刻变成纽卡斯尔腔,不需要动任何参数。模型原生支持多人对话,一条提示词就能生成两个声线的对话场景。

可以把它当成一个听导演词的配音演员:你描述场景、角色背景和口音,它就照着演。

中文视角 · 出海机会

定价 $20/M 音频 tokens,比 ElevenLabs Flash 档便宜,对做多语言出海工具(语言学习、有声书、播客)的中文开发者来说成本差是实质性的。4 月 15 日才上线,做内容或测试场景还在早窗口。

EarlyTerms Pro

提前 7 天看到萌芽期新词,解锁全部阶段筛选,并每周收到抢先提醒。

为什么现在开始走红?

TL;DR

2026 年 4 月 15 日,Google DeepMind 上线了 Gemini 3.1 Flash TTS preview,支持 70+ 种语言和 200+ 条音频标签,原生支持多人对话,在 Artificial Analysis 排行榜上拿到 1,211 分 Elo。音频输出定价 $20/M tokens,比 ElevenLabs Flash 档便宜,同步登陆 Vertex AI 和 Google Vids。

6 个因素在推动它走红,右滑 →

搜索热度

峰值 0
更新于 2026-08-01
0 0 0
2026-07-03 2026-07-18 2026-08-01
词的生命周期
  1. 萌芽
    0–7 天
  2. 初现
    8–30 天
  3. 验证中
    31–90 天
  4. 上升 ← 当前
    91–180 天
  5. 成熟
    180 天以上

前景

未来 6 个月的热度走势与商业化节奏。

信号 中等
营收

Google 的定价比 ElevenLabs Flash 档便宜,通过 Vertex AI 和 Google Vids 分发能快速嵌进企业工作流。

风险 · Preview 标签加 16k token 输出上限限制了长内容场景;OpenAI 下一个语音模型一出,基准可能几周内就被刷新。

类比 · ElevenLabs Flash · OpenAI gpt-4o-audio-preview · Gemini 2.5 Flash

变现时间线
  1. 现在
    API 已上线,含免费额度

    开发者通过 Gemini API 计费(文字输入 $1、音频输出 $20,单位均为每百万 tokens);Vertex AI 企业 SKU 同步上线。

  2. 3-6 个月
    语音应用涌入期

    按 $20/M 音频定价,一波照着 ElevenLabs 路子的独立语音应用很快会来。

  3. 6-12 个月
    正式版 + 商业化音色克隆

    Preview 结束后大概率正式发布;支持 SynthID 水印识别的音色克隆工具和播客对话生成器也会跟着起来。

“Gemini 3.1 Flash TTS” 的竞争与机会

判断依据包括已追踪的搜索词、变现方向和相关词。除标注“实测”的 Google KD 外,其余均为参考估算。

内容缺口
10 条搜索词已追踪
主要是 通用 (5), 费用拆解 (2)
10 条长尾词仅见于 Suggest,存在内容机会
变现潜力
20% 的搜索词带有购买意图
2 条变现方向
信息需求与购买意图并存
实现难度
(参考估算)
阶段: 上升 — 入场稍晚,先确认是否还有机会
0 / 13 个常见域名后缀已被注册
2 个相关词已发布
参考信号:已追踪的搜索词、变现方向和相关词

“Gemini 3.1 Flash TTS” 能做的点子

这个词可以延伸成文章、网站、产品、帖子、邮件、视频或课程。选一个方向,就能开始行动。

文章
Gemini 3.1 Flash TTS vs ElevenLabs Flash v2.5:价格、质量和可控性全比

2026 年 4 月选 TTS 的开发者都绕不开这个对比。Google 的 $20/M 音频定价、ElevenLabs 的 $0.06-0.30/1k 字符、Elo 分差,数据都是公开的,但没有一篇文章把它们放在一起说清楚。

文章
怎么写 Gemini 3.1 Flash TTS 的提示词:200+ 音频标签速查表

音频标签是这个模型最核心的差异点,但 Google 文档把它们分散在好几个页面。整理一份附带样例输出的速查表,实用又好传播。

文章
用 Gemini 3.1 Flash TTS 生成多人播客:一套完整流程

原生多人对话支持是 AI 播客创作者最需要的功能,但从脚本到对话再到 RSS 导出,目前还没有一篇端到端的教程。

文章
SynthID 水印对 2026 年 AI 语音内容意味着什么

Gemini 3.1 Flash TTS 的每条输出都带 SynthID 水印,创作者、平台和内容审核团队都需要搞清楚检测机制的工作原理和局限。

产品
可按角色切换口音的有声书创作工具

Willison 的「Brixton vs Newcastle」演示指向一个实打实的需求:让独立有声书作者通过导演式提示词为每个角色指定地区口音的工具。

产品
多语言在线课程配音生成器

70+ 种语言加上 $20/M 音频定价,课程创作者可以用极低成本生成每一门语言的版本。这个市场目前付给 ElevenLabs 的是每月 $99+ 的套餐。

产品
支持 SynthID 检测的内容审核 SDK

托管用户生成音频的平台需要大规模检测 SynthID 水印语音。开源 SDK 加托管 API,顺着合规监管的趋势走。

视频
「Gemini 3.1 Flash TTS vs ElevenLabs vs OpenAI:我用三个模型读了同一段有声书」— 15 分钟 YouTube 演示

并排对比配合音频样本、情绪控制演示和成本拆解,正是那些搜「2026 年最好的 AI 语音」的人在找的内容。

帖子 Newsletter / LinkedIn
Google 给 ElevenLabs 上了一课:语音该值多少钱

每百万音频输出 tokens $20。录一集 10 分钟播客,不到两美分。ElevenLabs 最便宜的套餐要贵 30 倍。

帖子 HN / r/MachineLearning
我想把 Gemini 3.1 Flash TTS 的口音控制测崩,结果反被打脸

提示词「Jaz is from Brixton, London」,出来的真是伦敦布里克斯顿腔。改成「Newcastle」,真的变成纽卡斯尔腔。没改任何参数。

帖子 YouTube / Tech media
ElevenLabs 要落幕了?

三年来,ElevenLabs 一直是 AI 语音的代名词。某个星期二下午,Google 上线了一个比它便宜、比它可控、而且内置进整个 Google Workspace 的对手。

大家在搜什么

来自 Google Suggest 和 Trends 的长尾词。热度和竞争度是估算,仅供参考,未经核实。内容类型由搜索词的写法推断。

关键词
竞争度
内容类型
gemini 3.1 flash tts
通用
gemini 3.1 flash tts preview
通用
gemini 3.1 flash tts voices
通用
gemini 3.1 flash tts pricing
费用拆解
gemini 3.1 flash tts api
参考
gemini 3.1 flash tts api pricing
费用拆解
gemini 3.1 flash tts download
教程
gemini 3.1 flash tts documentation
参考
1–8 共 10
1 / 2
更新于 2026-08-01 · 来源:Google Trends、Google Suggest · 竞争度为参考估算

“Gemini 3.1 Flash TTS” 的搜索结果

这里展示当前的自然搜索结果,以及正在投放的广告。广告数量可以反映当下的商业需求。

常见问题

什么是 Gemini 3.1 Flash TTS?

Gemini 3.1 Flash TTS 是 Google DeepMind 的文本转语音大模型,支持 70+ 种语言,可以用 200+ 条音频标签加上自由格式的导演式提示词来控制口音、语速、情绪和场景风格,输出内容带 SynthID 水印。

Gemini 3.1 Flash TTS 为什么现在火?

2026 年 4 月 15 日,Google DeepMind 上线了 Gemini 3.1 Flash TTS preview,支持 70+ 种语言和 200+ 条音频标签,原生支持多人对话,在 Artificial Analysis 排行榜上拿到 1,211 分 Elo。音频输出定价 $20/M tokens,比 ElevenLabs Flash 档便宜,同步登陆 Vertex AI 和 Google Vids。

Gemini 3.1 Flash TTS 是什么时候出现的?

约于 2026-04-15 公开出现(截至 2026-08-11 约 118 天前)。EarlyTerms 最早于 2026-04-16 记录到信号。

相关词

同一领域里的其他词:别名、子类、竞品,以及值得继续了解的相近概念。

继续探索
被引用于
还提到
  • 属于 Gemini API
  • 竞品 ElevenLabs Flash·gpt-4o-audio-preview
  • 相关 Gemini 3.1 Flash Lite·Gemini 3.1 Flash Image·SynthID·audio tags·voice cloning

来源

这份报告引用的一手链接,点开任意一条都能自己核对。

  1. 01 Google 官方博客 — Gemini 3.1 Flash TTS 发布公告 blog.google
  2. 02 Gemini API 文档 — 3.1 Flash TTS preview ai.google.dev
  3. 03 Google Cloud — Vertex AI 上线公告 cloud.google.com
  4. 04 Simon Willison — 导演式提示词实测 simonwillison.net
  5. 05 DeepMind 模型卡片 — Gemini 3.1 Flash Audio deepmind.google
  6. 06 Artificial Analysis — TTS 排行榜测评 artificialanalysis.ai
  7. 07 MarkTechPost 报道 marktechpost.com
机会雷达
还有更多搜索量正在飙升的新词
查看 →