介绍
文本转语音(TTS)API 基于先进的生成 AI 模型,可以将输入的文本转换为逼真的语音音频。支持多种用途:- 为书面博客文章配音
- 生成多种语言的语音音频
- 提供实时音频输出流
可用模型列表
OpenAI 模型
- gpt-4o-audio-preview —— OpenAI 最新的音频生成模型,支持对话式音频生成
- gpt-4o-mini-tts —— 智能实时应用的首选模型,支持高级语音控制,可以通过提示词控制多种语音特性:
- 口音 (Accent)
- 情感范围 (Emotional range)
- 语调 (Intonation)
- 印象/风格 (Impressions)
- 语速 (Speed of speech)
- 语调 (Tone)
- 轻声说话 (Whispering)
- tts-1-hd —— 高清音质的上一代 TTS 模型
- tts-1 —— 标准 TTS 模型,平衡质量和速度
Gemini 模型
- gemini-2.5-flash-preview-tts —— Gemini 快速 TTS 模型,支持单说话人和多说话人音频生成
- gemini-2.5-pro-preview-tts —— Gemini 专业 TTS 模型,支持单说话人和多说话人音频生成
- 为获得最快的响应时间,建议使用
wav或pcm作为响应格式 - 对于高质量音频,建议使用
tts-1-hd - 对于更快的生成速度,使用
tts-1 - 对于智能语音应用,推荐使用
gpt-4o-mini-tts - 对于需要多说话人对话的场景,推荐使用 Gemini TTS 模型
API 接口
请求地址
请求头
请求参数
标准 TTS 参数
标准参数适用于 tts-1, tts-1-hd, gpt-4o-mini-tts, gemini-2.5-flash-preview-tts 以及 gemini-2.5-pro-preview-tts。gpt-4o-audio-preview 参数
语音列表
OpenAI 语音
支持以下语音选项:- alloy - 中性、平衡
- ash - 清晰、专业
- ballad - 温暖、叙事性
- coral - 友好、平易近人
- echo - 清晰、明亮
- fable - 富有表现力、戏剧性
- onyx - 深沉、权威
- nova - 活泼、充满活力
- sage - 成熟、知识渊博
- shimmer - 柔和、舒缓
- verse - 清晰、多才多艺
- marin - 自然、友好
- cedar - 稳定、可靠
Gemini 语音
支持以下 30 种语音选项:语音映射
当使用 Gemini 模型时,如果传入 OpenAI 语音名称,系统会自动映射到对应的 Gemini 语音:使用示例
标准 TTS 模型(OpenAI)
Gemini TTS 模型(单说话人)
Gemini TTS 模型(多说话人 - 通过提示词控制)
Python 示例(OpenAI SDK)
Python 示例(Gemini TTS)
控制语音风格(Gemini 模型)
Gemini TTS 模型支持通过自然语言提示词来控制语音的风格、语调、口音和语速。您可以在input 或 instructions 参数中提供指导。
单说话人风格控制
多说话人风格控制
提示词结构建议
为了获得最佳效果,可以使用以下结构化的提示词格式:支持的语言
TTS 模型自动检测输入语言。支持以下 24 种语言:响应格式
音频格式
注意: Gemini 模型原生返回 PCM 格式(24kHz, 单声道, 16-bit),系统会自动转换为 WAV 格式。如需其他格式,建议使用 OpenAI 模型。
响应体
成功时返回音频流(二进制数据),Content-Type 根据response_format 参数设置。
失败时返回 JSON 错误信息:
计费说明
TTS API 按字符数计费:- 输入文本的字符数作为计费单位
- 不同模型有不同的价格倍率
- 最大输入长度:4096 字符
限制说明
- 最大输入长度:4096 个字符
- Gemini TTS 模型仅支持
wav和pcm输出格式 - Gemini TTS 模型不支持
speed参数(可通过提示词控制) - 上下文窗口限制:32k tokens(Gemini 模型)
常见问题
Q: 如何选择合适的模型?
- 需要快速生成 →
tts-1或gemini-2.5-flash-preview-tts - 需要高质量音频 →
tts-1-hd - 需要智能语音控制 →
gpt-4o-mini-tts或 Gemini TTS 模型 - 需要多说话人对话 → Gemini TTS 模型
Q: Gemini TTS 和 OpenAI TTS 有什么区别?
- Gemini TTS: 支持通过自然语言提示词控制语音风格,支持多说话人,但仅支持 WAV/PCM 格式
- OpenAI TTS: 支持多种音频格式,有固定的语音选项,速度可通过参数控制
Q: 如何实现多说话人对话?
使用 Gemini TTS 模型,在input 中使用对话格式,并在 instructions 中为每个说话人指定风格: