Skip to main content

介绍

文本转语音(TTS)API 基于先进的生成 AI 模型,可以将输入的文本转换为逼真的语音音频。支持多种用途:
  • 为书面博客文章配音
  • 生成多种语言的语音音频
  • 提供实时音频输出流

可用模型列表

OpenAI 模型

  • gpt-4o-audio-preview —— OpenAI 最新的音频生成模型,支持对话式音频生成
  • gpt-4o-mini-tts —— 智能实时应用的首选模型,支持高级语音控制,可以通过提示词控制多种语音特性:
    1. 口音 (Accent)
    2. 情感范围 (Emotional range)
    3. 语调 (Intonation)
    4. 印象/风格 (Impressions)
    5. 语速 (Speed of speech)
    6. 语调 (Tone)
    7. 轻声说话 (Whispering)
  • tts-1-hd —— 高清音质的上一代 TTS 模型
  • tts-1 —— 标准 TTS 模型,平衡质量和速度

Gemini 模型

性能建议:
  1. 为获得最快的响应时间,建议使用 wavpcm 作为响应格式
  2. 对于高质量音频,建议使用 tts-1-hd
  3. 对于更快的生成速度,使用 tts-1
  4. 对于智能语音应用,推荐使用 gpt-4o-mini-tts
  5. 对于需要多说话人对话的场景,推荐使用 Gemini TTS 模型

API 接口

请求地址

请求头

请求参数

标准 TTS 参数

标准参数适用于 tts-1, tts-1-hd, gpt-4o-mini-tts, gemini-2.5-flash-preview-tts 以及 gemini-2.5-pro-preview-tts。

gpt-4o-audio-preview 参数

语音列表

OpenAI 语音

支持以下语音选项:
  • alloy - 中性、平衡
  • ash - 清晰、专业
  • ballad - 温暖、叙事性
  • coral - 友好、平易近人
  • echo - 清晰、明亮
  • fable - 富有表现力、戏剧性
  • onyx - 深沉、权威
  • nova - 活泼、充满活力
  • sage - 成熟、知识渊博
  • shimmer - 柔和、舒缓
  • verse - 清晰、多才多艺
  • marin - 自然、友好
  • cedar - 稳定、可靠

Gemini 语音

支持以下 30 种语音选项:

语音映射

当使用 Gemini 模型时,如果传入 OpenAI 语音名称,系统会自动映射到对应的 Gemini 语音:

使用示例

标准 TTS 模型(OpenAI)

Gemini TTS 模型(单说话人)

Gemini TTS 模型(多说话人 - 通过提示词控制)

Python 示例(OpenAI SDK)

Python 示例(Gemini TTS)

控制语音风格(Gemini 模型)

Gemini TTS 模型支持通过自然语言提示词来控制语音的风格、语调、口音和语速。您可以在 inputinstructions 参数中提供指导。

单说话人风格控制

多说话人风格控制

提示词结构建议

为了获得最佳效果,可以使用以下结构化的提示词格式:

支持的语言

TTS 模型自动检测输入语言。支持以下 24 种语言:

响应格式

音频格式

注意: Gemini 模型原生返回 PCM 格式(24kHz, 单声道, 16-bit),系统会自动转换为 WAV 格式。如需其他格式,建议使用 OpenAI 模型。

响应体

成功时返回音频流(二进制数据),Content-Type 根据 response_format 参数设置。 失败时返回 JSON 错误信息:

计费说明

TTS API 按字符数计费:
  • 输入文本的字符数作为计费单位
  • 不同模型有不同的价格倍率
  • 最大输入长度:4096 字符

限制说明

  • 最大输入长度:4096 个字符
  • Gemini TTS 模型仅支持 wavpcm 输出格式
  • Gemini TTS 模型不支持 speed 参数(可通过提示词控制)
  • 上下文窗口限制:32k tokens(Gemini 模型)

常见问题

Q: 如何选择合适的模型?

  • 需要快速生成 → tts-1gemini-2.5-flash-preview-tts
  • 需要高质量音频 → tts-1-hd
  • 需要智能语音控制 → gpt-4o-mini-tts 或 Gemini TTS 模型
  • 需要多说话人对话 → Gemini TTS 模型

Q: Gemini TTS 和 OpenAI TTS 有什么区别?

  • Gemini TTS: 支持通过自然语言提示词控制语音风格,支持多说话人,但仅支持 WAV/PCM 格式
  • OpenAI TTS: 支持多种音频格式,有固定的语音选项,速度可通过参数控制

Q: 如何实现多说话人对话?

使用 Gemini TTS 模型,在 input 中使用对话格式,并在 instructions 中为每个说话人指定风格:

Q: 支持流式输出吗?

目前 TTS API 返回完整的音频文件,不支持流式输出。

更新时间:2026-06-01