模型接口API文档音频模型
音频模型
Doubao TTS 与 Gemini TTS 文本转语音接口
现有音频文档内容集中在文本转语音接口,统一使用 POST /v1/audio/speech。本页内部按厂商分段,避免为每个 TTS 模型单独拆完整教程。
接口路径
| 方法 | 路径 | 用途 |
|---|---|---|
| POST | /v1/audio/speech | 将输入文本合成为语音,成功时通常直接返回音频二进制流。 |
curl -X POST "https://api.routescope.ai/v1/audio/speech" \ -H "Content-Type: application/json" \ -d '{ "model": "gpt-4o-mini", "input": "需要处理的输入文本。", "voice": "string", "format": "json", "speed": 1 }'"string"Authorization
BearerAuth
AuthorizationBearer <token>
模型 relay 接口鉴权。请求头:Authorization: Bearer 。
In: header
Request Body
application/json
model*string
语音合成模型。
input*string
要朗读的文本内容。
voice*string
音色,例如 alloy、nova。 voice 字符串字段。范围:非空字符串或按业务配置校验。
format?string
输出音频格式,例如 mp3、wav。
speed?number
语速。 speed 数值字段。范围:以接口说明或后台配置为准。
Response Body
audio/mpeg
模型选择表
| 厂商 | 模型 ID | 示例音色/说明 | 适用场景 |
|---|---|---|---|
| Doubao | seed-tts-1.0 | 示例 zh_female_cancan_mars_bigtts | 中文语音合成,女声示例。 |
| Doubao | seed-tts-2.0 | 示例 zh_male_m191_uranus_bigtts | 中文语音合成,男声示例。 |
| Gemini | gemini-2.5-flash-preview-tts | 暂未统一提供默认音色 | Gemini TTS 预览模型,Flash 取向以模型名称和页面展示为准。 |
| Gemini | gemini-2.5-pro-preview-tts | 暂未统一提供默认音色 | Gemini TTS 预览模型,Pro 取向以模型名称和页面展示为准。 |
通用参数
| 字段 | 类型 | 必选 | 说明 |
|---|---|---|---|
model | string | 是 | TTS 模型 ID。 |
input | string | 是 | 要合成的文本。 |
voice | string | 是 | 音色 key。Doubao 示例提供默认音色;Gemini 暂未统一提供默认音色,以接口返回或页面实际展示为准。 |
format | string | 否 | 网关 OpenAPI 字段名,表示输出音频格式。Doubao 官方文档里对应字段叫 response_format / audio.encoding,接入 Routescope 时按本页示例使用 format。 |
speed | number | 否 | 语速。 |
模型差异参数
| 字段 | 适用模型 | 默认值/范围 | 差异说明 |
|---|---|---|---|
voice | seed-tts-1.0 | zh_female_cancan_mars_bigtts | 字节音色 key,实际可用音色以账号授权为准。 |
voice | seed-tts-2.0 | zh_male_m191_uranus_bigtts | 字节音色 key,实际可用音色以账号授权为准。 |
voice | Gemini TTS | 暂无统一默认值 | 以接口返回或页面实际展示为准。 |
input | Doubao TTS | 普通音色单次文本建议不超过 1024 字节 | 长文本或复刻音色以渠道配置为准。 |
format | Doubao TTS | 默认 pcm,支持 mp3、wav、pcm、ogg_opus | wav 通常不用于流式场景;接入 Routescope 时请使用 format。 |
speed | Doubao TTS | 默认 1,范围 [0.2, 3] | 对应官方 audio.speed_ratio。 |
volume_ratio、pitch_ratio、emotion、language | Doubao TTS | 具体支持范围以渠道配置和音色能力为准 | 可选高级字段,实际支持以渠道配置和音色能力为准。 |
Doubao 示例
curl https://api.routescope.ai/v1/audio/speech \
-H "Authorization: Bearer $ROUTESCOPE_API_KEY" \
-H "Content-Type: application/json" \
--output speech.mp3 \
-d '{
"model": "seed-tts-2.0",
"input": "你好,这是一段由 Seed TTS 2.0 生成的语音。",
"voice": "zh_male_m191_uranus_bigtts",
"format": "mp3",
"speed": 1
}'Gemini 示例
curl https://api.routescope.ai/v1/audio/speech \
-H "Authorization: Bearer $ROUTESCOPE_API_KEY" \
-H "Content-Type: application/json" \
--output speech.mp3 \
-d '{
"model": "gemini-2.5-flash-preview-tts",
"input": "请生成一段简短的语音。",
"voice": "your-voice-id"
}'Gemini TTS 暂未统一确认默认音色或额外参数,示例中的 your-voice-id 请替换为接口返回或页面实际展示的可用音色。
响应结构
语音生成成功时通常直接返回音频二进制流。示例中使用 --output speech.mp3 或写入文件保存响应内容。
最后更新于