Routescope APIRoutescope API
模型接口API文档音频模型

音频模型

Doubao TTS 与 Gemini TTS 文本转语音接口

现有音频文档内容集中在文本转语音接口,统一使用 POST /v1/audio/speech。本页内部按厂商分段,避免为每个 TTS 模型单独拆完整教程。

接口路径

方法路径用途
POST/v1/audio/speech将输入文本合成为语音,成功时通常直接返回音频二进制流。
POST
/v1/audio/speech
curl -X POST "https://api.routescope.ai/v1/audio/speech" \  -H "Content-Type: application/json" \  -d '{    "model": "gpt-4o-mini",    "input": "需要处理的输入文本。",    "voice": "string",    "format": "json",    "speed": 1  }'
"string"

Authorization

BearerAuth

AuthorizationBearer <token>

模型 relay 接口鉴权。请求头:Authorization: Bearer

In: header

Request Body

application/json

model*string

语音合成模型。

input*string

要朗读的文本内容。

voice*string

音色,例如 alloynova。 voice 字符串字段。范围:非空字符串或按业务配置校验。

format?string

输出音频格式,例如 mp3wav

speed?number

语速。 speed 数值字段。范围:以接口说明或后台配置为准。

Response Body

audio/mpeg

模型选择表

厂商模型 ID示例音色/说明适用场景
Doubaoseed-tts-1.0示例 zh_female_cancan_mars_bigtts中文语音合成,女声示例。
Doubaoseed-tts-2.0示例 zh_male_m191_uranus_bigtts中文语音合成,男声示例。
Geminigemini-2.5-flash-preview-tts暂未统一提供默认音色Gemini TTS 预览模型,Flash 取向以模型名称和页面展示为准。
Geminigemini-2.5-pro-preview-tts暂未统一提供默认音色Gemini TTS 预览模型,Pro 取向以模型名称和页面展示为准。

通用参数

字段类型必选说明
modelstringTTS 模型 ID。
inputstring要合成的文本。
voicestring音色 key。Doubao 示例提供默认音色;Gemini 暂未统一提供默认音色,以接口返回或页面实际展示为准。
formatstring网关 OpenAPI 字段名,表示输出音频格式。Doubao 官方文档里对应字段叫 response_format / audio.encoding,接入 Routescope 时按本页示例使用 format
speednumber语速。

模型差异参数

字段适用模型默认值/范围差异说明
voiceseed-tts-1.0zh_female_cancan_mars_bigtts字节音色 key,实际可用音色以账号授权为准。
voiceseed-tts-2.0zh_male_m191_uranus_bigtts字节音色 key,实际可用音色以账号授权为准。
voiceGemini TTS暂无统一默认值以接口返回或页面实际展示为准。
inputDoubao TTS普通音色单次文本建议不超过 1024 字节长文本或复刻音色以渠道配置为准。
formatDoubao TTS默认 pcm,支持 mp3、wav、pcm、ogg_opuswav 通常不用于流式场景;接入 Routescope 时请使用 format。
speedDoubao TTS默认 1,范围 [0.2, 3]对应官方 audio.speed_ratio。
volume_ratio、pitch_ratio、emotion、languageDoubao TTS具体支持范围以渠道配置和音色能力为准可选高级字段,实际支持以渠道配置和音色能力为准。

Doubao 示例

curl https://api.routescope.ai/v1/audio/speech \
  -H "Authorization: Bearer $ROUTESCOPE_API_KEY" \
  -H "Content-Type: application/json" \
  --output speech.mp3 \
  -d '{
    "model": "seed-tts-2.0",
    "input": "你好,这是一段由 Seed TTS 2.0 生成的语音。",
    "voice": "zh_male_m191_uranus_bigtts",
    "format": "mp3",
    "speed": 1
  }'

Gemini 示例

curl https://api.routescope.ai/v1/audio/speech \
  -H "Authorization: Bearer $ROUTESCOPE_API_KEY" \
  -H "Content-Type: application/json" \
  --output speech.mp3 \
  -d '{
    "model": "gemini-2.5-flash-preview-tts",
    "input": "请生成一段简短的语音。",
    "voice": "your-voice-id"
  }'

Gemini TTS 暂未统一确认默认音色或额外参数,示例中的 your-voice-id 请替换为接口返回或页面实际展示的可用音色。

响应结构

语音生成成功时通常直接返回音频二进制流。示例中使用 --output speech.mp3 或写入文件保存响应内容。

最后更新于