GRGlobalRouter Docs
Console

Audio / POST

Create speech

将文本转换为二进制音频流,支持在同一请求中参考音频复刻音色。

Endpoints

Mobile only shows the endpoint list. View parameter details and examples on desktop.

MethodEndpointDescription
POST/api/v1/audio/speech将文本转换为二进制音频流,支持在同一请求中参考音频复刻音色。
POST/api/v1/audio/transcriptions将 Base64 音频转录为文本。
POST/api/v1/audio/speech

调用 Qwen Audio 3.0 TTS Flash 生成音频。传入 input_references 时,GlobalRouter 会先用参考音频create一次性音色,再合成语音;responses直接returns文件流,而不是 JSON 对象。

Back to Audio endpoint list

Request parameters

FieldTypeRequiredDescription
modelstringYes固定为 qwen-audio-3.0-tts-flash。
inputstringYes需要合成语音的文本。
voicestringNo不使用 input_references 时的预置音色;传 input_references 时由参考音频生成一次性音色。
input_referencesarrayNo参考输入数组;传入 input_audio 时启用同请求声音复刻。
input_references[].typestring是(传 input_references 时)固定为 input_audio。
input_references[].input_audio.datastring是(传 input_references 时)参考音频的 Base64 Data URI,格式必须为 data:audio/wav;base64,<BASE64>、data:audio/mpeg;base64,<BASE64> 或 data:audio/mp4;base64,<BASE64>。
response_formatstringNo输出格式:mp3、pcm、wav 或 opus;默认 pcm。
speednumberNo语速,范围 0.5 到 2;默认 1。
provider.provider_idstring传 input_references 时为是指定providers;当前仅支持 ali。
provider.options.ali.sample_rateintegerNo采样率:8000、16000、22050、24000、44100 或 48000。
provider.options.ali.volumeintegerNo音量,范围 0 到 100。
provider.options.ali.pitchnumberNo音调,范围 0.5 到 2。
provider.options.ali.seedintegerNo随机种子,范围 0 到 65535。
provider.options.ali.language_hintsstring[]No单个语言提示,例如 ["zh"]。
provider.options.ali.instructionstringNo声音风格或朗读方式指令。

Response fields

FieldTypeRequiredDescription
Content-TypeheaderYes音频 MIME 类型:audio/mpeg、audio/pcm、audio/wav 或 audio/ogg。
Content-DispositionheaderYes下载文件名,扩展名与 response_format 一致。
X-Generation-IdheaderYesGlobalRouter 生成记录 ID,可用于排查请求。
bodybinaryYes音频二进制文件流。

Errors

400ROUTER_AUDIO_MODEL_UNSUPPORTED

model 不是当前支持的 TTS models。

400ROUTER_AUDIO_PROVIDER_UNSUPPORTED

provider_id 不是 ali。

422validation_error

请求格式不合法,例如不支持的 response_format 或超出 speed 范围。

Notes

  • API需要 API Key 具有 tasks scope,且该 Key 被授权调用对应models。
  • 请根据 response_format 保存responses文件;该API不会returns JSON 中的音频 URL。
  • input_references[].input_audio.data 只能传完整的 Base64 Data URI,不能只传裸 Base64、文件路径或远程 URL。支持 WAV、MP3、M4A(audio/wav、audio/mpeg、audio/mp4),解码后最大 10 MiB。
  • 声音复刻和合成在同一请求完成,不returns可复用的 voice_id。参考音频应为清晰、连续的人声;上游要求至少 5 秒,推荐 10 到 20 秒,最长不超过 60 秒。