/api/v1/audio/speech调用 Qwen Audio 3.0 TTS Flash 生成音频。传入 input_references 时,GlobalRouter 会先用参考音频create一次性音色,再合成语音;responses直接returns文件流,而不是 JSON 对象。
Back to Audio endpoint listRequest parameters
FieldTypeRequiredDescription
modelstringYes固定为 qwen-audio-3.0-tts-flash。inputstringYes需要合成语音的文本。voicestringNo不使用 input_references 时的预置音色;传 input_references 时由参考音频生成一次性音色。input_referencesarrayNo参考输入数组;传入 input_audio 时启用同请求声音复刻。input_references[].typestring是(传 input_references 时)固定为 input_audio。input_references[].input_audio.datastring是(传 input_references 时)参考音频的 Base64 Data URI,格式必须为 data:audio/wav;base64,<BASE64>、data:audio/mpeg;base64,<BASE64> 或 data:audio/mp4;base64,<BASE64>。response_formatstringNo输出格式:mp3、pcm、wav 或 opus;默认 pcm。speednumberNo语速,范围 0.5 到 2;默认 1。provider.provider_idstring传 input_references 时为是指定providers;当前仅支持 ali。provider.options.ali.sample_rateintegerNo采样率:8000、16000、22050、24000、44100 或 48000。provider.options.ali.volumeintegerNo音量,范围 0 到 100。provider.options.ali.pitchnumberNo音调,范围 0.5 到 2。provider.options.ali.seedintegerNo随机种子,范围 0 到 65535。provider.options.ali.language_hintsstring[]No单个语言提示,例如 ["zh"]。provider.options.ali.instructionstringNo声音风格或朗读方式指令。Response fields
FieldTypeRequiredDescription
Content-TypeheaderYes音频 MIME 类型:audio/mpeg、audio/pcm、audio/wav 或 audio/ogg。Content-DispositionheaderYes下载文件名,扩展名与 response_format 一致。X-Generation-IdheaderYesGlobalRouter 生成记录 ID,可用于排查请求。bodybinaryYes音频二进制文件流。Errors
400
ROUTER_AUDIO_MODEL_UNSUPPORTEDmodel 不是当前支持的 TTS models。
400
ROUTER_AUDIO_PROVIDER_UNSUPPORTEDprovider_id 不是 ali。
422
validation_error请求格式不合法,例如不支持的 response_format 或超出 speed 范围。
Notes
- API需要 API Key 具有 tasks scope,且该 Key 被授权调用对应models。
- 请根据 response_format 保存responses文件;该API不会returns JSON 中的音频 URL。
- input_references[].input_audio.data 只能传完整的 Base64 Data URI,不能只传裸 Base64、文件路径或远程 URL。支持 WAV、MP3、M4A(audio/wav、audio/mpeg、audio/mp4),解码后最大 10 MiB。
- 声音复刻和合成在同一请求完成,不returns可复用的 voice_id。参考音频应为清晰、连续的人声;上游要求至少 5 秒,推荐 10 到 20 秒,最长不超过 60 秒。