Skip to content

[Feature]增加通用 TTS API 配置,用于万能接入联网与本地TTS推理✨ #9481

Description

@mrweek0

Description / 描述

增加通用 TTS API 配置,用于万能接入联网与本地TTS推理✨

目前开源TTS模型众多,但是请求参数各家都有不同,即使标注了兼容OpenAI/v1/audio/speech接口,实际实现也五花八门。能否在[模型提供商]->[文字转语音]->[新增模型提供商]位置,建立起一个通用的请求体构建功能,让用户自行决定送入json的变量名称,变量值。而不必为了频繁的新增TTS供应商而不断的写适配页面。只需在说明页面使用文本说明即可适配使用,实现低代码(Low-Code)开发。

Use Case / 使用场景

用近期才开源的 Qwen3 TTS系列举例,其标准请求体构建如下:✨

curl -X POST http://127.0.0.1:7861/v1/audio/speech
-H "Content-Type: application/json"
-d '{
"model": "mlx-community/Qwen3-TTS-12Hz-1.7B-Base-8bit",
"input": "你好,请放入你要生成的语音在这里!",
"voice": "default",
"language": "zh",
"ref_audio": "/Volumes/refaudio/qwen3_voice_000.wav",
"ref_text": "你好,这是一个语音合成测试。很高兴见到你!",
"response_format": "wav"
}'
--output cloned_speech.wav

需求是在[新增模型提供商]位置,建立一个[通用TTS API]选项卡,内部包含如下表单并能实现传递请求的逻辑✨

让用户自己填写表单来构建请求体,适配不同模型,使一些新模型要求的额外参数得到有效传递运行。✨

序号 变量名 变量值
01 model Qwen3-TTS-12Hz-1.7B-Base-8bit
02 input $约定的变量传递标记$
03 voice default
04 ref_audio /Volumes/refaudio/qwen3_voice_000.wav
05 ref_text 你好,这是一个语音合成测试。很高兴见到你!

Willing to Submit PR? / 是否愿意提交PR?

  • Yes, I am willing to submit a PR. / 是的,我愿意提交 PR。

Code of Conduct

Metadata

Metadata

Assignees

No one assigned

    Labels

    area:providerThe bug / feature is about AI Provider, Models, LLM Agent, LLM Agent Runner.enhancementNew feature or request

    Type

    No type

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions