TTS-7788 语音合成

基于 Qwen3-TTS-12Hz & Longcat AudioDit模型的本地语音合成服务

无模型

预设音色

CustomVoice模型支持基础音色+情绪指令
开心 愤怒 温柔 激动 悲伤 严肃 俏皮 冷静 热情 慵懒 神秘 紧张 自信 娇羞 豪迈 沮丧 惊讶 嘲讽 恐惧 深情 得意 困惑
1.0x
1.0x
默认使用低随机采样,适合章节朗读。开启长文本模式后将调用专用的 /tts/book 接口并按句拼接输出。
0.9

声音克隆

点击或拖拽上传音频文件
提供参考音频的文本内容可提升克隆质量
Base模型专门用于参考音频克隆
完美模仿 自然日常 开心 愤怒 温柔 激动 悲伤 严肃 俏皮 冷静 热情 慵懒 神秘 紧张 自信 豪迈 深情 娇羞 沧桑
1.0x
1.0x
克隆模式默认降低随机性,尽量贴近参考音频,不让每句语调飘开。
0.9

声音设计

VoiceDesign模型通过指令设计声音,无需基础音色
磁性男声 甜美女声 成熟稳重 活泼可爱 神秘深邃 温柔治愈 浑厚男声 清澈女声 沧桑沙哑 阳光少年 知性优雅 搞怪俏皮 威严霸气 柔弱纤细 豪迈粗犷 稚嫩童真 冷峻淡漠 妩媚动人 沉稳内敛 欢快跳跃 撒娇萌妹 高冷御姐 清脆正太 温柔少妇
1.0x
1.0x
声音设计也支持稳定模式。关闭后更自由,但跨句一致性会明显下降。
0.9